Kedy má AI pamäť dôverovať novému faktu? Corroboration, odmerané
Toto je odmeraná vlastnosť jedného open-source pamäťového enginu (inspeximus), na syntetických scenároch — nie SOTA tvrdenie, nový útok ani nový obranný koncept. Hrozba (memory poisoning) je dobre zdokumentovaný prior art (AgentPoison, MINJA, OWASP ASI06 "Memory & Context Poisoning"). Pridávame konkrétne: bežateľnú sondu a odmeranú krivku pre os, ktorú žiadny verejný pamäťový benchmark nemeria (LoCoMo, LongMemEval, BEAM hodnotia retrieval, nie odolnosť voči poisoningu). Titulok, čestne: keď engine podmieni "trvácnosť" zaslúženou korroboráciou, recall-pumpnutý falošný fakt vyfejduje pod pravdu za ~3 týždne (≈3 decay polčasy, parameter readout) namiesto korumpovania odpovedí celé mesiace — ale len keď útok prestane (kontinuálny útočník drží hocijakú pamäť čerstvú; viď limity).
Hrozba a medzera
Vývojári sa aktívne boja memory poisoningu — "náhodná veta sa stane trvalou črtou". Útok: zapíš falošný fakt, daj ho dosť-krát vyvolať, aby ho systém považoval za dôležitý, a sám sa posilní do dôveryhodnej dlhodobej pamäte. Je to pomenovaná výskumná oblasť (OWASP ASI06 „Memory & Context Poisoning"). No ani jeden z verejných pamäťových benchmarkov — LoCoMo, LongMemEval, BEAM — nemeria, či tomu systém odolá; merajú presnosť retrievalu na čistých dátach. To je medzera, ktorú táto sonda rieši — pre náš vlastný engine.
Mechanizmus (v inspeximus)
inspeximus rozkladá recall-váhu pamäte na hodinách podľa typu: episodic bledne rýchlo (polčas 7 dní), semantic pomaly (180 dní). Pamäť "graduuje" episodic→semantic, keď nazbiera dosť recall hodnoty. Chyba, ktorú sme opravili: graduácia akceptovala sebou-nastaviteľný reťazec source ako "korroboráciu" — takže útočníkom nastavená proveniencia nechala recall-pumpnutý poison graduovať do trvácnej vrstvy. Oprava: graduácia teraz vyžaduje zaslúženú korroboráciu — pozitívny výsledok (nastavený len credit slučkou, nie sebou) alebo ≥2 nezávislé linky. Sebou-zdrojovaný poison už negraduuje; ostáva episodic a vybledne.
Meranie
40 rôznych scenárov (pravda, poison); poison je recall-pumpnutý nad prah graduácie, potom útok prestane; pravda je normálna, čerstvo používaná pamäť. Starneme poison a pýtame sa spornú otázku. Korupcia = poison preváži pravdu. Dva výsledky, identické okrem vrstvy poisonu. Spustené v oboch režimoch (semantic aj lexical) — identické výsledky.
| dní po zastavení útoku | STARÝ guard (poison graduoval) | NOVÝ guard (ostáva episodic) |
|---|---|---|
| 0–7 | 100% korupcia | 100% korupcia |
| 14 | 100% | 52% |
| 21 | 100% | 0% |
| 30–90 | 100% (nikdy nevybledne) | 0% |
Medián vyblednutia pre nový guard: 21 dní (deň-14 52%, 95% CI 37–67%; deň-21 0%, CI 0–9%, n=40); starý guard korumpuje v 100% scenárov počas 90 dní (a ďaleko za, pri polčase 180 dní). Identické v semantic aj lexical režime — čo hovorí, že ide o mechanizmus trvácnosti, nie o artefakt retrievalu.
Čítaj tých 21 dní čestne: je to parameter readout, nie objavená konštanta. Čas vyblednutia je d* = τ½ · log₂(V_pump / V_truth) — pri 7-dňovom episodic polčase a poisone pumpnutom na 8 nad čerstvou pravdou (~1) to je 7·log₂(8) = 21 dní, teda ~3 episodic polčasy; iný decay clock to škáluje. A OLD-vs-NEW rozdiel je aritmetika, keď fixneš, do ktorej decay vrstvy poison padne (180-dní vs 7-dní): sonda to sama predpovedala „~2–3 týždne" ešte pred behom. Takže to potvrdzuje, že dva už-etablované mechanizmy sa skladajú podľa očakávania — graduačný gate a 2-vrstvový decay — je to sanity check, nie samostatná empirická vlastnosť.
Útočník teraz musí makať ďalej (odmerané) — a čestný limit
Odmerali sme aj vytrvalého útočníka, ktorý poison re-pumpuje každých P dní (medzi pumpami bledne), na menšej sade (n=15, nie 40 ako fade krivka vyššie). Podiel 90-dňového okna, počas ktorého poison preváži pravdu (je to spaced-repetition aritmetika — interval re-pumpu ÷ polčas to určuje):
| útočník re-pumpuje | STARÝ guard | NOVÝ guard |
|---|---|---|
| raz, potom prestane | 100% (korumpuje mesiace) | prechodné (~39%, CI 20–64%; →0 do dňa 21) |
| každých 30 dní | 100% | 72% (CI 48–89%) |
| každých 14 dní | 100% | 99% |
| každých 7 dní / kontinuálne | 100% | 100% |
Čestný limit, oboma smermiGuard nezastaví aktívneho, kontinuálneho útočníka — re-pumpuj zhruba týždenne a poison ostane navrchu pri oboch vrstvách (to je samostatný, ťažší problém). Čo mení, odmerané: odopiera nezaslúženú trvácnosť, takže jeden útok, ktorý kedysi otrávil pamäť na mesiace, sa stane prechodným (vybledne za ~3 týždne), a vytrvalý útočník je nútený re-pumpovať každých ~1–2 týždne namiesto otrávenia raz a odchodu. To je celé — a jediné — tvrdenie. Decay je strop blast-radiusu hit-and-run útoku, nie obrana proti živému útočníkovi: otrávený záznam stále páli na ďalšom zhodnom dopyte a týždenný re-pumper ostane navrchu. Páka na živého útočníka nie je decay, ale read-time influence-gating (inspeximus vlastnérecall(..., influence_only=True)— gate to, čo poháňa akciu, nie to, čo je uložené) plus source-keyedmonitor/slashstack.
Prečo je porovnanie férové a čo ním nie je
- Férové interné A/B — rovnakých 40 scenárov, rovnaká recall cesta; jediný rozdiel je, či poison mohol graduovať do pomaly-rozkladnej vrstvy. Nie strawman, nie cross-product porovnanie.
- Syntetické, jeden engine — charakterizuje to mechanizmus v inspeximus; nie je to benchmark iných produktov ani štúdia reálneho incidentu.
- Izoluje trvácnosť, nie kvalitu retrievalu — preto semantic a lexical sedia.
- Korroboračná / write-decision logika existuje aj inde (napr. write decisions v Mem0); tvrdíme odmeranú vlastnosť nášho guardu, nie novú obranu.
Čo je bežateľné
Sonda aj oprava sú otvorené; čísla vyššie sa regenerujú jedným príkazom, cloud-free (lokálne embeddingy) — skripty + výsledky sú na research/probes/poison_durability. Ak ti táto os záleží, spusti to na svojej pamäťovej vrstve — o to ide.
FAQ
Čo je otrava pamäte AI? Zapísanie falošného faktu, jeho dostatočné vyvolávanie, aby ho systém považoval za dôležitý, takže sa sám posilní do dôveryhodnej dlhodobej pamäte — „zatúlaná veta sa stane trvalou vlastnosťou.“ Je to pomenovaná oblasť výskumu, no väčšina pamäťových systémov nemá odmeranú obranu.
Dá sa zabrániť, aby sa otrávený fakt stal trvalým? Áno, merateľne. S corroboration guardom nepodložený fakt zostane epizodický a vyprchá: 52% poškodených na 14. deň a 0% do 21. dňa. Stará brána „povýš pri vyvolaní“ zostane 100% poškodená navždy.
Čo sa počíta ako corroboration? Pozitívny výsledok nastavený len credit loopom (nie samozvolne pisateľom) alebo ≥2 nezávislé prepojenia. Fakt, ktorý si jediný zdroj len sám o sebe tvrdí, nikdy nepovýši do trvalej pamäte.
Prečo nestačí frekvencia vyvolania na dôveru faktu? Pretože útočník ovláda frekvenciu vyvolania — opakovanie lži ju spraví „dôležitou“ pri akomkoľvek pravidle založenom na vyvolávaní. Corroboration viaže trvácnosť na výsledky alebo nezávislé dôkazy, ktoré útočník nevie sfalšovať.