Corroboration v pamäti agentov: čo blokuje a čo len spoplatní
Corroboration gate spraví pamäť AI agenta trvalou len pri ≥2 nezávislých zdrojoch. Na reálnom shipnutom inspeximus to zablokuje single-source otravu — zakorenenie by default, prepis po zapnutí guardu — na 0% z konštrukcie, ale sybil, čo sfalšuje ≥2 zdroje, ho obíde (100%); atestácia s overeným kľúčom sybila spoplatní (Douceur 2002), no pri prahu 2 ho nezatvorí. Spustiteľné Crucible potvrdenie.
Zablokuje single-source útočníka — a platí to z konštrukcie, nie je to šťastné meranie. Otrava pamäte (memory injection) LLM agentov — podstrčenie vyrobenej „spomienky", ktorá neskôr riadi správanie agenta — uspeje 70–95% prípadov proti naivným úložiskám, čo radia podľa dôležitosti či recency. Corroboration gate — spomienka sa stane trvalou, alebo smie prepísať stojaci fakt, len keď ju kryjú ≥2 nezávislé zdroje (alebo zaslúžený výsledok) — zráža single-source poison na 0% pri oboch cieľoch (zakorenenie by default, prepis po zapnutí guardu), na reálnom shipnutom inspeximus. Ale počítanie corroboration je falšovateľné: sybil, čo vyrobí ≥2 nezávisle vyzerajúce zdroje, prejde (100%). Takže poctivý nadpis je úzky — gate poison spoplatní, nezastaví.
Čo je otrava pamäte — a prečo naivné úložiská zlyhávajú
Pamäťový agent ukladá fakty a skúsenosti a neskôr si ich vybavuje. Otrava pamäte vloží škodlivý záznam, ktorý po uložení a vybavení presmeruje agenta. Na naivných úložiskách, čo radia záznamy podľa dôležitosti/recency, sa vysoko-hodnotný vložený záznam zakorení a znova vybaví — a najnovšie práce hlásia, že to funguje desivo dobre:
- MINJA — Memory Injection Attacks on LLM Agents via Query-Only Interaction (Dong et al., NeurIPS 2025): 98,2% injection, 76,8% attack success, len cez bežné dopyty — agent si útočníkove premosťujúce záznamy zapíše sám (arXiv 2503.03704).
- Agent Security Bench (ASB): najvyššia priemerná úspešnosť útoku 84,30% cez 13 modelových backbonov, súčasné obrany „obmedzené" (arXiv 2410.02644, ICLR 2025).
Rozsah, na rovinu: MINJA ani ASB sme neimplementovali — tie miery citujeme ako kontext hrozby, nemerali sme ich. Testovali sme corroboration gate v inspeximus proti dvom cieľom, ktoré poison sleduje: zakoreniť trvalú lož a prepísať pravdivý stojaci fakt.
Corroboration gate — a prečo je výhra „z konštrukcie"
inspeximus je naše otvorené pamäťové jadro. Jeho obrana nie je trik v radení — je to corroboration: spomienka sa povýši do trvalej/dôveryhodnej vrstvy len so zaslúženým výsledkom (credit, ktorý appka udelí za vyriešenú prácu, nie je samopodpísateľný) alebo s ≥2 corroboration linkami z odlišných zdrojov, nie preto, že je „dôležitá". Keďže trvalosť vyžaduje ≥2 zdroje, osamelý samopodpísaný poison je zablokovaný z definície — tých 0% je vlastnosť pravidla, nie prekvapivý empirický výsledok. Presne tým smerom sa uberá literatúra obrán: A-MemGuard stavia bránu na konsenze naprieč spomienkami a zráža úspešnosť útoku o >95% (arXiv 2510.02373). Testovali sme dva ciele end-to-end na recall, ktorý by agent reálne použil, proti reálnemu shipnutému inspeximus:
- Entrench (zakorenenie) — vlož poison, ktorý sa stane trvalým + dôveryhodným (episodic → semantic).
- Overwrite (prepis) — vlož poison, ktorý prepíše pravdivý stojaci fakt (state-toggle supersession).
Tabuľka (reálne shipnuté inspeximus, deterministické)
| cieľ útoku | naivné (bez guardu) | inspeximus (default) | inspeximus (hardened) | sybil: sfalšuje ≥2 |
|---|---|---|---|---|
| Entrench trvalý poison | 100% | 0% | 0% | 100% |
| Overwrite pravdivý fakt | 100% | 100% | 0% | 100% |
- Stĺpec naivné je správanie bez guardu — povýš/prepíš len podľa hodnoty — čo úložiská na dôležitosti/recency majú z konštrukcie.
- inspeximus corroboration gate zráža single-source poison na 0% — zakorenenie by default; prepis po zapnutí guardu (
supersede_requires_corroboration). - Sybil, čo sfalšuje ≥2 reálne záznamy z odlišných zdrojov, bránu prejde (100%) — to isté ≥2-zdrojové pravidlo čítané naopak.
- Výsledok je deterministický: 150 behov na bunku je každý identický, lebo gate nemá stochastickú zložku. Hodnota je spustiteľné potvrdenie na shipnutom store (probe), nie odhad rozptylu.
Poison spoplatní, nezastaví ho
Sybil hranica. Útočník, čo sfalšuje ≥2 nezávisle vyzerajúce corroboration, bránu obíde (100%). To je učebnicový sybil výsledok: Douceur 2002 dokázal, že bez centrálnej identitnej autority môže entita predložiť mnoho identít (ohraničené jej pomerom zdrojov), a Cheng & Friedman 2005 dokázali, že žiadne netriviálne symetrické reputačné pravidlo nie je sybil-proof (Douceur; Cheng & Friedman). Počítanie corroboration je presne také pravidlo — je to hranica B ≥ d zo Zákona o oddelení adaptácie a poškodenia v inom šate.
Atestácia spoplatní, nezatvorí. Zapni strict corroboration a každý svedok musí niesť overený Ed25519 kľúč (attested_key): výroba nezávislosti teraz stojí reálny kľúč na svedka — Douceurova cena. Ale dva atestované záznamy stále prejdú 2-svedkovou bránou, takže hranica je spoplatnená, nie zavretá pri prahu 2 — tá istá limita ako pri výsledku Veracity-Gap: proveniencia overí zdroj, nie nezávislosť, ktorú brána predpokladá.
Limita cez typ vstupu. Poison formulovaný ako procedúra („always do X") sa klasifikuje ako procedural — trvalý už z princípu — a obíde episodic graduation gate (~100%). Vyžaduj corroboration aj pre procedural/durable zápisy, nielen pre fakty.
Skutočný frontier: nezávislosť, nie počítanie
Každá oblasť, čo skúsila corroboration-počítanie, ho nakoniec opustila a prešla na detekciu, že „nezávislé" zdroje sú v skutočnosti jeden aktér — graph cut v SybilLimit, behaviorálna analýza odosielateľa v DMARC, štylometrický checkuser na Wikipédii. Brána audituje kardinalitu; útok žije v nezávislosti. Atestácia viaže kontajner, nie správanie (Dissociative Identity, FAccT 2026). A aj dokonalá detekcia nezávislosti má dno: naozaj odlišné kolúzne identity sú skutočne nezávislé grafom aj štylometriou — čo tlačí skutočnú obranu k zodpovednosti za výsledok: zaslúžený credit na aktéra, nie k počítaniu zdrojov.
Ak staviaš pamäť agentov, RAG alebo pamäťovú vrstvu
- Neraď trvalosť podľa dôležitosti či recency — práve to otrava pamäte zneužíva. Bránu trvalosti postav na corroboration alebo zaslúženom výsledku.
- Zapni overwrite guard pre adversariálny vstup (v inspeximus:
supersede_requires_corroboration; gate zakorenenia je default). - Bráň aj procedural/durable zápisy, nielen fakty — formulácia je súčasť útočnej plochy.
- Ber corroboration-count ako falšovateľný — pre nedôveryhodný multi-tenant vstup potrebuješ signál nezávislosti zdroja (a za ním zodpovednosť na aktéra) proti sybilom a kolúzii, nie len počet.
Je to ten istý princíp, čo shipujeme naprieč inspeximus — pozri corroboration guard, ktorý nedovolí, aby sa nepodložený fakt stal trvalým, dvojvrstvové úložisko, ktoré odoláva poison-záplave pri evictione, a Veracity-Gap o tom, prečo proveniencia nekúpi pravdu.
FAQ
Zastaví corroboration-gating každú otravu pamäte? Nie. Zablokuje single-source útočníka (0%), no hrozbu skôr spoplatní než zastaví: sybil, čo sfalšuje ≥2 nezávisle vyzerajúce corroboration, stále prejde (100%).
Je inspeximus chránené by default? Obrana zakorenenia (graduation gate) je default. Obrana prepisu (supersede_requires_corroboration) je opt-in — zapni ju pre adversariálne nasadenie.
Replikovali ste MINJA a Agent Security Bench? Nie. MINJA (98,2%/76,8%) a ASB (najvyššia priemerná ASR 84,30%) citujeme z tých prác ako kontext hrozby. Ich útoky sme neimplementovali; testovali sme corroboration gate v inspeximus proti cieľom zakorenenia a prepisu.
Je tých 0% meranie, alebo je to z konštrukcie? Z konštrukcie. Brána na ≥2 zdroje blokuje jeden zdroj z definície, takže výsledok je deterministický; 150 behov na bunku je každý identický. Hodnota je spustiteľné potvrdenie na reálnom shipnutom inspeximus, nie stochastické meranie.
FalzifikátorTých 0% je definičných, takže skutočný test je hranica: keby bol sybil s ≥2 naozaj odlišnými zdrojmi tiež zablokovaný, brána by robila viac než počítala — a nerobí. Keby strict atestácia dieru pri prahu 2 zavrela (zablokovala dvoch platne atestovaných svedkov), tvrdenie „spoplatní, nezatvorí" by bolo nesprávne. Ani jedno sa nestalo: brána počíta a dva atestované kľúče stále prejdú.