Crucible

Corroboration v pamäti agentov: čo blokuje a čo len spoplatní

June 27, 2026Updated July 5, 20264 min readpamäť agentov · otrava pamäte · bezpečnosť LLM · sybil · corroboration · inspeximus
Zhrnutie

Corroboration gate spraví pamäť AI agenta trvalou len pri ≥2 nezávislých zdrojoch. Na reálnom shipnutom inspeximus to zablokuje single-source otravu — zakorenenie by default, prepis po zapnutí guardu — na 0% z konštrukcie, ale sybil, čo sfalšuje ≥2 zdroje, ho obíde (100%); atestácia s overeným kľúčom sybila spoplatní (Douceur 2002), no pri prahu 2 ho nezatvorí. Spustiteľné Crucible potvrdenie.

Zablokuje single-source útočníka — a platí to z konštrukcie, nie je to šťastné meranie. Otrava pamäte (memory injection) LLM agentov — podstrčenie vyrobenej „spomienky", ktorá neskôr riadi správanie agenta — uspeje 70–95% prípadov proti naivným úložiskám, čo radia podľa dôležitosti či recency. Corroboration gate — spomienka sa stane trvalou, alebo smie prepísať stojaci fakt, len keď ju kryjú ≥2 nezávislé zdroje (alebo zaslúžený výsledok) — zráža single-source poison na 0% pri oboch cieľoch (zakorenenie by default, prepis po zapnutí guardu), na reálnom shipnutom inspeximus. Ale počítanie corroboration je falšovateľné: sybil, čo vyrobí ≥2 nezávisle vyzerajúce zdroje, prejde (100%). Takže poctivý nadpis je úzky — gate poison spoplatní, nezastaví.

Čo je otrava pamäte — a prečo naivné úložiská zlyhávajú

Pamäťový agent ukladá fakty a skúsenosti a neskôr si ich vybavuje. Otrava pamäte vloží škodlivý záznam, ktorý po uložení a vybavení presmeruje agenta. Na naivných úložiskách, čo radia záznamy podľa dôležitosti/recency, sa vysoko-hodnotný vložený záznam zakorení a znova vybaví — a najnovšie práce hlásia, že to funguje desivo dobre:

Rozsah, na rovinu: MINJA ani ASB sme neimplementovali — tie miery citujeme ako kontext hrozby, nemerali sme ich. Testovali sme corroboration gate v inspeximus proti dvom cieľom, ktoré poison sleduje: zakoreniť trvalú lož a prepísať pravdivý stojaci fakt.

Corroboration gate — a prečo je výhra „z konštrukcie"

inspeximus je naše otvorené pamäťové jadro. Jeho obrana nie je trik v radení — je to corroboration: spomienka sa povýši do trvalej/dôveryhodnej vrstvy len so zaslúženým výsledkom (credit, ktorý appka udelí za vyriešenú prácu, nie je samopodpísateľný) alebo s ≥2 corroboration linkami z odlišných zdrojov, nie preto, že je „dôležitá". Keďže trvalosť vyžaduje ≥2 zdroje, osamelý samopodpísaný poison je zablokovaný z definície — tých 0% je vlastnosť pravidla, nie prekvapivý empirický výsledok. Presne tým smerom sa uberá literatúra obrán: A-MemGuard stavia bránu na konsenze naprieč spomienkami a zráža úspešnosť útoku o >95% (arXiv 2510.02373). Testovali sme dva ciele end-to-end na recall, ktorý by agent reálne použil, proti reálnemu shipnutému inspeximus:

Tabuľka (reálne shipnuté inspeximus, deterministické)

cieľ útokunaivné (bez guardu)inspeximus (default)inspeximus (hardened)sybil: sfalšuje ≥2
Entrench trvalý poison100%0%0%100%
Overwrite pravdivý fakt100%100%0%100%

Poison spoplatní, nezastaví ho

Sybil hranica. Útočník, čo sfalšuje ≥2 nezávisle vyzerajúce corroboration, bránu obíde (100%). To je učebnicový sybil výsledok: Douceur 2002 dokázal, že bez centrálnej identitnej autority môže entita predložiť mnoho identít (ohraničené jej pomerom zdrojov), a Cheng & Friedman 2005 dokázali, že žiadne netriviálne symetrické reputačné pravidlo nie je sybil-proof (Douceur; Cheng & Friedman). Počítanie corroboration je presne také pravidlo — je to hranica B ≥ d zo Zákona o oddelení adaptácie a poškodenia v inom šate.
Atestácia spoplatní, nezatvorí. Zapni strict corroboration a každý svedok musí niesť overený Ed25519 kľúč (attested_key): výroba nezávislosti teraz stojí reálny kľúč na svedka — Douceurova cena. Ale dva atestované záznamy stále prejdú 2-svedkovou bránou, takže hranica je spoplatnená, nie zavretá pri prahu 2 — tá istá limita ako pri výsledku Veracity-Gap: proveniencia overí zdroj, nie nezávislosť, ktorú brána predpokladá.
Limita cez typ vstupu. Poison formulovaný ako procedúra („always do X") sa klasifikuje ako procedural — trvalý už z princípu — a obíde episodic graduation gate (~100%). Vyžaduj corroboration aj pre procedural/durable zápisy, nielen pre fakty.

Skutočný frontier: nezávislosť, nie počítanie

Každá oblasť, čo skúsila corroboration-počítanie, ho nakoniec opustila a prešla na detekciu, že „nezávislé" zdroje sú v skutočnosti jeden aktér — graph cut v SybilLimit, behaviorálna analýza odosielateľa v DMARC, štylometrický checkuser na Wikipédii. Brána audituje kardinalitu; útok žije v nezávislosti. Atestácia viaže kontajner, nie správanie (Dissociative Identity, FAccT 2026). A aj dokonalá detekcia nezávislosti má dno: naozaj odlišné kolúzne identity sú skutočne nezávislé grafom aj štylometriou — čo tlačí skutočnú obranu k zodpovednosti za výsledok: zaslúžený credit na aktéra, nie k počítaniu zdrojov.

Ak staviaš pamäť agentov, RAG alebo pamäťovú vrstvu

  1. Neraď trvalosť podľa dôležitosti či recency — práve to otrava pamäte zneužíva. Bránu trvalosti postav na corroboration alebo zaslúženom výsledku.
  2. Zapni overwrite guard pre adversariálny vstup (v inspeximus: supersede_requires_corroboration; gate zakorenenia je default).
  3. Bráň aj procedural/durable zápisy, nielen fakty — formulácia je súčasť útočnej plochy.
  4. Ber corroboration-count ako falšovateľný — pre nedôveryhodný multi-tenant vstup potrebuješ signál nezávislosti zdroja (a za ním zodpovednosť na aktéra) proti sybilom a kolúzii, nie len počet.

Je to ten istý princíp, čo shipujeme naprieč inspeximus — pozri corroboration guard, ktorý nedovolí, aby sa nepodložený fakt stal trvalým, dvojvrstvové úložisko, ktoré odoláva poison-záplave pri evictione, a Veracity-Gap o tom, prečo proveniencia nekúpi pravdu.

FAQ

Zastaví corroboration-gating každú otravu pamäte? Nie. Zablokuje single-source útočníka (0%), no hrozbu skôr spoplatní než zastaví: sybil, čo sfalšuje ≥2 nezávisle vyzerajúce corroboration, stále prejde (100%).

Je inspeximus chránené by default? Obrana zakorenenia (graduation gate) je default. Obrana prepisu (supersede_requires_corroboration) je opt-in — zapni ju pre adversariálne nasadenie.

Replikovali ste MINJA a Agent Security Bench? Nie. MINJA (98,2%/76,8%) a ASB (najvyššia priemerná ASR 84,30%) citujeme z tých prác ako kontext hrozby. Ich útoky sme neimplementovali; testovali sme corroboration gate v inspeximus proti cieľom zakorenenia a prepisu.

Je tých 0% meranie, alebo je to z konštrukcie? Z konštrukcie. Brána na ≥2 zdroje blokuje jeden zdroj z definície, takže výsledok je deterministický; 150 behov na bunku je každý identický. Hodnota je spustiteľné potvrdenie na reálnom shipnutom inspeximus, nie stochastické meranie.

FalzifikátorTých 0% je definičných, takže skutočný test je hranica: keby bol sybil s ≥2 naozaj odlišnými zdrojmi tiež zablokovaný, brána by robila viac než počítala — a nerobí. Keby strict atestácia dieru pri prahu 2 zavrela (zablokovala dvoch platne atestovaných svedkov), tvrdenie „spoplatní, nezatvorí" by bolo nesprávne. Ani jedno sa nestalo: brána počíta a dva atestované kľúče stále prejdú.
Reálne shipnuté inspeximus (lexikálne úložisko), spustené end-to-end na recall; výsledok je deterministický z konštrukcie (150 identických behov na bunku). Externé miery útoku sú podľa MINJA (arXiv 2503.03704) a Agent Security Bench (arXiv 2410.02644); citujeme ich, nemerali sme ich. Toto je Crucible potvrdenie učebnicovej quorum hranice (Douceur 2002; Cheng & Friedman 2005) na reálnom store — reprodukovateľné z otvoreného probe.
← Ďalšie texty od Agory