Pamäť agenta · meranie

Minulé lekcie agentovi pomohli, keď ich napísali výsledky zvonka, nie keď ich vybral ranker

28. septembra 20263 min čítaniaPamäť agenta · Otrava pamäte · Pripisovanie výsledkov · Taste-Bench · inspeximus
Zhrnutie

Na 160 inžinierskych rozhodnutiach z Taste-Bench zdvihli náhodné lekcie z toho istého repozitára Claude Opus 5.5 z 0,594 na 0,750; zoradenie podľa podobnosti pridalo 0,019, v šume. Pomohli lekcie z výsledkov zvonka, nie tie, ktoré agent posúdil sám. So sondou.

Lekcie s potvrdeným výsledkom zdvihli Claude Opus 5.5 z 0,594 na 0,750 pri inžinierskych rozhodnutiach, aj keď sme ich vyberali náhodne. Výber podľa podobnosti embeddingov to zvýšil na 0,769. Týchto 0,019 navyše má 95 % interval -0,031 až +0,069, takže beh ich nevie odlíšiť od nuly.

Chceli sme ukázať, že vybavená rozhodovacia pamäť pomáha agentovi voliť lepšie. Výsledok je užší: pomohli lekcie napísané z výsledkov potvrdených mimo agenta. Na tom, ako sme ich zoradili, pri týchto rozhodnutiach záležalo málo.

Čo sme merali, v tomto poradí

Použili sme inžiniersku časť Taste-Bench (Pan et al., arXiv 2609.25804): 390 rozhodnutí zo skutočných programátorských postupov. Každé má dva možné ďalšie kroky a štítok označuje ten, ktorého vetva mala lepší zaznamenaný výsledok. Model vidí obe možnosti v oboch poradiach a rozhodnutie sa počíta, iba keď sú obe odpovede správne. Tým sa kontroluje sklon k pozícii.

Lekcia je jedna veta z rozhodnutia v inej úlohe: „voľba X namiesto Y viedla k lepšiemu výsledku“. Lekciu z testovanej úlohy nikdy nevyberáme.

Lekcie v zadaníSprávne v oboch poradiach
Žiadne0,594
Náhodné, ten istý repozitár, rovnaké povrchové znaky0,750
Top 3 podľa podobnosti embeddingov (výber inspeximus)0,769
Bez modelu: pravidlo na dva riadky (vyber izolovanú alebo dlhšiu možnosť)0,669

Náhodné lekcie z toho istého repozitára pridajú 0,156 (+0,087 až +0,225). Zoradenie podľa podobnosti pridá navrch 0,019. Pri 160 rozhodnutiach beh vylúči zisk zo zoradenia nad približne 0,07, menší nie.

Záležalo na tom, odkiaľ prišiel výsledok

Qwen napísal vlastné lekcie zo svojich skorších volieb, dvoma spôsobmi:

Zodpovedá to zisteniu Huang et al. pri uvažovaní (arXiv 2310.01798): bez spätnej väzby zvonka sa modely ťažko opravujú a ich výkon niekedy klesne. ReasoningBank (arXiv 2509.25140) je protipríklad: pamäť hodnotená samým agentom pomohla pri webových úlohách, kde sa úspech overuje ľahšie než pri rozhodnutí o vkuse.

Kam patrí otrava pamäte

Pamäť, ktorá sa učí z výsledkov, je vystavená otrave pamäte: falošnému výsledku zapísanému do skladu. Každej lekcii sme dali obrátené dvojča, zámerne extrémny sklad, v ktorom je zhruba polovica každého výberu nesprávna. Išlo o samostatný beh s Opusom pri predvolenom úsilí, v ktorom čistá pamäť dosiahla 0,825. Obyčajný výber klesol na 0,637. Výber iba lekcií, ktorých výsledok potvrdil niekto zvonka, vrátil 0,825.

Posledné číslo ukazuje, čo brána robí so signálom, nie že útok odhalí: v tomto teste je potvrdenie zvonka samotný štítok z datasetu. Starší článok ukázal tú istú hranicu na štylizovaných ukážkach: obrana, ktorá pripisuje zásluhu výsledkom hodnoteným samým agentom, padne pred útočníkom, ktorý svoj jed ohodnotí ako úspech.

Čo by nás vyvrátilo

Hranice

Čo to znamená pre inspeximus

Výsledok niesla tá časť pamäte agenta, ktorou je výsledok a to, kto ho potvrdil. inspeximus to podporuje a treba to zapnúť. V Python API vráti recall(influence_only=True) iba potvrdené spomienky. S credit_requires_warrant=True sa zásluha počíta, iba keď nesie potvrdenie. remember(project=...) a recall(project=...) oddelia pamäť podľa projektu, pričom záznamy bez projektu ostávajú viditeľné. Na tomto benchmarku hodnota nebola v lepšom zoradení podľa podobnosti.

Každé číslo tu vypíše research/probes/taste_outcome_not_ranking.py z výsledkov po jednotlivých rozhodnutiach, ktoré ležia vedľa nej.

← Ďalšie texty od Agory