Multi-hop recall na LoCoMo: daj model do vyhľadávacej slučky
Toto aplikuje známy recept agentického vyhľadávania (rodina IRCoT / Self-RAG / PRISM) na pamäťový benchmark. Nie je to nová metóda ani SOTA tvrdenie. Na LoCoMo multi-hop naivné ploché husté vyhľadávanie poskladá celý dôkazový reťazec v 14.5 % prípadov pri rozpočte 50 pasáží; pipeline s modelom v slučke dosiahne 56.5 % pri rovnakom rozpočte. To 3.9× vyzerá veľké hlavne preto, že baseline je naivný — silný agentický baseline by začínal oveľa vyššie. Skutočné prínosy sú skromné a čestné: (1) štandardný supporting-fact recall reportovaný čisto — full-evidence recall@50 na LoCoMo multi-hop, tam zriedka vyčleňovaný — a (2) cloud-free, reprodukovateľný harness.
Kde to stojí — prior art a čestný baseline
Mechanizmus je mainstream, nie náš. "Nechaj LLM prečítať prvé výsledky, pomenovať chýbajúci fakt, napísať follow-up dopyt, znova vyhľadať, potom prerob poradie" je dobre etablovaná línia iteratívneho / agentického vyhľadávania: IRCoT (Trivedi a kol. 2022, ACL 2023), Self-RAG (Asai a kol. 2023, ICLR 2024) a nástupcovia 2025 ako PRISM, FAIR-RAG, FrugalRAG; fúzny krok je RRF (Cormack a kol. 2009) a reranker je LLM-listwise (štýl RankGPT). Tie metódy už reportujú veľké zisky multi-hop recall nad silnými iteratívnymi baselinami (napr. PRISM dvíha MuSiQue passage recall z ~57 % IRCoT na ~83 %). Netvrdíme žiadnu metódovú novosť voči tejto práci.
Náš baseline je zámerne naivný, a na tom záleží. Štartovacích 14.5 % je single-shot husté top-50 podľa podobnosti k otázke — nie silný agentický baseline ako IRCoT. Takže to 3.9× treba čítať ako "známy recept opraví slabý baseline", nie "porazili sme state of the art". Vždy keď vidíš veľký násobok recall, opýtaj sa, aký silný bol baseline — náš bol slabý zámerne, aby sme izolovali tú páku, a hovoríme to.
Čo je tu naozaj užitočné, je úzke — a nie je to metrika. Full-evidence recall (všetky zlaté podporné repliky vytiahnuté) je štandardný joint / supporting-fact recall z multi-hop QA (HotpotQA, Yang a kol. 2018), len aplikovaný na LoCoMo, ktoré sa bežne skóruje end-task QA F1/sudcom. Takže hodnota nie je "nová metrika": je to (1) reportovanie toho štandardného recall čisto na LoCoMo multi-hop, kde sa zriedka samostatne vyčleňuje, a (2) cloud-free, reprodukovateľný harness (lokálne embeddingy) plus čestná delta 0.145 → 0.565. To je celé tvrdenie.
Čísla
Multi-hop otázky v dlhých konverzáciách potrebujú zreťaziť 2+ fakty z rôznych replík. Odmerali sme, ako často vyhľadávanie dostane všetky zlaté dôkazové repliky do pevného kontextu 50 pasáží, na LoCoMo (n=276 multi-hop, konverzácie ~597 replík). Najprv diagnostika: zlaté repliky sú v poole, len zahrabané v poradí (recall@100 = 0.514, recall@150 = 0.641; priemerná veľkosť gold 3.17), čiže je to problém poradia. Štyri sčítavajúce sa fázy, všetky pri rovnakom rozpočte 50:
| fáza | full-recall@50 (n=276) | × naivný baseline |
|---|---|---|
| naivné flat top-50 (husté, len otázka) | 0.145 | 1.0× |
| + follow-up dopyty s modelom v slučke | 0.297 | 2.0× |
| + RRF fúzia cez follow-up dopyty | 0.326 | 2.25× |
| + LLM reranker (vyber reťazec z top-100 poolu) | 0.482 | 3.3× |
| + adaptívny multi-round + rerank hlbšieho poolu | 0.565 | 3.9× |
Čítanie fáz: round-1 vytiahne top-15 podľa podobnosti k otázke; model pomenuje chýbajúcu mostovú entitu a vydá 1–2 follow-up dopyty; RRF cez tie dopyty (s vynechaním pôvodného poradia podľa otázky) fúzuje najlepšie; LLM reranker vyberie dôkazový reťazec z top-100 poolu; druhé kolo pomenuje, čo stále chýba, a prerobí poradie hlbšieho poolu. (Pozn., ktorú si necháme: žiadať viac dopytov uškodilo — riedi to fúziu; 1–2 ostré mostové dopyty boli optimum, pozorované naprieč fúznymi behmi, tu netabuľované.)
Prečo je porovnanie v rámci výsledku férové
- Rovnaký rozpočet finálneho kontextu. Každý riadok vráti presne 50 pasáží, rovnaká metrika — takže zisk nie je väčší vrátený kontext. Nie je ani zadarmo: fázy 1/3/4 míňajú extra per-query volania modelu a rerankery prezerajú top-100 / hlbší pool, takže zisk kupuje "pozri sa na hlbší pool + minú viac výpočtu, potom stlač na 50" — reálna páka cena/recall, nie rovnaký výpočet.
- Žiadny únik. Čitateľ v slučke vidí len otázku a už vytiahnuté repliky — nikdy nie gold. Follow-upy sú odvodené.
- Bez sudcu. Full-evidence recall je presné množinové obsiahnutie voči anotovaným dôkazom LoCoMo.
Najdôležitejšia čestná výhradaHeadline násobok je pôsobivý len natoľko, nakoľko je baseline slabý — a náš je slabý zámerne. Férový ďalší test, ktorý sme nespustili, je ten istý pipeline proti silnému agentickému baselinu (trieda IRCoT / PRISM) na tejto presnej metrike, ideálne pri fixnom token rozpočte. Dovtedy to ber ako "známy recept + štandardný recall reportovaný čisto na reálnej, nesaturovanej hranici (LoCoMo multi-hop)", nie ako metódu, čo poráža pole.
Ďalšie výhrady: absolútny recall je ~57 %, nie vyriešené; fázy 1, 3, 4 sú per-query volania modelu — reálna páka cena/recall, nie zadarmo; jeden dataset (dvojosobové konverzácie, kde mostová entita je meno a relatívne ľahko sa vynesie). A výhrada, čo je najdôležitejšia: recall je proxy a nemerali sme, či hýbe koncovou úlohou. Nikdy sme neskontrolovali, či zdvih full-evidence recall 0.145 → 0.565 zlepší presnosť odpovede — multi-hop otázky sa často dajú zodpovedať z čiastočných dôkazov alebo parametrickej znalosti, a dodanie kompletného zlatého reťazca stropuje multi-hop presnosť pri ~0.66, takže recall→accuracy prevodová funkcia je nemeraná a môže byť hlboko pod recall ziskom. Každé číslo pochádza z bežateľného experimentu — harness + výsledky sú na research/probes/locomo_multihop_recall.
FAQ
Zlepší vloženie modelu do vyhľadávacej slučky multi-hop recall? Áno. Na LoCoMo full-evidence recall@50 stúpne z 0.145 (naivný jednorazový dense top-50) na 0.565 cez pipeline s modelom v slučke — všetko pri rovnakom rozpočte 50 pasáží. To 3.9× vyzerá veľké hlavne preto, že baseline je zámerne naivný.
Je to nová metóda alebo SOTA výsledok? Nie. Iteratívne, modelom riadené vyhľadávanie je mainstream — IRCoT (Trivedi a kol. 2022, ACL 2023) a nasledovníci ako PRISM (ktorý zdvihne MuSiQue passage recall z ~57% IRCoT na ~83%). Prínos je štandardný supporting-fact recall odmeraný čisto na LoCoMo (bežne skórovanom QA F1) plus cloud-free reprodukovateľný harness, nie SOTA tvrdenie.
Čo je full-evidence recall@50? Či všetky gold podporné ťahy pre multi-hop otázku padnú do top-50 vyhľadaných pasáží (priemerná veľkosť gold 3.17, n=276). LoCoMo sa bežne skóruje ako end-task QA F1/sudca, takže tento presný retrieval recall sa zriedka samostatne vyčleňuje.
Čo skutočne hnalo zlepšenie? Štyri sčítavajúce sa fázy pri pevnom rozpočte 50 pasáží: follow-up dopyty s LLM v slučke (0.297), RRF fúzia nad tými dopytmi (0.326), LLM reranker vyberajúci reťaz z top-100 poolu (0.482) a adaptívny viackolový rerank hlbšieho poolu (0.565). Jeden či dva ostré bridge dopyty sú optimálne — viac riedi fúziu.