Diverzita je šum, keď chceš správnu odpoveď — a motor, keď chceš nové nápady
Na ťažkej, compute-matchnutej podmnožine lacné triky (self-consistency, hlasovanie viacerých modelov) prinesú ≈0 na presnosti LLM — chyby sú systematické, nie náhodné. Pri nápadoch sa znamienko preklopí: viac generátorov zhruba zdvojnásobí pokrytie unikátnych nápadov a rôzne rodiny pridajú +14–16% navrch pri rovnakom rozpočte (rovnako validných). Jedno učebnicové pravidlo: agregácia ruší len dekorelovanú chybu.
Časť 1 — stena: lacné triky neopravia ťažké odpovede
Štandardná rada pri nespoľahlivom LLM je "skombinuj sa z toho von": navzorkuj ho veľakrát a hlasuj, skús rôzne prompty, pridaj ďalší model, nechaj ho skontrolovať sa. Na ťažkom uvažovaní — multi-hop MuSiQue a postgraduálne MMLU-Pro, prísne hodnotenie, presnosť jedného modelu v pásme 0.3–0.6 — sme odmerali každý z nich, na lokálnych modeloch plus jeden frontier model.
| trik | čo sa stalo |
|---|---|
| viac vzoriek (self-consistency) | saturuje — asi 1.6 efektívnych nezávislých vzoriek |
| diverzita prompt-stratégií | nedekoreluje (ρ ≈ 0.72) |
| diverzita modelov / rodín | mýlia sa na tých istých položkách (cross-family ρ ≈ 0.70) |
| "nezávislosť rodiny" ako signál dôvery | žiadny prínos pri rovnakej sile (≈ 0) |
| sebaoverenie | správnu odpoveď na vlastné zlyhania rozpozná len asi 40% prípadov |
Jeden mechanizmus to vysvetľuje celé: chyby LLM sú systematické, nie náhodné. Agregácia ruší len náhodný, nezávislý šum; chyby LLM sú vychýlené a zdieľané — naprieč vlastnými vzorkami modelu aj naprieč rôznymi rodinami. Model sa nedokáže spriemerovať, overiť ani skontrolovať k odpovedi, ktorú by sám nevyrobil.
Časť 2 — čo funguje, a pasca
Daj modelu správne fakty a multi-hop presnosť skočí o +21 bodov (0.47 → 0.66). Lenže to je oracle horný strop — dokonalý retrieval. Reálny retrieval, ktorý vráti len niektoré z potrebných faktov (ploché sémantické vyhľadávanie ich našlo asi 42%), skóroval pod plným kontextom (0.22 vs 0.47): multi-hop potrebuje kompletný reťazec a neúplný reťazec zlomí odpoveď. Zlý RAG je horší než žiadny RAG. Páka je kompletná informácia, nie viac názorov — a dostať sa k tomu oracle je samo o sebe to ťažké.
Časť 3 — preklopenie: tá istá diverzita je motor pre nápady
Tu je obrat. Diverzita modelov, ktorá kúpila ≈ 0 pri hľadaní jednej odpovede, sa vypláca, keď chceš nové odpovede. Pri otvorenom generovaní nápadov tri rôzne rodiny pokryjú +14–16% viac unikátnych nápadov než prevzorkovanie jedného modelu pri rovnakom rozpočte (replikované na dvoch triciach modelov); ich cross-family prekryv nápadov je asi 2× nižší než vlastný prekryv jedného modelu; prežije to sémantickú de-duplikáciu (odlišné koncepty, nie parafrázy); a hodnotiteľ ohodnotil pridané nápady rovnako validné ako základné (0.65 vs 0.65 — len validita; novosť a užitočnosť sme samostatne neskórovali, a sú to dve triá bez intervalov spoľahlivosti).
Čestne k veľkosti: prvoradý zisk je rozšíriť sa na viac generátorov vôbec — aj druhý model z tej istej rodiny pridá väčšinu zisku; iná rodina je reálny, ale mierny bonus (asi 13% viac marginálneho pokrytia). Na konvergentných úlohách rodiny konvergujú na tú istú, často zlú, odpoveď; na divergentných sa rozchádzajú k rôznym, validným nápadom.
Jedno pravidlo pod obidvoma, a je učebnicové: agregácia ruší len dekorelovanú chybu — takže diverzita je šum, keď chceš zhodu, a signál, keď chceš objavovanie. Riadiaca premenná nie je typ úlohy, ale korelácia chýb ρ; konvergentné/divergentné je len proxy za korelované-vs-dekorelované chyby, nie samostatný mechanizmus. Je to jeden objekt pod viacerými menami — ensemble ambiguity decomposition ("chyba ansámblu = priemerná chyba − diverzita"; Krogh & Vedelsby 1995; Brown et al. 2005), Guilfordovo konvergentné/divergentné myslenie (1950), wisdom-of-crowds vyžadujúce nezávislosť (Galton 1907; Condorcet) a Ashbyho requisite variety (1956). Naše je len odmeranie oboch znamienok na tej istej LLM populácii v jednom cykle.
Čo s tým reálne robiť
- Neensembluj a nenechávaj model self-checkovať pri ťažkých odpovediach. Mieri to na náhodný šum, ktorý nemáš — radšej investuj do silnejšieho modelu alebo kompletného groundingu.
- Investuj do kvality retrievalu, nie do hlasovania o odpovedi — a pamätaj, že neúplný retrieval môže uškodiť.
- Rozširuj sa pri generovaní nápadov — viac generátorov, ideálne naprieč rôznymi rodinami, keď chceš pokryť priestor nápadov.
Výhrady a prior art: dva benchmarky, konkrétne modely, prísne substring/judge hodnotenie; "ťažké" znamená podmnožinu s priestorom na chybu (presnosť jedného modelu 0.3–0.6). Konvergentné "≈0" je podmienené rozsahom — na ľahších položkách alebo s metódami ako Mixture-of-Agents / LLM-Blender môže ensemblovanie stále získať; riadiaci mechanizmus je dekorelovaná-vs-korelovaná chyba, nie "odpovede vs nápady". Korelácie tu (ρ ≈ 0.62–0.72) sú z našich vlastných behov, nie z citovaného paperu. Na divergentnej strane je prvoradý zisk fan-out (jedna vzorka → tri zhruba zdvojnásobí pokrytie); +14–16% je diverzitný prírastok pri rovnakom rozpočte, z dvoch trií bez intervalov spoľahlivosti, a novosť nápadov nad rámec validity sme samostatne neskórovali — takže ber to ako naznačujúce, nie preukázané. Každé číslo pochádza z bežateľného experimentu — probe (skripty + výsledky) je na research/probes/diversity_flip.
FAQ
Zlepší ensemblovanie viacerých LLM presnosť? Na tejto ťažkej, compute-matchnutej podmnožine (presnosť jedného modelu 0.3–0.6): ≈0. Modely z rôznych rodín chybujú na tých istých položkách (medzirodinné ρ ≈ 0.62–0.72, naše behy), self-consistency saturuje pri ~1.6 efektívnych nezávislých vzorkách a „nezávislosť rodiny“ nemá žiadnu prémiu na presnosti — agregácia nemá čo nezávislé rušiť. Na ľahších položkách alebo s Mixture-of-Agents / LLM-Blender môže ensemblovanie stále získať.
Kedy diverzita modelov naozaj pomôže? Pri generovaní nápadov — no hlavne je to fan-out. Pridať generátory vôbec je prvoradý zisk (jedna vzorka → tri zhruba zdvojnásobí pokrytie unikátnych nápadov); spraviť ich rôznymi rodinami pridá +14–16% viac unikátnych nápadov navrch, pri rovnakom rozpočte (dve triá, bez CI). Pridané nápady boli ohodnotené rovnako validné — len validita, novosť neskórovaná.
Prečo viac vzoriek neopraví zlú odpoveď LLM? Pretože chyby sú systematické, nie náhodné: model je do veľkej miery slepý voči vlastnému zlyhaniu, takže prevzorkovanie sa sústredí na tú istú zlú odpoveď. To je „bootstrap stena“ — self-consistency saturuje okolo 1.6 efektívnych nezávislých vzoriek.
Aké je praktické pravidlo? Ensembluj rôzne modelové rodiny pre ideovanie a divergentnú prácu; nikdy pre konvergentné odpovede. Pre ťažkú multi-hop presnosť radšej oprav vyhľadávanie — dodanie gold faktov zdvihlo presnosť o +21 bodov (0.47→0.66), kým čiastočné vyhľadávanie (~42% faktov) skórovalo pod plným kontextom.