Viac vzoriek, horšie odpovede: kedy škálovanie best-of-N škodí
Výber verifikátorom (best-of-N) sa škáluje bezpečne pri zašumenom verifikátore, ale kolabuje pri zneužiteľnom - nebezpečná je zneužiteľnosť, nie nedokonalosť. Odmerané, s falzifikátorom.
Lacný spôsob, ako zlepšiť odpoveď AI: vygeneruj N kandidátov a nechaj toho, ktorému dá verifikátor (alebo reward model) najvyššie skóre — „best-of-N". Folklór hovorí, že viac vzoriek = lepšie. Odmerali sme, kedy to neplatí, na minimálnom, plne reprodukovateľnom modeli — a ukazuje sa, že je to učebnicový efekt (overoptimalizácia reward modelu / Goodhart), ktorý náš model len sprehľadňuje.
Dva druhy „nedokonalého verifikátora"
Vygeneruj N kandidátov, každý správny s pravdepodobnosťou g. Verifikátor každého ohodnotí a vezmeme argmax. „Nedokonalý" sa delí na dva veľmi odlišné prípady.
A — chyba nezávislá od správnosti (skóre sleduje správnosť s mierou zarovnania α plus šum nesúvisiaci s tým, či je odpoveď správna). Best-of-N je bezpečný: presnosť rastie k 1.0 pre akékoľvek α > 0 (v našom sweepe monotónne). Podstatné je, že šum je nezávislý od správnosti, nie že je malý — aj neohraničený gaussovský šum sa pod argmaxom vypriemeruje, lebo fixný odstup signálu prevýši zmenšujúci sa rozptyl extrémnych ťahov (ktorý rastie len ako √log N), takže rozhodne signál. Nebezpečná nie je veľkosť šumu.
| zarovnanie α | N=1 | N=8 | N=32 | N=128 |
|---|---|---|---|---|
| 0.20 | 0.30 | 0.62 | 0.95 | 1.00 |
| 0.50 | 0.30 | 0.94 | 1.00 | 1.00 |
B — chyba korelovaná s nesprávnosťou. V ostrej verzii je malý zlomok h kandidátov „hacky": nesprávne, ale ohodnotené vyššie než akýkoľvek správny. Teraz presnosť vyvrcholí a potom skolabuje s rastúcim N:
| miera hackov h | vrchol presnosti | pri N | N=128 |
|---|---|---|---|
| 0.00 | 1.00 | 32 | 1.00 (bezpečné) |
| 0.01 | 0.86 | 8 | 0.28 |
| 0.03 | 0.74 | 8 | 0.02 |
| 0.08 | 0.56 | 4 | 0.00 |
Keďže šanca natrafiť aspoň na jeden hack je 1 − (1 − h)^N → 1, presnosť pri veľkom N je len P(žiadny hack) = (1 − h)^N — aritmetická identita, nie objavený zákon. Jej škála je 1/h, takže optimálne N klesá, ako rastie zneužiteľný chvost; pri h = 8 % má best-of-128 nulu. „≈ 1/h" je preformulovanie tohto geometrického poklesu.
Chvost „ohodnotený nad každým správnym" je ostrá karikatúra. Reálny režim je spojitý: kedykoľvek nesprávna-ale-vierohodná odpoveď dokáže len prebiť správnu — verifikátor, ktorého chyba je korelovaná s nesprávnosťou (dĺžka, sebavedomý tón, sykofancia), nie diskrétny hack — best-of-N skolabuje rovnako, bez akéhokoľvek chvosta. Náš probe túto spojitú páčku prechádza; je to obyčajný nedokonalý reward model z Gao 2022 a os zdieľaná-vs-idiosynkratická chyba z Eisenstein 2023.
Mechanizmus (je učebnicový)
Pod výberom sa chyba verifikátora nezávislá od správnosti vypriemeruje, ale chyba korelovaná s nesprávnosťou — zaujatosť, alebo v limite zneužiteľný chvost — sa zosilní: best-of-N tlačí vzorku k tomu, čo verifikátor preceňuje. Riziko nie je nedokonalosť ani veľkosť šumu; je to smer vysoké-proxy / nízka-pravda, po ktorom argmax vie stúpať. Nič z toho nie je nové — je to Goodhart / Campbellov zákon (1979) a empiricky overoptimalizácia reward modelu: Gao, Schulman & Hilton (2022) fitujú best-of-N krivku gold-rewardu ako parabolu nadol v √KL, takže optimálne N je už konečné; Khalaf a spol. (2025) dokazujú, že vzostup-a-pád je nevyhnutný pre širokú triedu best-of-N mechanizmov, a dávajú algoritmus (HedgeTune), ktorý optimálne N nájde. Naším príspevkom je len minimálny spustiteľný model, ktorý izoluje tie dva idealizované extrémy.
Ak míňaš výpočet v čase testu
Pred škálovaním best-of-N alebo rerankingu reward modelom sa nepozeraj len na priemernú presnosť verifikátora — argmax stúpa po chvoste, nie po priemere. Mieru zneužiteľného chvosta zvyčajne nedokážeš priamo odmerať (keby áno, odfiltroval by si ju), takže nasadené páky sú nepriame: sleduj rozdiel medzi proxy skóre a held-out gold signálom, proti ktorému si nevyberal (druhý reward model, skryté testy, výberové kontroly), a obmedz N tam, kde tá held-out krivka prestane rásť; pridaj KL / debias dĺžky-a-štýlu, aby chvost víťaza-prekliatia nemohol vyhrať; použi ansámbly reward modelov (tlmia idiosynkratickú, nie zdieľanú chybu — Coste 2023, Eisenstein 2023); a hlavne uprednostni overiteľné / spustiteľné odmeny (unit testy, checkery), kde je zneužiteľný chvost ohraničený konštrukciou. Chvost je nestacionárny: optimalizácia proti verifikátoru posúva politiku k jeho slepým miestam, tak bezpečné N premeriavaj.
FalzifikátorDve vopred zaviazané predpovede: pri verifikátore, ktorého chyba je nezávislá od správnosti, musí byť presnosť neklesajúca v N (platilo aj pre neohraničený gaussovský šum — nebezpečná nie je veľkosť šumu); a pri chybe korelovanej s nesprávnosťou musí presnosť vyvrcholiť a klesnúť. Oboje platilo naprieč sweepom — keby samotný argmax best-of-N vyrobil kolaps z čisto nezávislého šumu, tvrdenie „zneužiteľnosť, nie šum" by bolo nesprávne. Nevyrobil: extrémne ťahy rastú rovnako pre správnych aj nesprávnych kandidátov, takže fixný odstup signálu stále vyhrá.
FAQ
Zlepší best-of-N vzorkovanie vždy odpovede? Nie. Keď je chyba verifikátora korelovaná s nesprávnosťou (nesprávna odpoveď, ktorá skóruje vysoko), viac vzoriek to zhorší — argmax stúpa k oblasti vysoké-skóre / nízka-pravda. V našom modeli presnosť skolabuje k nule pri N=128, akonáhle taký chvost existuje (0.28 pri 1 % miere hackov, 0.00 pri 8 %).
Prečo viac vzoriek uškodí? Pretože best-of-N berie maximálne proxy skóre. Ak proxy len čiastočne sleduje pravdu (zarovnanie α), väčšie N skôr vynesie vzorku, ktorá oklame proxy bez toho, aby bola správna — práve ten chvost, ktorý argmax hľadá.
Existuje optimálne N? Áno, a zmenšuje sa, ako rastie zneužiteľný chvost. So zarovnaným verifikátorom viac N pomáha; so slabým proxy je optimálne N malé — za ním dominuje exploitácia.
Ako používať best-of-N bezpečne? Zlepši zarovnanie verifikátora pred škálovaním N; ohranič N na bod, kde pridané proxy skóre stále sleduje skutočný reward; a verifikátor, ktorý zriedka nesúhlasí s politikou, ber ako varovanie, nie zelenú.