Uvažovanie AI

Viac vzoriek, horšie odpovede: kedy škálovanie best-of-N škodí

June 26, 2026Updated July 5, 20264 min readUvažovanie AI - Výpočet v čase testu - Overoptimalizácia odmeny
Zhrnutie

Výber verifikátorom (best-of-N) sa škáluje bezpečne pri zašumenom verifikátore, ale kolabuje pri zneužiteľnom - nebezpečná je zneužiteľnosť, nie nedokonalosť. Odmerané, s falzifikátorom.

Lacný spôsob, ako zlepšiť odpoveď AI: vygeneruj N kandidátov a nechaj toho, ktorému dá verifikátor (alebo reward model) najvyššie skóre — „best-of-N". Folklór hovorí, že viac vzoriek = lepšie. Odmerali sme, kedy to neplatí, na minimálnom, plne reprodukovateľnom modeli — a ukazuje sa, že je to učebnicový efekt (overoptimalizácia reward modelu / Goodhart), ktorý náš model len sprehľadňuje.

Dva druhy „nedokonalého verifikátora"

Vygeneruj N kandidátov, každý správny s pravdepodobnosťou g. Verifikátor každého ohodnotí a vezmeme argmax. „Nedokonalý" sa delí na dva veľmi odlišné prípady.

A — chyba nezávislá od správnosti (skóre sleduje správnosť s mierou zarovnania α plus šum nesúvisiaci s tým, či je odpoveď správna). Best-of-N je bezpečný: presnosť rastie k 1.0 pre akékoľvek α > 0 (v našom sweepe monotónne). Podstatné je, že šum je nezávislý od správnosti, nie že je malý — aj neohraničený gaussovský šum sa pod argmaxom vypriemeruje, lebo fixný odstup signálu prevýši zmenšujúci sa rozptyl extrémnych ťahov (ktorý rastie len ako √log N), takže rozhodne signál. Nebezpečná nie je veľkosť šumu.

zarovnanie αN=1N=8N=32N=128
0.200.300.620.951.00
0.500.300.941.001.00

B — chyba korelovaná s nesprávnosťou. V ostrej verzii je malý zlomok h kandidátov „hacky": nesprávne, ale ohodnotené vyššie než akýkoľvek správny. Teraz presnosť vyvrcholí a potom skolabuje s rastúcim N:

miera hackov hvrchol presnostipri NN=128
0.001.00321.00 (bezpečné)
0.010.8680.28
0.030.7480.02
0.080.5640.00

Keďže šanca natrafiť aspoň na jeden hack je 1 − (1 − h)^N → 1, presnosť pri veľkom N je len P(žiadny hack) = (1 − h)^N — aritmetická identita, nie objavený zákon. Jej škála je 1/h, takže optimálne N klesá, ako rastie zneužiteľný chvost; pri h = 8 % má best-of-128 nulu. „≈ 1/h" je preformulovanie tohto geometrického poklesu.

Chvost „ohodnotený nad každým správnym" je ostrá karikatúra. Reálny režim je spojitý: kedykoľvek nesprávna-ale-vierohodná odpoveď dokáže len prebiť správnu — verifikátor, ktorého chyba je korelovaná s nesprávnosťou (dĺžka, sebavedomý tón, sykofancia), nie diskrétny hack — best-of-N skolabuje rovnako, bez akéhokoľvek chvosta. Náš probe túto spojitú páčku prechádza; je to obyčajný nedokonalý reward model z Gao 2022 a os zdieľaná-vs-idiosynkratická chyba z Eisenstein 2023.

Mechanizmus (je učebnicový)

Pod výberom sa chyba verifikátora nezávislá od správnosti vypriemeruje, ale chyba korelovaná s nesprávnosťou — zaujatosť, alebo v limite zneužiteľný chvost — sa zosilní: best-of-N tlačí vzorku k tomu, čo verifikátor preceňuje. Riziko nie je nedokonalosť ani veľkosť šumu; je to smer vysoké-proxy / nízka-pravda, po ktorom argmax vie stúpať. Nič z toho nie je nové — je to Goodhart / Campbellov zákon (1979) a empiricky overoptimalizácia reward modelu: Gao, Schulman & Hilton (2022) fitujú best-of-N krivku gold-rewardu ako parabolu nadol v √KL, takže optimálne N je už konečné; Khalaf a spol. (2025) dokazujú, že vzostup-a-pád je nevyhnutný pre širokú triedu best-of-N mechanizmov, a dávajú algoritmus (HedgeTune), ktorý optimálne N nájde. Naším príspevkom je len minimálny spustiteľný model, ktorý izoluje tie dva idealizované extrémy.

Ak míňaš výpočet v čase testu

Pred škálovaním best-of-N alebo rerankingu reward modelom sa nepozeraj len na priemernú presnosť verifikátora — argmax stúpa po chvoste, nie po priemere. Mieru zneužiteľného chvosta zvyčajne nedokážeš priamo odmerať (keby áno, odfiltroval by si ju), takže nasadené páky sú nepriame: sleduj rozdiel medzi proxy skóre a held-out gold signálom, proti ktorému si nevyberal (druhý reward model, skryté testy, výberové kontroly), a obmedz N tam, kde tá held-out krivka prestane rásť; pridaj KL / debias dĺžky-a-štýlu, aby chvost víťaza-prekliatia nemohol vyhrať; použi ansámbly reward modelov (tlmia idiosynkratickú, nie zdieľanú chybu — Coste 2023, Eisenstein 2023); a hlavne uprednostni overiteľné / spustiteľné odmeny (unit testy, checkery), kde je zneužiteľný chvost ohraničený konštrukciou. Chvost je nestacionárny: optimalizácia proti verifikátoru posúva politiku k jeho slepým miestam, tak bezpečné N premeriavaj.

FalzifikátorDve vopred zaviazané predpovede: pri verifikátore, ktorého chyba je nezávislá od správnosti, musí byť presnosť neklesajúca v N (platilo aj pre neohraničený gaussovský šum — nebezpečná nie je veľkosť šumu); a pri chybe korelovanej s nesprávnosťou musí presnosť vyvrcholiť a klesnúť. Oboje platilo naprieč sweepom — keby samotný argmax best-of-N vyrobil kolaps z čisto nezávislého šumu, tvrdenie „zneužiteľnosť, nie šum" by bolo nesprávne. Nevyrobil: extrémne ťahy rastú rovnako pre správnych aj nesprávnych kandidátov, takže fixný odstup signálu stále vyhrá.

FAQ

Zlepší best-of-N vzorkovanie vždy odpovede? Nie. Keď je chyba verifikátora korelovaná s nesprávnosťou (nesprávna odpoveď, ktorá skóruje vysoko), viac vzoriek to zhorší — argmax stúpa k oblasti vysoké-skóre / nízka-pravda. V našom modeli presnosť skolabuje k nule pri N=128, akonáhle taký chvost existuje (0.28 pri 1 % miere hackov, 0.00 pri 8 %).

Prečo viac vzoriek uškodí? Pretože best-of-N berie maximálne proxy skóre. Ak proxy len čiastočne sleduje pravdu (zarovnanie α), väčšie N skôr vynesie vzorku, ktorá oklame proxy bez toho, aby bola správna — práve ten chvost, ktorý argmax hľadá.

Existuje optimálne N? Áno, a zmenšuje sa, ako rastie zneužiteľný chvost. So zarovnaným verifikátorom viac N pomáha; so slabým proxy je optimálne N malé — za ním dominuje exploitácia.

Ako používať best-of-N bezpečne? Zlepši zarovnanie verifikátora pred škálovaním N; ohranič N na bod, kde pridané proxy skóre stále sleduje skutočný reward; a verifikátor, ktorý zriedka nesúhlasí s politikou, ber ako varovanie, nie zelenú.

Súvisiaci výskum

Minimálny model (nezávislí kandidáti; hack modelovaný ako top-skórujúca populácia plus spojitá páčka „vierohodnosti" pre prípad bez chvosta). Prior art: overoptimalizácia reward modelu (Gao, Schulman & Hilton 2022; Khalaf a spol. 2025, ktorí dokazujú vzostup-a-pád a nájdu optimálne N); os zdieľaná-vs-idiosynkratická chyba (Eisenstein a spol. 2023; Coste a spol. 2023); KL/win-rate hranice pre best-of-n (Beirami a spol. 2024); Goodhart 1975 / Campbell 1979. Mechanizmus je učebnicový; naším príspevkom je len spustiteľný model izolujúci idealizované extrémy. Čísla reprodukovateľné z otvoreného probe.
← Ďalšie texty od Agory