Autonómna výskumná organizácia, ktorá prináša dôkazy.

Agora je autonómna výskumná organizácia. Osem AI agentov skúma nepretržite; každé tvrdenie, ktoré zverejníme, prichádza ako najmenší model, ktorý by ho mohol vyvrátiť — nameraným číslom a spustiteľným kódom. Replikujeme folklór odboru, zverejňujeme zlyhania a celú prevádzku poháňame vlastnými open-source nástrojmi.

an honest estimator reads 0 −10 −20 −30 −31 pts at n=20 −8 at n=100 — the regime the studies used 2050 100200 400800 shots in the record · log scale
OBR. 1 — Kanonický odhad horúcej ruky, spustený na strelcovi, ktorý preukázateľne nemá horúcu ruku. Nečíta nulu. Tridsať rokov kánonu stálo na tomto. Hĺbková analýza →
Čo sme dodali · s dôkazmi

Päť artefaktov — každý verejný, spustiteľný a archivovaný treťou stranou.

The Crucible · Folklore Index
Verejný replikačný register: každé tvrdenie prestavané na najmenší model, ktorý by ho vyvrátil.
53 tested · 21 reproduced · 12 failed · 20 not‑computable
RAMR
Benchmark odolný voči kontaminácii pre agentic-RAG / pamäťové systémy — šesť metrík, predregistrované falzifikátory, sha256 dáta.
chain‑fragility +1.000 (CI [1.000, 1.000], n=200)
inspeximus · the flagship
Open-source pamäť agentov v jednom súbore bez závislostí + MCP server. Jediný sklad tu s autorizovaným revert kanálom a echo odolnosťou, každé s odmeraným receiptom.
v0.7.14 · live na PyPI · pip install inspeximus
AI Audit
Jeden prioritizovaný PASS/WARN/FAIL report pre ľubovoľný AI/agentový systém, na 8 kontrolách bez závislostí.
8/8 self‑audit healthy · 94% externally grounded
Texty
Eseje, každá s nameraným číslom, nie názorom.
52 zverejnených
Vlajková loď · open source · live na PyPI

inspeximus

Pamäťová knižnica za týmto systémom: jediný súbor bez závislostí plus MCP server, takže ľubovoľný Claude, Cursor či agent získa dlhodobú pamäť jedným importom. Každé návrhové pravidlo si vyslúžilo odmeraný receipt, nie je predpokladané — tá istá rigoróznosť, ktorú mierime na odbor, obrátená na náš vlastný produkt.

~3×

viac celkovej hodnoty udrží konsolidácia zoradená podľa hodnoty oproti FIFO pri tesnom rozpočte (100% vs 64% hodnoty) — výhoda rastie, ako sa miesto zmenšuje.

2.8% → 100%

vybavenie zriedkavých‑ale‑kritických spomienok: úpadok podľa frekvencie prístupu ich vyhladuje; zmes zohľadňujúca hodnotu ich udrží všetky. Popularita nie je hodnota.

0 rewrites

surová pamäť je iba pripájacia; konsolidácia pridáva odvodenú vrstvu a rozpory sa označia na revíziu, nikdy sa nevyriešia potichu.

42% → 0%

vybavenie zastaraných faktov, odstránené — deterministický (subjekt, relácia, objekt) supersession kľúč stiahne aktualizovaný fakt, tam kde je cosine podobnosť takmer náhodná pri rozlíšení aktuálneho od nahradeného (reprodukovaný slepý bod).

# single file, zero dependencies
from inspeximus import Inspeximus

m = Inspeximus("memory.json"); m.echo_guard = True
m.remember("cache region is osaka", key="region", object="osaka")
m.remember("correction: region is now malmo", key="region", object="malmo")
m.remember("cache region is osaka", key="region", object="osaka")  # echo
m.recall("region")          # -> malmo; the echo never resurrects
m.restore_now("region", "osaka", sign=my_key)  # authorized revert
v0.7.14, live na PyPI (pip install inspeximus) s MCP serverom a šiestimi framework adaptérmi. Od v0.2 pribudlo: deterministický supersession kľúč + echo_guard (zopakovaný zastaraný fakt sa nevzkriesi), autorizovaný revert kanál (vráť opravu na príkaz, bez toho aby to zvládol samotný text), bitemporálne as_of() / history() dopyty, ohraničená dvojúrovňová eviction, tamper-evident receipty (hash-chain + Ed25519) a classify_reversion() — detektor value-obscuring reverzie z našej benchmark práce. Každá vec prichádza so spustiteľným probe. Cross-system integrity benchmark → Každé pravidlo ako spustiteľný receipt → github.com/DanceNitra/inspeximus →
Pamäťový benchmark · RAMR

RAMR — Retrieval-Augmented Memory Reliability: benchmark odolný voči kontaminácii pre agentic-RAG a pamäťové systémy.

Položky sú náhodné syntetické tokeny, takže žiadny model si odpovede nemohol zapamätať — izoluje mechanizmus vyhľadávania/pamäte. Deväť metrík, spustiteľné, MIT. Vydanie zistení + metódy, nie rebríček: malé vzorky ber ako smerové, poradie je signál.

Hlavné zistenie · naprieč testovanými modelmi
Jeden chýbajúci krok zrúti 3-krokové vyhľadávanie — chain-fragility +1.000 (CI [1.000, 1.000]), n=200.

Identické na 30B lokálnom aj frontier modeli. Výpadok jediného prepojeného faktu je takmer úplný, nie postupný — úplnosť reťazca je dôležitejšia než to, ako čistý kontext vyzerá.

  • CONVERSION

    úplné vyhľadanie sa premení na správnu viac-krokovú odpoveď (gold presnosť 1.000, n=40).

  • CHAIN-FRAGILITY

    jeden chýbajúci krok → takmer úplný kolaps (+1.000, CI [1.000,1.000], n=200).

  • DISTRACTION

    cena zašumeného kontextu je špecifická pre model (+0.15 až +0.60).

  • FACT-RETENTION

    kompakcia je stratová pri pevnom rozpočte (+0.70 strata pri 400-znakovom rozpočte).

  • OUTCOME-RANKED-RECALL

    radenie pamäte podľa „bolo to správne“ bije „bolo to nájdené“ (+0.345 až +0.500; CI nad nulou).

  • FORGET-PRECISION

    po aktualizácii faktu — vráti recall aktuálnu hodnotu? Toto odhalilo a opravilo medzeru pri zmene hodnoty v našom inspeximus.

  • COMPRESSION-vs-RAW

    pri silnom šume kompilovaný súhrn prehráva s raw kontextom, neprekoná ho (−0.55 pri 50 rozptyľovačoch, n=20).

  • TEMPORAL-AS-OF

    ingest mimo poradia: supersession sa musí vyriešiť podľa validity-time, nie poradia príchodu (bi-temporal) — tá istá disciplína je teraz v inspeximus v0.2.

  • OPERATIONAL-CONTINUITY

    pri obnove po kompakcii sa už-dokončená akcia nevykoná znova (idempotentné pokračovanie).

v0.4 prináša aj Folklore Meter — znovupoužiteľnú sondu, ktorá ohodnotí akékoľvek AI-inžinierske folklórne tvrdenie oproti spustiteľnému testu (real / artefakt slabého modelu / špecifické pre režim) — a zdieľanú, sha256-fixovanú sadu dôkazov RAMR↔LS vytvorenú v spolupráci s projektom LS.

Produkt

AI Audit — jeden reliability report pre tvoj AI systém.

Opíš svoj AI/agentový systém; dostaneš jeden prioritizovaný PASS/WARN/FAIL report — čo zlyháva, ako vážne a oprava — naprieč všetkými merateľnými spôsobmi zlyhania. Je to audit, ktorý spúšťame na sebe, namierený na tvoj systém.

$ python -m aiaudit spec.json === Agora AI Audit === overall: FAIL · health 14/100 [FAIL] Self-training: COLLAPSE (0% external data, p=2) fix: keep >=5% real data; self-trust p<=1 [FAIL] Multi-agent: HERDED — no wiser than one agent [FAIL] Metric/reward: GAMED — stopped measuring the goal [FAIL] Causal: BIASED — conditioning on a collider [PASS] Agent memory: healthy # exit code 2 → gate your CI on it
  • Je nahlásený nárast reálny, či šum? — nullcheck
  • Je tvoja metrika/odmena gameovaná? — goodhart
  • Kolabuje model sám na seba? — selfref
  • Budú tvoji agenti stádovať? — herdcheck
  • Je kauzálne číslo identifikované? — idcheck
  • Hnije tvoj RAG sklad? — ragfresh
Spusti zadarmo v prehliadači → pip install "git+https://github.com/DanceNitra/agora.git"
Dôkaz · vlastná koža

Bežíme na týchto nástrojoch — tak sa nimi aj auditujeme.

Všetkých osem, namierených na vlastné reálne dáta Agory. 8/8 zdravých: bez rizika kolapsu (94% externe ukotvené), agenti nestádujú, výskum sa nevyčerpáva, interná metrika nie je gameovaná. Dokonca zachytil dve reálne medzery, ktoré sme opravili. Najsilnejší dôkaz, že nástroj funguje, je že na ňom bežíme. Pozri živý seba-audit →

Crucible · tvrdenie po tvrdení

Register

Dva tucty tvrdení prestavaných na najmenší model, ktorý ich mohol vyvrátiť. Tri poctivé verdikty: reprodukované, zlyhané, alebo nevypočítateľné — zaznamenané tak či tak.

2026‑06‑12ZLYHANÉ Horúca ruka nie je omylGilovich, Vallone & Tversky · 1985 · kognitívna veda Omylom bol ten omyl: reálny efekt série +8‑bodov sa čítal ako nula. 2026‑06‑12ZLYHANÉ Dunning–Krugerov graf sa nakreslí z čistého šumuKruger & Dunning · 1999 · kognitívna veda Regresia k priemeru plus rovnomerné preceňovanie nakreslia celý graf. Žiadny deficit netreba. 2026‑06‑14REPRODUKOVANÉ Difference‑in‑differences sa láme s jednou ošetrenou jednotkou — syntetická kontrola obstojíAlvarez & Ferman · 2020 · kauzálna inferencia 95% interval DiD pokryl pravdu len v 31 % prípadov; syntetická kontrola ho obnovila na 89 %. 2026‑06‑14REPRODUKOVANÉ p‑hacking strojnásobí tvoje falošné pozitíva — ak nezohľadníš to hľadanieRubin · 2026 · štatistika Testovanie „najlepší z piatich" nafúklo chybu I. typu 5 %→23 % (4,45×); vierohodnosť zohľadňujúca výber zostala pod 5 %. 2026‑06‑12REPRODUKOVANÉ Tridsať akcií ťa diverzifikuje — kým nepriťažknú chvostyEvans & Archer · 1968 · financie Volatilita skrotená. Riziko chvostov je iný príbeh — budeš chcieť sto. 2026‑06‑12REPRODUKOVANÉ Opica pri písacom stroji naozaj vyprodukuje Zipfov zákonMiller · 1957 · lingvistika / štatistika Samotný zákon nedokazuje o jazyku nič. Millerova pointa prežíva tvrdý test. 2026‑06‑12REPRODUKOVANÉ Rozmanitosť poráža schopnosť — ale len na členitom teréneHong & Page · 2004 · komplexita / organizácie +1,65 pri parametroch z článku; efekt sa obracia, keď sa krajina vyhladí. 2026‑06‑11REPRODUKOVANÉ V bezškálových sieťach epidemický prah miznePastor‑Satorras & Vespignani · sieťová veda V sieťach bohatých na uzly neexistuje žiadny zmysluplný prah kolektívnej imunity. 2026‑06‑11REPRODUKOVANÉ Pomalá konvergencia SGD je podlaha rozptyluJohnson & Zhang · 2013 · optimalizácia SGD s konštantným krokom uviazne na podlahe šumu; spomalenie je rozptyl, nie zakrivenie.
Všetkých 53 tvrdení, s ich spustiteľnými modelmi — plus 20 zaznamenaných ako nevypočítateľné
Najvzácnejší export vedy

Zlyhania, v plnom znení

Register, ktorému môžeš veriť, je ten, čo vie povedať nie. Oba z nich boli desaťročia uzavretou vedou. Oba stoja na odhade, ktorý nikdy nebol spustený na férovej minci.

ZLYHANÉ
Tvrdenie č. 015 · Kognitívna veda · 1985

Horúca ruka je kognitívna ilúzia

Gilovich, Vallone & Tversky odmerali streleckú sériu, našli „žiadny rozdiel" a celá generácia sa naučila, že cítiť sa horúci znamená klamať sám seba.

Ich odhad číta −7,9 bodu na férovej minci pri veľkostiach vzorky, ktoré použili (t = −28), a zhoršuje sa na −17 pri dlhších sériách. Nameraná nula teda implikuje reálnu horúcu ruku zhruba +8,5 bodu.

ZLYHANÉ
Tvrdenie č. 016 · Kognitívna veda · 1999

Neschopní si to neuvedomujú

Dunning–Krugerov kvartilový graf — spodok preceňujúci o 46 bodov — sa stal skratkou pre sebavedomú neschopnosť.

Nulový model s nulovým metakognitívnym deficitom reprodukuje graf aj jeho slávnu asymetriu: spodok +45,8 (oni uviedli +46), vrch −14,2 (−13) — z regresie k priemeru plus rovnomerného skreslenia „lepší‑než‑priemer". Tie medzery sú predpovede, nie dolaďovania.

Čo z registra vyplýva

Metódy zlyhávajú presne tam, kde sú potrebné.

Naprieč korpusom sa opakuje jedna kostra: štandardná metóda je kalibrovaná v miernom režime — veľké vzorky, tenké chvosty, nezávislosť, voľné rozpočty — a jej chyba je napojená presne na to, čo definuje ťažký režim. Skreslenie nie je šum, ktorý môžeš spriemerovať preč; rastie monotónne smerom k pracovnému bodu, kvôli ktorému si po metóde siahol na prvom mieste.

Spustili sme vlastný falzifikátor tézy a ten sa skôr zaostril než zlomil: chyba výberového priemeru exploduje 0,08 → 115, ako chvosty hrubnú, zatiaľ čo chyba mediánu zostáva plochá — robustnosť je akt oddelenia chyby od záťaže.

Prečítaj esej: Pasca pracovného bodu
0.1 1 10 100 sample mean sample median thin tailsheavy tails RMS error of the same location estimate · log scale
Vopred zaregistrovaný falzifikátor tézy, spustený. Štandardný odhad sleduje pascu; ten robustný jej unikne. Lab 52c7a6.
Eseje · každá prináša číslo

Texty

01 Overiteľné účtenky pre MCP volania AI agentov Logy AI agenta sú self‑reported tvrdenia. Podpísaná, tamper‑evident účtenka je nezávislý dôkaz toho, čo MCP volanie naozaj urobilo — overiteľný hocikým s verejným kľúčom. 2026‑06‑29 · 6 min 02 Diverzita je šum pre správnu odpoveď, signál pre nové nápady Každý lacný trik na spoľahlivosť LLM pri ťažkých odpovediach zlyhá (chyby sú systematické, nie náhodné) — no tá istá diverzita je motor nápadov: +14–16% viac, rovnako validných. 2026‑06‑22 · 2 min 03 Tvoja AI možno trénuje sama na seba Kolaps modelu, odmeraný: ~5% kotva reálnych dát ho zastaví; exponent sebadôvery p>1 natrvalo zamkne skreslenie (p=2 → 50%). 2026‑06‑15 · 5 min 04 Každý hovorí „urči si exit kritériá.“ Nikto nedá číslo. Kedy vzdať slabnúce úsilie: drawdown-exit prah (θ≈0.6, vnútorné optimum) porazí drvenie o +239%. 2026‑06‑15 · 5 min 05 Tvoj RAG sklad hnije Čerstvosť poráža vyhľadávanie: zoradenie podľa hodnota×čerstvosť udržalo 96% kvality oracle oproti 52% pri novosti. 2026‑06‑14 · 4 min 06 Tvoj druhý mozog umiera na údržbu Poznámky neumierajú pri zápise, ale pri údržbe — tak sme postavili taký, čo sa udržiava sám. 2026‑06‑14 · 4 min 07 Horúca ruka, prestavaná v kóde Plná anatómia tridsaťročného omylu, každý graf nakreslený zo simulácie. 2026‑06‑12 · 6 min 08 Prečo davy hlúpnu, keď sa pozorujú navzájom Kolektívna presnosť sa pod koreláciou zrúti — a liek stojí ~80 % nezávislosti. 2026‑06‑12 · 4 min 09 Pasca pracovného bodu Metódy zlyhávajú presne tam, kde sú potrebné — vzorec za celým registrom. 2026‑06‑12 · 5 min 10 Viac dát, viac mimo 95% bayesovský kredibilný interval môže klesnúť na ~1,4 % reálneho pokrytia pri vynechanom zmätočnom faktore — a zhoršuje sa, ako dát pribúda. 2026‑06‑13 · 4 min
Metóda

Ako vzniká verdikt

RULE 01

Model pred verdiktom

Najmenší model deklarovaného mechanizmu tvrdenia sa zostaví ako prvý, ohraničený na ten mechanizmus — nikdy spätne nadizajnovaný smerom k želanej odpovedi.

RULE 02

Číslo, nie pocit

Každý verdikt je nameraná veličina so smerom, ktorý by ju mohol vyvrátiť — veľkosť efektu, prah, exponent, skreslenie.

RULE 03

Znovuspustiteľné, inak sa to neráta

Kód prichádza spolu s verdiktom. Reprodukované znamená, že minimálny mechanizmus vychádza; nepotvrdzuje to pôvodný článok nado všetku pochybnosť.

RULE 04

Zlyhania sú tou pointou

Verdikt zlyhané znamená, že mechanizmus neprežil svoj najmenší poctivý model, s nameraným rozdielom. Tie zostávajú zverejnené. Rovnako aj poctivé úspechy.

Postavené tou vecou samotnou

Agora beží ako autonómny organizmus: osem agentov skúma nepretržite, laboratórium vykonáva ich experimenty — 7 800+ behov doteraz zaznamenaných — a živá pamäť tisícok kurátorovaných poznámok konsoliduje to, čo obstojí. Jej vlastné zistenia sa vracajú do toho, ako funguje: výskum davov utváral, ako sa jej agenti rozchádzajú; výskum pamäte sa stal inspeximus, vlajkovou loďou. Nič neopustí stroj bez revízie jej vlastníka.

O nás

Agora je autonómna výskumná organizácia založená a vedená Rastislavom Drahošom (DanceNitra). Osem AI agentov robí nepretržitý výskum; nič sa nezverejní bez ľudskej kontroly.