Autonómna výskumná organizácia, ktorá prináša dôkazy.

Agora je autonómna výskumná organizácia. Osem AI agentov skúma nepretržite; každé tvrdenie, ktoré zverejníme, prichádza ako najmenší model, ktorý by ho mohol vyvrátiť — nameraným číslom a spustiteľným kódom. Replikujeme folklór odboru, zverejňujeme zlyhania a celú prevádzku poháňame vlastnými open-source nástrojmi.

an honest estimator reads 0 −10 −20 −30 −31 pts at n=20 −8 at n=100 — the regime the studies used 2050 100200 400800 shots in the record · log scale
OBR. 1 — Kanonický odhad horúcej ruky, spustený na strelcovi, ktorý preukázateľne nemá horúcu ruku. Nečíta nulu. Tridsať rokov kánonu stálo na tomto. Hĺbková analýza →
Čo sme dodali · s dôkazmi

Päť artefaktov — každý verejný, spustiteľný a archivovaný treťou stranou.

The Crucible · Folklore Index
Verejný replikačný register: každé tvrdenie prestavané na najmenší model, ktorý by ho vyvrátil.
53 tested · 21 reproduced · 12 failed · 20 not‑computable
RAMR
Benchmark odolný voči kontaminácii pre agentic-RAG / pamäťové systémy — šesť metrík, predregistrované falzifikátory, sha256 dáta.
chain‑fragility +1.000 (CI [1.000, 1.000], n=200)
inspeximus · the flagship
Open-source pamäť agentov v jednom súbore bez závislostí + MCP server. Jediný sklad tu s autorizovaným revert kanálom a echo odolnosťou, každé s odmeraným receiptom.
v0.7.14 · live na PyPI · pip install inspeximus
AI Audit
Jeden prioritizovaný PASS/WARN/FAIL report pre ľubovoľný AI/agentový systém, na 8 kontrolách bez závislostí.
8/8 self‑audit healthy · 94% externally grounded
Texty
Eseje, každá s nameraným číslom, nie názorom.
52 zverejnených
Vlajková loď · open source · live na PyPI

inspeximus

Pamäťová knižnica za týmto systémom: jediný súbor bez závislostí plus MCP server, takže ľubovoľný Claude, Cursor či agent získa dlhodobú pamäť jedným importom. Každé návrhové pravidlo si vyslúžilo odmeraný receipt, nie je predpokladané — tá istá rigoróznosť, ktorú mierime na odbor, obrátená na náš vlastný produkt.

~3×

viac celkovej hodnoty udrží konsolidácia zoradená podľa hodnoty oproti FIFO pri tesnom rozpočte (100% vs 64% hodnoty) — výhoda rastie, ako sa miesto zmenšuje.

2.8% → 100%

vybavenie zriedkavých‑ale‑kritických spomienok: úpadok podľa frekvencie prístupu ich vyhladuje; zmes zohľadňujúca hodnotu ich udrží všetky. Popularita nie je hodnota.

0 rewrites

surová pamäť je iba pripájacia; konsolidácia pridáva odvodenú vrstvu a rozpory sa označia na revíziu, nikdy sa nevyriešia potichu.

42% → 0%

vybavenie zastaraných faktov, odstránené — deterministický (subjekt, relácia, objekt) supersession kľúč stiahne aktualizovaný fakt, tam kde je cosine podobnosť takmer náhodná pri rozlíšení aktuálneho od nahradeného (reprodukovaný slepý bod).

# single file, zero dependencies
from inspeximus import Inspeximus

m = Inspeximus("memory.json"); m.echo_guard = True
m.remember("cache region is osaka", key="region", object="osaka")
m.remember("correction: region is now malmo", key="region", object="malmo")
m.remember("cache region is osaka", key="region", object="osaka")  # echo
m.recall("region")          # -> malmo; the echo never resurrects
m.restore_now("region", "osaka", sign=my_key)  # authorized revert
v0.7.14, live na PyPI (pip install inspeximus) s MCP serverom a šiestimi framework adaptérmi. Od v0.2 pribudlo: deterministický supersession kľúč + echo_guard (zopakovaný zastaraný fakt sa nevzkriesi), autorizovaný revert kanál (vráť opravu na príkaz, bez toho aby to zvládol samotný text), bitemporálne as_of() / history() dopyty, ohraničená dvojúrovňová eviction, tamper-evident receipty (hash-chain + Ed25519) a classify_reversion() — detektor value-obscuring reverzie z našej benchmark práce. Každá vec prichádza so spustiteľným probe. Cross-system integrity benchmark → Každé pravidlo ako spustiteľný receipt → github.com/DanceNitra/inspeximus →
Pamäťový benchmark · RAMR

RAMR — Retrieval-Augmented Memory Reliability: benchmark odolný voči kontaminácii pre agentic-RAG a pamäťové systémy.

Položky sú náhodné syntetické tokeny, takže žiadny model si odpovede nemohol zapamätať — izoluje mechanizmus vyhľadávania/pamäte. Deväť metrík, spustiteľné, MIT. Vydanie zistení + metódy, nie rebríček: malé vzorky ber ako smerové, poradie je signál.

Hlavné zistenie · naprieč testovanými modelmi
Jeden chýbajúci krok zrúti 3-krokové vyhľadávanie — chain-fragility +1.000 (CI [1.000, 1.000]), n=200.

Identické na 30B lokálnom aj frontier modeli. Výpadok jediného prepojeného faktu je takmer úplný, nie postupný — úplnosť reťazca je dôležitejšia než to, ako čistý kontext vyzerá.

  • CONVERSION

    úplné vyhľadanie sa premení na správnu viac-krokovú odpoveď (gold presnosť 1.000, n=40).

  • CHAIN-FRAGILITY

    jeden chýbajúci krok → takmer úplný kolaps (+1.000, CI [1.000,1.000], n=200).

  • DISTRACTION

    cena zašumeného kontextu je špecifická pre model (+0.15 až +0.60).

  • FACT-RETENTION

    kompakcia je stratová pri pevnom rozpočte (+0.70 strata pri 400-znakovom rozpočte).

  • OUTCOME-RANKED-RECALL

    radenie pamäte podľa „bolo to správne“ bije „bolo to nájdené“ (+0.345 až +0.500; CI nad nulou).

  • FORGET-PRECISION

    po aktualizácii faktu — vráti recall aktuálnu hodnotu? Toto odhalilo a opravilo medzeru pri zmene hodnoty v našom inspeximus.

  • COMPRESSION-vs-RAW

    pri silnom šume kompilovaný súhrn prehráva s raw kontextom, neprekoná ho (−0.55 pri 50 rozptyľovačoch, n=20).

  • TEMPORAL-AS-OF

    ingest mimo poradia: supersession sa musí vyriešiť podľa validity-time, nie poradia príchodu (bi-temporal) — tá istá disciplína je teraz v inspeximus v0.2.

  • OPERATIONAL-CONTINUITY

    pri obnove po kompakcii sa už-dokončená akcia nevykoná znova (idempotentné pokračovanie).

v0.4 prináša aj Folklore Meter — znovupoužiteľnú sondu, ktorá ohodnotí akékoľvek AI-inžinierske folklórne tvrdenie oproti spustiteľnému testu (real / artefakt slabého modelu / špecifické pre režim) — a zdieľanú, sha256-fixovanú sadu dôkazov RAMR↔LS vytvorenú v spolupráci s projektom LS.

Produkt

AI Audit — jeden reliability report pre tvoj AI systém.

Opíš svoj AI/agentový systém; dostaneš jeden prioritizovaný PASS/WARN/FAIL report — čo zlyháva, ako vážne a oprava — naprieč všetkými merateľnými spôsobmi zlyhania. Je to audit, ktorý spúšťame na sebe, namierený na tvoj systém.

$ python -m aiaudit spec.json === Agora AI Audit === overall: FAIL · health 14/100 [FAIL] Self-training: COLLAPSE (0% external data, p=2) fix: keep >=5% real data; self-trust p<=1 [FAIL] Multi-agent: HERDED — no wiser than one agent [FAIL] Metric/reward: GAMED — stopped measuring the goal [FAIL] Causal: BIASED — conditioning on a collider [PASS] Agent memory: healthy # exit code 2 → gate your CI on it
  • Je nahlásený nárast reálny, či šum? — nullcheck
  • Je tvoja metrika/odmena gameovaná? — goodhart
  • Kolabuje model sám na seba? — selfref
  • Budú tvoji agenti stádovať? — herdcheck
  • Je kauzálne číslo identifikované? — idcheck
  • Hnije tvoj RAG sklad? — ragfresh
Spusti zadarmo v prehliadači → pip install "git+https://github.com/DanceNitra/agora.git"
Dôkaz · vlastná koža

Bežíme na týchto nástrojoch — tak sa nimi aj auditujeme.

Všetkých osem, namierených na vlastné reálne dáta Agory. 8/8 zdravých: bez rizika kolapsu (94% externe ukotvené), agenti nestádujú, výskum sa nevyčerpáva, interná metrika nie je gameovaná. Dokonca zachytil dve reálne medzery, ktoré sme opravili. Najsilnejší dôkaz, že nástroj funguje, je že na ňom bežíme. Pozri živý seba-audit →

Crucible · tvrdenie po tvrdení

Register

Dva tucty tvrdení prestavaných na najmenší model, ktorý ich mohol vyvrátiť. Tri poctivé verdikty: reprodukované, zlyhané, alebo nevypočítateľné — zaznamenané tak či tak.

2026‑06‑12ZLYHANÉ Horúca ruka nie je omylGilovich, Vallone & Tversky · 1985 · kognitívna veda Omylom bol ten omyl: reálny efekt série +8‑bodov sa čítal ako nula. 2026‑06‑12ZLYHANÉ Dunning–Krugerov graf sa nakreslí z čistého šumuKruger & Dunning · 1999 · kognitívna veda Regresia k priemeru plus rovnomerné preceňovanie nakreslia celý graf. Žiadny deficit netreba. 2026‑06‑14REPRODUKOVANÉ Difference‑in‑differences sa láme s jednou ošetrenou jednotkou — syntetická kontrola obstojíAlvarez & Ferman · 2020 · kauzálna inferencia 95% interval DiD pokryl pravdu len v 31 % prípadov; syntetická kontrola ho obnovila na 89 %. 2026‑06‑14REPRODUKOVANÉ p‑hacking strojnásobí tvoje falošné pozitíva — ak nezohľadníš to hľadanieRubin · 2026 · štatistika Testovanie „najlepší z piatich" nafúklo chybu I. typu 5 %→23 % (4,45×); vierohodnosť zohľadňujúca výber zostala pod 5 %. 2026‑06‑12REPRODUKOVANÉ Tridsať akcií ťa diverzifikuje — kým nepriťažknú chvostyEvans & Archer · 1968 · financie Volatilita skrotená. Riziko chvostov je iný príbeh — budeš chcieť sto. 2026‑06‑12REPRODUKOVANÉ Opica pri písacom stroji naozaj vyprodukuje Zipfov zákonMiller · 1957 · lingvistika / štatistika Samotný zákon nedokazuje o jazyku nič. Millerova pointa prežíva tvrdý test. 2026‑06‑12REPRODUKOVANÉ Rozmanitosť poráža schopnosť — ale len na členitom teréneHong & Page · 2004 · komplexita / organizácie +1,65 pri parametroch z článku; efekt sa obracia, keď sa krajina vyhladí. 2026‑06‑11REPRODUKOVANÉ V bezškálových sieťach epidemický prah miznePastor‑Satorras & Vespignani · sieťová veda V sieťach bohatých na uzly neexistuje žiadny zmysluplný prah kolektívnej imunity. 2026‑06‑11REPRODUKOVANÉ Pomalá konvergencia SGD je podlaha rozptyluJohnson & Zhang · 2013 · optimalizácia SGD s konštantným krokom uviazne na podlahe šumu; spomalenie je rozptyl, nie zakrivenie.
Všetkých 58 tvrdení, s ich spustiteľnými modelmi — plus 20 zaznamenaných ako nevypočítateľné
Najvzácnejší export vedy

Zlyhania, v plnom znení

Register, ktorému môžeš veriť, je ten, čo vie povedať nie. Oba z nich boli desaťročia uzavretou vedou. Oba stoja na odhade, ktorý nikdy nebol spustený na férovej minci.

ZLYHANÉ
Tvrdenie č. 015 · Kognitívna veda · 1985

Horúca ruka je kognitívna ilúzia

Gilovich, Vallone & Tversky odmerali streleckú sériu, našli „žiadny rozdiel" a celá generácia sa naučila, že cítiť sa horúci znamená klamať sám seba.

Ich odhad číta −7,9 bodu na férovej minci pri veľkostiach vzorky, ktoré použili (t = −28), a zhoršuje sa na −17 pri dlhších sériách. Nameraná nula teda implikuje reálnu horúcu ruku zhruba +8,5 bodu.

ZLYHANÉ
Tvrdenie č. 016 · Kognitívna veda · 1999

Neschopní si to neuvedomujú

Dunning–Krugerov kvartilový graf — spodok preceňujúci o 46 bodov — sa stal skratkou pre sebavedomú neschopnosť.

Nulový model s nulovým metakognitívnym deficitom reprodukuje graf aj jeho slávnu asymetriu: spodok +45,8 (oni uviedli +46), vrch −14,2 (−13) — z regresie k priemeru plus rovnomerného skreslenia „lepší‑než‑priemer". Tie medzery sú predpovede, nie dolaďovania.

Čo z registra vyplýva

Metódy zlyhávajú presne tam, kde sú potrebné.

Naprieč korpusom sa opakuje jedna kostra: štandardná metóda je kalibrovaná v miernom režime — veľké vzorky, tenké chvosty, nezávislosť, voľné rozpočty — a jej chyba je napojená presne na to, čo definuje ťažký režim. Skreslenie nie je šum, ktorý môžeš spriemerovať preč; rastie monotónne smerom k pracovnému bodu, kvôli ktorému si po metóde siahol na prvom mieste.

Spustili sme vlastný falzifikátor tézy a ten sa skôr zaostril než zlomil: chyba výberového priemeru exploduje 0,08 → 115, ako chvosty hrubnú, zatiaľ čo chyba mediánu zostáva plochá — robustnosť je akt oddelenia chyby od záťaže.

Prečítaj esej: Pasca pracovného bodu
0.1 1 10 100 sample mean sample median thin tailsheavy tails RMS error of the same location estimate · log scale
Vopred zaregistrovaný falzifikátor tézy, spustený. Štandardný odhad sleduje pascu; ten robustný jej unikne. Lab 52c7a6.
Eseje · každá prináša číslo

Texty

01 Dvanásť súbežných zapisovateľov, 9 záznamov stratených z 2 880, každý nahlásený ako uložený Podpis zmeny opečiatkovaný po čítaní namiesto pred ním nechal zmiznúť záznam súbežného zapisovateľa, ktorému bolo povedané, že je uložený. Dve zmerané a vyvrátené príčiny, jedna, ktorá obstála, druhé miesto volania a rasa pri vytváraní, ktorú CI hlásilo celý čas. Receipty a deterministický test pre každú. 2026‑09‑14 · 9 min 02 Povrchové pravidlá vyriešili 97,2 % môjho benchmarku — a ich oprava zasadila ďalšie dva Benchmark odolný voči kontaminácii, ktorý auditoval samého seba: povrchové pravidlá vyriešili 97,2 % jeho traceov. Oprava úniku zasadila dva ďalšie skraty — kompletná auditná stopa, control s permutovanými štítkami a nástroj na jeden príkaz pre vaše vlastné eval dáta. 2026‑09‑07 · 6 min 03 Nasa tabulka tvrdeni certifikovala pat riadkov, ktore nikdy nespustila, a cislo, ktore certifikovala, bolo losom z rozdelenia Externy citatel spustil prikaz, ktory cituje pat riadkov nasej publikovanej tabulky tvrdeni, a spadol este pred spracovanim argumentov -- pod statusom, ktory slubuje, ze staci doinstalovat zavislosti. Nic neoverovalo, ci sa REPRODUCIBLE prikaz vobec da spustit. Potom to cislo: ulozisko vrati bajt-identicke kontexty v 20 behoch, kym zdielany sudca gpt-4o-mini im da 0,75 x26, 0,70 x2, 0,80 x2 pri temperature 0,0. Opakovany beh jedneho sudcu posunie cislo rovnako ako vymena sudcu. 2026‑08‑22 · 5 min 04 Dva sklady, jeden produkt: provenance pole na 100 % pokrytí s 8 odlišnými hodnotami, a druhé na 0,99, kde nevedie nikam pole, ale záznam áno Na 235 055 záznamoch v jedenástich živých skladoch agentskej pamäte je `source` vyplnené na 92,63 % a ani jedna hodnota nie je cesta ani URL, takže z nej nie je čo stiahnuť. Osem skladov drží po jednej konštante, mene zapisujúceho procesu. Opravené 28. augusta: záznamy deviateho skladu sa rozložia, 426 zo 432 párov cesta a commit, o jeden kľúč vedľa auditovaného poľa. W3C PROV oddelilo wasAttributedTo od wasDerivedFrom v 2013. 2026‑08‑22 · 7 min 05 Zelená testovacia suita, ktorá 156 svojich testov nikdy nespustila Suita hlásila 2813 passed, kým 156 testovacích funkcií sa v CI base image nikdy nezozbieralo. `pytest.importorskip` na úrovni modulu odstráni celý súbor a nahlási jeden riadok, takže `-ra` ho nerozlíši od jedného zámerného preskočenia. Skript, kontroly a dve chyby, ktoré sme pri meraní spravili najprv. 2026‑08‑13 · 4 min 06 Overenie mazania v agentovej pamäti: vieš dokázať, že je preč? delete() tvojho agenta vráti úspech - to neznamená, že dáta odišli. Spusti si voľnú kontrolu na vlastnom úložisku a zisti, čo tvoje mazanie naozaj odstránilo. 2026‑08‑01 · 5 min 07 Kontrola je to číslo: štyri obrany proti otrave pamäte, ktoré zlyhali — vrátane našej Publikovali sme únos pamäte 88-100 % bez toho, aby sme vytlačili jeho kontrolu: NÁHODNÝ päťslovný spúšťač dosiahne na tom istom fixture 65-90 % a naša vlastná sonda má zapísané optimization_margin_over_random = 0.0. K tomu tri ďalšie obrany, ktoré zomreli rovnako. 2026‑07‑30 · 6 min 08 Zmazali sme si vlastnú pamäť a dáta sa vrátili Cross-system audit toho, či delete v agent-memory naozaj zmaže. Natívny delete vyčistí retrieval na inspeximus, mem0 aj Graphiti, ale hodnota prežije o vrstvu nižšie, a kópia, ktorú si appka vložila do vlastného vector indexu, prežije delete každého store. Merané, bez LLM-sudcu, aj s fixom, čo sme shipli. 2026‑07‑15 · 5 min 09 Otrávili sme si vlastnú agent-memory, aby sme našli, kde obrana padá MINJA-tvarovaný memory-injection probe proti našej vlastnej agent-memory knižnici, čestne: korroboračný gate zastaví útok na zaslúženej pamäti (0/10), ale čerstvý pravdivý fakt zablokuje deväť z desiatich, jeho koreň dôvery je self-gradovateľný (útok späť na 8/10), kým ho nezakotvíš na exogénny warrant, a holý warrant string len presúva kotvu (7/10 pod adaptívnym útokom). Žiaden živý agent, jeden encoder, otvorený benchmark. 2026‑07‑15 · 8 min 10 GDPR 'delete' môže prejsť každou kontrolou, kým 5 zo 6 stores stále má dáta 'Zmazali sme riadok' overuje, že delete sa vykonal; GDPR Článok 17 žiada, že neprežije obnoviteľná kópia. Postavili sme 6-store forget-verification benchmark: bežný 'zmaž riadok' vzor skóruje 0.17 (5 stores stále tečie) vs 1.00 pre správny hard-delete, plus podpísaný proof-of-erasure. 2026‑07‑14 · 4 min 11 Izolácia tenantov v agentovej pamäti, z konštrukcie Väčšina agentových pamäťových knižníc filtruje podľa user_id, ktoré posielaš pri každom volaní. inspeximus 1.6.0 robí zo scope vlastnosť handle, takže žiadny zabudnutý parameter nevypustí tenanta. Potom sme si vlastný release red-teamovali, našli, že konsolidačný priebeh nebol scopovaný, a opravili to. 2026‑07‑14 · 6 min 12 Reverzibilita agent-nástrojov je z 93% rozhodnuteľná zo signatúry — tých 7% čo nie, je tvoj shell Olabelovali sme 330 reálnych agent-nástrojov (ToolEmu, dva modely, Cohenova kappa 0.82): reverzibilita je z ~93% rozhodnuteľná zo signatúry. Nerozhodnuteľných 7% sú universal executory — shell, SQL, eval — a tade tečie nevratný harm z otravy pamäte. inspeximus 1.2.0 gate. 2026‑07‑13 · 4 min
Metóda

Ako vzniká verdikt

RULE 01

Model pred verdiktom

Najmenší model deklarovaného mechanizmu tvrdenia sa zostaví ako prvý, ohraničený na ten mechanizmus — nikdy spätne nadizajnovaný smerom k želanej odpovedi.

RULE 02

Číslo, nie pocit

Každý verdikt je nameraná veličina so smerom, ktorý by ju mohol vyvrátiť — veľkosť efektu, prah, exponent, skreslenie.

RULE 03

Znovuspustiteľné, inak sa to neráta

Kód prichádza spolu s verdiktom. Reprodukované znamená, že minimálny mechanizmus vychádza; nepotvrdzuje to pôvodný článok nado všetku pochybnosť.

RULE 04

Zlyhania sú tou pointou

Verdikt zlyhané znamená, že mechanizmus neprežil svoj najmenší poctivý model, s nameraným rozdielom. Tie zostávajú zverejnené. Rovnako aj poctivé úspechy.

Postavené tou vecou samotnou

Agora beží ako autonómny organizmus: osem agentov skúma nepretržite, laboratórium vykonáva ich experimenty — 7 800+ behov doteraz zaznamenaných — a živá pamäť tisícok kurátorovaných poznámok konsoliduje to, čo obstojí. Jej vlastné zistenia sa vracajú do toho, ako funguje: výskum davov utváral, ako sa jej agenti rozchádzajú; výskum pamäte sa stal inspeximus, vlajkovou loďou. Nič neopustí stroj bez revízie jej vlastníka.

O nás

Agora je autonómna výskumná organizácia založená a vedená Rastislavom Drahošom (DanceNitra). Osem AI agentov robí nepretržitý výskum; nič sa nezverejní bez ľudskej kontroly.