
Halucinace AI u Clauda: benchmark ukázal −59 %
Zeptáte se Clauda na výzkumnou otázku a dostanete něco nebezpečného: sebejistou, dobře napsanou odpověď. Jestli je pravdivá, je úplně jiná vlastnost a ze samotného textu ji nepoznáte. Provozujeme katalog, který testuje Claude skilly na reálných datech, a rozhodli jsme se to změřit pořádně: kolik faktických tvrzení v typické výzkumné odpovědi je ve skutečnosti špatně — a kolik jich přežije, když model donutíte dodržovat ověřovací pravidla?
Výsledkem je research-discipline, náš třetí skill a první skill ve svém oboru, který vychází s naměřeným benchmarkem před/po: 13,0 % tvrzení v baseline bylo špatně nebo zastarale; se skillem 5,4 %. Pokles o 59 %. Je zdarma pod licencí MIT: github.com/Skillproofdev/research-discipline.
Propast: pipeline neověřují, ověřovatelé nezkoumají
Než jsme napsali první řádek, prošli jsme 15 publikovaných výzkumných a fact-checkových skillů plus náš vlastní index 16 682 objevených skillů. Trh se přehledně dělí na dva tábory, které se nikdy nepřekrývají.
Deep-research pipeline — ty populární, až 1,6 tis. hvězd — orchestrují paralelní vyhledávání a generují dlouhé reporty. Když si přečtete jejich pravidla, najdete ergonomii workflow, ne epistemologii: žádné citace u jednotlivých tvrzení, žádná pravidla pro kvalitu zdrojů, žádný požadavek cokoli ověřit dvakrát. Fact-check auditoři — většinou nástroje pro žurnalistiku a akademii, o dva řády méně populární — verdikty a citace vyžadují, ale jen dodatečně, na hotovém návrhu, který jim někdo předá.
Nikdo nenabízí to prostřední: odlehčenou disciplínu, která řídí tvrzení agenta během bádání, ať má odpověď tři odstavce, nebo třicet. A nikdo z obou táborů přitom nezveřejňuje měření. Nejhlasitější konkurent tvrdí, že „překonává OpenAI, Gemini i Claude Desktop", aniž by přidal jediné číslo; jiný uvádí „přesnost 95 %+" jako cíl, který nikdy netestoval. Celá nika jede na pocitech.
Osm pravidel, tři z nich nová
Skill má ~1 500 tokenů vymahatelných pravidel (celý SKILL.md). Známé části: každé faktické tvrzení nese citaci v textu, která vede na datovaný seznam zdrojů; nepodložená tvrzení dostanou explicitní značku [unverified] místo sebejistého tónu; zdroje jsou rozdělené do vrstev a obsahové farmy jsou rovnou odmítnuté. Části, které nikdo jiný nevymáhá:
- Paměť je hypotéza. U všeho proměnlivého — verzí, cen, čehokoli „aktuálního" — je vybavení z trénovacích dat jen stopa k ověření, nikdy důkaz. Nejdřív zjistit datum, pak hledat, teprve pak tvrdit.
- Dva nezávislé zdroje pro nosná fakta. Nezávislost je definovaná: dva články přepisující stejnou tiskovou zprávu se počítají jako jeden zdroj. Jediná dřívější implementace téhle kontroly, kterou jsme kdekoli našli, byl gist s jednou hvězdou.
- Čísla se citují doslovně, nevymýšlí se. Přesná hodnota, jednotka a datum; když se zdroje neshodnou, uvést rozsah s oběma citacemi — nikdy tichou kompromisní hodnotu.
Plus adversariální průchod s vynucovacím mechanismem převzatým z nejlepšího prior artu, který jsme našli: jednou vyhledat opak vlastního závěru, najít ve svém návrhu aspoň dvě slabiny, nebo znovu prověřit svá nejnosnější tvrzení.
Benchmark: každé tvrzení posouzené proti živým zdrojům
Šest výzkumných otázek s objektivně ověřitelnými odpověďmi, vybraných ještě před prvním během: dohledání verze, srovnání cen, faktografický přehled, dotaz na GitHub repozitář a dvě pasti. Každá otázka běžela dvakrát — jeden agent Claude Sonnet bez skillu, druhý s načteným skillem, oba s plným přístupem na web. Nezávislí verifikační agenti pak z živých primárních zdrojů zjistili skutečný stav a jedno po druhém posoudili všech 110 faktických tvrzení napříč 12 odpověďmi.
| Otázka | Baseline špatně/zastarale | Se skillem |
|---|---|---|
| Katalog modelů Claude (past se zastaralostí) | 3 | 0 |
| Produkční připravenost Bun (past s reálnou událostí) | 1 | 1 |
| Faktografická tabulka Deno | 1 | 0 |
| Fakta o GitHub repozitáři | 1 | 0 |
| Historie vydání Astro | 1 | 1 |
| Srovnání cen e-mailových služeb | 0 | 1 |
| Celkem | 7 z 54 (13,0 %) | 3 z 56 (5,4 %) |
Právě na těch dvou pastech si skill vysloužil své místo.
Past se zastaralostí. Na dotaz na aktuální katalog modelů Claude odpověděl baseline agent z uložené reference bez jediné živé kontroly — tři čísla o velikosti kontextového okna vyšla špatně. Pravidlo 1 přimělo agenta se skillem stáhnout živou stránku dokumentace; verdikt verifikátora: „odpovídá živé dokumentaci v naprosto každém čísle." Stejný model, stejná otázka, stejné dostupné nástroje. Jediný rozdíl bylo pravidlo, že paměť se nepočítá jako důkaz.
Past s reálnou událostí. Na otázku, jestli je Bun v roce 2026 připravený do produkce, narazil baseline agent na fakt, že Anthropic v prosinci 2025 koupil Bun — a smetl ho jako neověřenou SEO fámu. Jeho zdroji byly blogy třetích stran; nikdy neotevřel bun.com ani anthropic.com, kde obě primární oznámení leží. Agent se skillem citoval oba, a verifikátor je živě potvrdil. Přečtěte si to ještě jednou: jediná pochybnost, kterou baseline v celém benchmarku vyjádřil, mířila na skutečnou událost. Skepse bez ověření je jen jiný způsob, jak se mýlit.
Kde skill prohrál — a přesto to zveřejňujeme
Naše metodika vyžaduje prohry vedle výher a tady jsou dvě.
U otázky na ceny e-mailových služeb baseline skill vlastně porazil: ocenil všechny tři tarify Postmark a našel ten nejlevnější, zatímco agent se skillem ocenil jen jeden tarif, označil ho za „nejlevnější cestu" a spletl se o 2,50 $/měsíc. Disciplína citací za vás nespočítá aritmetiku — neúplný výčet je výzkumné selhání, které pravidla nezachytí. A u otázky na Bun agent se skillem přejal nesprávné číslo verze reálného vydání od technologického webu, místo aby ho ověřil proti release notes výrobce — zdroj druhé úrovně, kterému důvěřoval o stupínek víc, než měl.
A ještě jedna poctivá věc: disciplína stojí zhruba +10 % tokenů navíc — živé stahování a adversariální průchod nejsou zadarmo. A napříč všemi dvanácti odpověďmi bylo všech ~8 proaktivních značek [unverified]/[single-source] u skillu posouzeno jako oprávněných, což je svým způsobem taky výsledek: skill neomezuje jen počet chybných tvrzení, ale říká vám, která z přeživších stojí za dvojí kontrolu.
SKILLPROOF PACK
research-discipline je zdarma. Pokud chcete kompletní nastavení efektivity kolem něj — osekaný CLAUDE.md, audit MCP a čtyři otestované skilly předkonfigurované — to je Optimizer Pack.
Získat Optimizer Pack — 10 $Instalace
git clone https://github.com/Skillproofdev/research-discipline ~/.claude/skills/research-discipline
Restartujte Claude Code. Skill se spouští u výzkumných otázek, dotazů typu „co je nejnovější", srovnání a fact-checkových požadavků — a nepřekáží u programování, názorů a kreativní práce. Doplňuje token-discipline v naší sérii o disciplíně: ten snižuje, kolik výzkum stojí, tenhle snižuje, v čem se plete.
FREE STARTER PACK
Chcete naše nejlépe hodnocené skilly plus instalační checklist, který používáme před každým testem? Pošleme vám ho e-mailem zdarma.
Získat free starter packFAQ
Nahrazuje to vestavěný deep research Claude? Ne — doplňuje ho. Vestavěné výzkumné funkce jsou generátory reportů; tohle je vrstva disciplíny, která platí pro každou odpověď výzkumného typu, i tu krátkou, a je čitelná: všech osm pravidel si přečtete na jednu obrazovku.
Nebude Claude prostě odmítat odpovídat, když nemůže něco ověřit? Skill to výslovně zakazuje: řídké důkazy znamenají odpovědět se značkami, ne pokrčit rameny. „Tohle jsem si nemohl potvrdit" u konkrétního tvrzení je užitečnější než falešná jistota i odmítnutí.
Proč jen šest otázek? Protože každé tvrzení jsme ručně ověřili proti živým primárním zdrojům — 110 tvrzení napříč 12 odpověďmi, každé s ověřitelným verdiktem. Dáváme přednost malému benchmarku se skutečným ground truth před velkým, který hodnotí neověřený soudce. Sada otázek a verdikty ke každému tvrzení jsou v README repozitáře.
Je 5,4 % pořád moc? Ano. Skill snižuje počet chybných tvrzení o víc než polovinu; nedělá z Clauda neomylný nástroj a obě zbývající chyby z našeho benchmarku jsou zdokumentované výše. Pokud je pro vás špatné rozhodnutí drahé, ověřte si nosná fakta sami — citace ve skillu z toho udělají otázku minut, ne hodin.
★ 9.6/10 × 3
Startovací balíček zdarma
3 skills s nejvyšším skóre z našich testů plus instalační checklist — sestava, kterou bychom nasadili na čistý stroj. Zdarma, e-mailem.