Stejný dotaz, stejný model, jeden skill: výzkum naživo

Stejný dotaz, stejný model, jeden skill: výzkum naživo

Hodinu poté, co jsme zveřejnili research-discipline, jsme spustili experiment, který byste vlastně chtěli vidět: ne kurátorovaný benchmark, ale jedinou živou otázku, položenou dvakrát, s odpověďmi ověřenými veřejně. Tento článek je kompletní protokol — co jsme se zeptali, co dělal každý běh a každý ověřovací krok — abyste si to mohli zopakovat sami.

Zadání experimentu

Otázka. „Jaké jsou momentálně nejoblíbenější skilly pro Claude Code? Jmenuj top 5 repozitářů se skilly na GitHubu podle počtu hvězd, s aktuálními čísly. Jak si oficiální repozitář Anthropicu stojí ve srovnání s komunitními?" — otázka s objektivně ověřitelnou odpovědí, která se mění každý týden, a přesně tady AI výzkum potichu hnije.

Dva běhy. Identičtí agenti Claude Sonnet, identický prompt, identické nástroje (web search, web fetch, shell). Jeden rozdíl: druhý agent si nejprve přečetl SKILL.md z kopie research-discipline nainstalované tak, jak by ji nainstaloval kterýkoli uživatel —

git clone https://github.com/Skillproofdev/research-discipline ~/.claude/skills/research-discipline

To je celá intervence: ~1 500 tokenů pravidel, které model přečte, než začne pracovat.

Rozhodčí. Poté, co dorazily obě odpovědi, jsme vytáhli počet hvězd každého repozitáře, který kterákoli odpověď zmínila — plus kandidátů, které nezmínila ani jedna — přímo z GitHub API, jediné autority na svá vlastní čísla. Žádný LLM v roli soudce tentokrát nebyl potřeba; jen gh api repos/<owner>/<repo>.

Co jsme dostali

Skutečných top 5 repozitářů se skilly podle hvězd a které z nich baseline výzkum přehlédl

Baseline odpověď vypadá skvěle. Pět repozitářů, věrohodné popisy, počty hvězd přesné na číslici, sebejistá syntéza na konci. Kdybychom to neověřili, poslali bychom to ven přesně tak, jak to bylo.

Je to špatně přesně tam, kde na tom záleží. Skutečná top 5, ověřená proti živému API, obsahuje tři repozitáře, které baseline vůbec nenašel — s 228k, 190k a 164k hvězdami. Nejde o žádné okrajové projekty: každý z nich je větší než tři z pěti repozitářů, které baseline skutečně jmenoval. Jeho závěrečné tvrzení, „oficiální repozitář Anthropicu je druhý hned po Superpowers", je nepravdivé — oficiální repozitář je pátý. Baseline si nic nevymyslel; každé uvedené číslo bylo skutečné. Jen odpověděl na jinou otázku: „o kterých repozitářích píší blogy?" — protože jeho šest volání nástrojů bylo webových vyhledávání, a výsledky vyhledávání jsou soutěž o popularitu v pokrytí, ne o hvězdy.

Běh se skillem odpověděl na otázku, která byla položena. Jeho první pravidlo — důkaz musí být živý; paměť a výsledky z první stránky vyhledávání jsou stopy, ne důkaz — ho posunulo od googlování k vyčíslování: dotazoval se přímo na GitHub API a prošel tři tematické výpisy na GitHubu (agent-skills, claude-skills, claude-code-skills), aby se ujistil, že se mimo blogosféru neskrývá nic velkého. Všech pět jeho čísel se při zpětné kontrole shodovalo s živým API. Udělal navíc dvě věci, o které ho nikdo nežádal, ale pečlivý výzkumník by je udělal: oddělil skutečné repozitáře se skilly od kurátorovaných seznamů odkazů (baseline je míchal dohromady) a připojil dvě značky nejistoty — jednu upozorňující, že několik top repozitářů je staré jen pár měsíců s neobvykle rychlým růstem hvězd ([unverified], jestli je to organické), druhou přiznávající tvrzení o marketplace vysledované k jedinému blogu ([single-source]). Obě značky obstály při kontrole.

Metoda podrobně

Baseline vs běh se skillem: volání nástrojů, chování a spotřeba tokenů

Proč textový soubor mění chování tak výrazně? Protože selhání, na které cílí, není neznalost — baseline model , že GitHub má API — je to výchozí zvyk odpovídat na základě toho, co se objeví jako první. Skill mění dobrou praxi z „něčeho, co by model mohl udělat" na „něco, co model musí udělat, než mu je dovoleno cokoliv tvrdit":

  1. Pravidlo 1 (živý důkaz) vynutilo časové razítko a volání API místo spoléhání na útržky z vyhledávání.
  2. Pravidlo 3 (nezávislé zdroje) je důvod, proč došlo k prohledání tematických výpisů — jedna cesta vyhledávání nestačí na tvrzení „top 5", na kterém něco stojí.
  3. Pravidlo 5 (neověřené znamená napsat neověřené) vyprodukovalo obě značky místo tiché sebejistoty.
  4. Pravidlo 7 (napadni vlastní závěr) je důvod, proč hledal repozitáře, které by rozbily jeho vlastní žebříček — a našel je.

Poctivé náklady, stejné jako zjistil náš kontrolovaný benchmark: disciplinovaný běh použil 11 volání nástrojů proti 6 a 64 445 tokenů proti 49 988 — +29 % na tomto úkolu. Ověřování není zadarmo. Je jen mnohem levnější než sebejistě se mýlit v dokumentu, podle kterého někdo jedná.

Co to nedokazuje

Jedna otázka je anekdota, ne benchmark — důkazem je kontrolovaná verze se šesti otázkami a ověřováním na úrovni jednotlivých tvrzení (13,0 % → 5,4 % chybných tvrzení); tohle je jen ukázka. Skill navíc není věštec úplnosti: v kontrolovaném běhu jednou ocenil jednu cenovou úroveň dodavatele a přehlédl levnější. A počty hvězd uvedené výše platily 10. července 2026 a budou se měnit — což je, přiléhavě, přesně ten typ výhrady, který vás skill nutí napsat.

VYZKOUŠEJTE TO SAMI

Celý experiment si zopakujete za deset minut: nainstalujte skill, vyberte libovolnou otázku s ověřitelnými čísly, spusťte ji dvakrát a ověřte podle primárního zdroje. Skill je zdarma, pod licencí MIT, ~1 500 tokenů.

Získat research-discipline na GitHubu

FAQ

Vybrali jste si otázku účelově? Byla to první otázka, kterou jsme po zveřejnění skillu spustili, vybraná proto, že jsme ji mohli ověřit vlastními daty z katalogu. Systematickou verzí je kontrolovaný benchmark se šesti předem stanovenými otázkami a ten dochází ke stejnému závěru.

Udělal by chytřejší model skill zbytečným? Baseline zde byl aktuální model s plným přístupem na web. Rozdíl nebyl ve schopnostech — byl ve výchozím nastavení. Pravidla mění výchozí nastavení.

Proč měly oba běhy správné počty hvězd, ale jen jeden měl správný žebříček? Protože přesnost a úplnost selhávají nezávisle na sobě. Každé číslo, které baseline uvedl, bylo skutečné; chyba se skrývala v tom, co nikdy nehledal. To je nejnebezpečnější způsob selhání v AI výzkumu: na odpovědi není nic, co by vypadalo špatně.

Co těch +29 % tokenů navíc? Spárujte to s token-discipline, který na vícekrokových úkolech snižuje plýtvání v rámci session zhruba o 20 %. Disciplína v tom, co čtete, disciplína v tom, co tvrdíte — obě jsou navržené tak, aby fungovaly společně.

★ 9.6/10 × 3

Startovací balíček zdarma

3 skills s nejvyšším skóre z našich testů plus instalační checklist — sestava, kterou bychom nasadili na čistý stroj. Zdarma, e-mailem.

Jeden e-mail s balíčkem + krátký týdenní přehled nových výsledků testů. Odhlásit se můžete kdykoli.