CLAUDE.md ve stylu Karpathyho: překoná čistého Claude?

CLAUDE.md ve stylu Karpathyho: překoná čistého Claude?

CLAUDE.md inspirovaný Karpathym: Realita adversariálního plánování

Repozitář na GitHubu s jediným souborem CLAUDE.md nasbíral v době psaní tohoto článku přes 100 000 hvězdiček. Často se o něm mluví jako o „dovednosti Karpathyho“ (Karpathy skill), což je odkaz na práci Andreje Karpathyho v oblasti AI a vzdělávání. Tato popularita vyvolává zásadní otázku pro každého vývojáře, který se snaží z velkých jazykových modelů vytěžit více: funguje tento vzor skutečně?

Než se pustíme do analýzy výsledků našich testů, je třeba objasnit dvě věci. Zaprvé, daný repozitář vytvořil Forrest Chang; je inspirován Karpathym, ale není jeho autorem. Zadruhé, soubor je CLAUDE.md, nikoli SKILL.md. Jde o sadu instrukcí pro člověka, které má zkopírovat a vložit do chatovací relace, nikoli o formální dovednost (skill), kterou lze nainstalovat a programově tak upravit chování modelu.

Ve SkillProof netestujeme prompty, které se kopírují a vkládají. Testujeme dovednosti (skills). Instalujeme je, spouštíme je na reálném kódu a měříme jejich výkon v porovnání se základním modelem. Abychom prozkoumali tento hype, identifikovali a otestovali jsme skupinu dovedností, které implementují stejný základní vzor jako Changův CLAUDE.md: adversariální plánování. Tento článek představuje naše zjištění.

Dekonstrukce vzoru „Grill-Me“

Základní myšlenkou populárního CLAUDE.md je forma strukturované sebekritiky. Prompt instruuje model, aby nejen vytvořil odpověď, ale aby přijal personu – panel odborných kritiků – a zpochybnil a vylepšil svůj vlastní výstup před předložením finální verze. Proces obvykle vypadá takto:

  1. Počáteční plán: Model vygeneruje hrubý plán pro řešení požadavku uživatele.
  2. Sebekritika: Model je vyzván, aby „griloval“ svůj vlastní plán, identifikoval potenciální chyby, okrajové případy a implementační rizika. Může vypsat slabiny nebo si klást upřesňující otázky.
  3. Vylepšený výstup: Na základě kritiky model vytvoří robustnější, finální odpověď.

Tato technika je formou adversariálního plánování. Nutíte model, aby fungoval jako vlastní „red team“ a simuloval proces revize, který by normálně vyžadoval druhou osobu nebo samostatný krok ověření. Hypotézou je, že tento vnitřní dialog vede k promyšlenějšímu a správnějšímu výsledku, zejména u složitých úkolů, jako je návrh systémů nebo implementace algoritmů.

Právě tento vzor jsme se rozhodli otestovat. Když vývojáři žádají o recenzi dovednosti „karpathy claude skill review“, ptají se právě na tento mechanismus. Vede nucení modelu k sebekritice k měřitelně lepšímu kódu?

CLAUDE.md vs. SKILL.md: Zásadní rozdíl

Rozdíl mezi CLAUDE.md a SKILL.md není jen sémantický; je zásadní pro to, jak hodnotíme výkon.

A CLAUDE.md je manuální prompt. Jeho efektivita se může dramaticky lišit v závislosti na schopnosti uživatele jej přizpůsobit, specifikách jeho vstupu a stavu chatovací relace. Je to recept, ne nástroj. Recept nelze standardizovaným způsobem benchmarkovat.

A SKILL.md, jak je definován a používán v adresáři SkillProof, je kanonický, verzovaný soubor, který programově mění systémový prompt modelu. Když použijete dovednost z našeho adresáře, nainstaluje se jednou. Každý další požadavek na model pak těží z instrukcí této dovednosti (nebo je jimi naopak omezován), a to bez jakéhokoli ručního kopírování. To umožňuje opakovatelné, objektivní testování.

Celá naše metodika testování je postavena na tomto principu. Vezmeme SKILL.md, nainstalujeme ho a spustíme na sadě úkolů z reálného světa. Porovnáváme jeho výstup – z hlediska správnosti, efektivity a dodržení požadavků – s výstupem totožného modelu bez nainstalované dovednosti. Výsledné skóre je přímým měřítkem přidané (nebo odebrané) hodnoty dané dovednosti.

Pro toto šetření jsme netestovali přímo soubor Forresta Changa. Místo toho jsme z komunity získali několik dovedností, které formalizují vzor adversariálního plánování do znovupoužitelného formátu SKILL.md. To nám umožnilo odpovědět na otázku: plní samotný vzor, když je aplikován konzistentně, to, co slibuje?

Naše metodika testování adversariálních dovedností

Abychom provedli spravedlivou analýzu grill-me claude skill tested, vybrali jsme reprezentativní sadu úkolů, které jsou pro vývojáře běžným problémem a kde by teoreticky mohl vyniknout „přemýšlivější“ model:

  • Složitý refaktoring: Přepsání monolitické funkce s vysokou cyklomatickou složitostí na menší, testovatelné jednotky.
  • Generování API klienta: Napsání klientské knihovny pro středně složitou specifikaci OpenAPI, včetně zpracování chyb a modelů požadavků/odpovědí.
  • Implementace algoritmu: Implementace netriviálního algoritmu z textového popisu, jako je hledání cesty A* nebo prioritní fronta.
  • Generování unit testů: Napsání komplexní sady unit testů pro třídu s více závislostmi a okrajovými případy.

Pro každý úkol jsme provedli dva pokusy: jeden s čistým Claudem (základní model, bez dovednosti) a jeden s nainstalovanou dovedností pro adversariální plánování. Výstupy jsme bodovali na základě hodnotící tabulky, která zahrnuje funkční správnost, kvalitu kódu, úplnost a efektivitu. Konečné skóre dovednosti představuje její průměrnou změnu výkonu napříč všemi testovanými úkoly.

Tímto rigorózním procesem jsme vyhodnotili všech 1416 dovedností, které v současné době sledujeme v našem systému. Je to nepřehledné prostředí: pouze 889 (63 %) z těchto dovedností projde naším testem a poskytne čistý pozitivní přínos. Dalších 467 vyžaduje netriviální nastavení nebo jsou užitečné pouze ve velmi specifických kontextech. Adversariální dovednosti, které jsme testovali, spadaly do všech těchto kategorií.

Verdikt: Funguje dovednost inspirovaná Karpathym skutečně?

Odpověď je nejednoznačná. Efektivita vzoru adversariálního plánování je vysoce závislá na složitosti úkolu. Nejedná se o univerzální vylepšení. U některých úkolů je dokonce aktivně škodlivý.

Naše testy ukázaly jasný trend:

Typ úkolu Výkon čistého Claude Výkon s adversariální dovedností Verdikt
Jednoduchý boilerplate (např. React komponenta) Rychlý, 95% správnost Pomalejší, přehnaná kritika, 90% správnost Negativní dopad
Složitý refaktoring Často opomíjí okrajové případy Zachytí více okrajových případů, ale je rozvláčný Čistý přínos
Návrh algoritmu od nuly Náchylný k logickým mezerám Lepší logická struktura, pomalejší Čistý přínos
Ladění nejasných chyb Často navrhuje povrchní opravy Zkoumá hlubší příčiny Čistý přínos

U jednoduchých, dobře definovaných úkolů přidává adversariální vzor zbytečnou režii. Model spotřebovává tokeny a čas na kritiku plánu, který byl již dostatečný. V některých případech proces sebekritiky dokonce zanesl chyby, protože model si vymyslel nedostatky a následně je „opravil“, čímž rozbil naprosto funkční kód. Toto je klíčové zjištění pro každého, kdo se ptá, zda se karpathy claude md vyplatí pro každodenní kódování.

Avšak u složitých, otevřených úkolů – takových, které často zaskočí i juniorního vývojáře – poskytuje tento vzor měřitelný přínos. Když je model požádán o návrh systému nebo refaktoring spletitého staršího kódu, fáze sebekritiky ho nutí zvážit interakce a okrajové případy, které čistý Claude často opomíjí. Výsledný výstup je robustnější a vyžaduje méně lidských oprav, i když jeho generování trvá déle a je podstatně rozvláčnější.

Jedna z námi testovaných dovedností pro adversariální plánování jasně překonala základní model u otevřených úkolů návrhu systémů, ale dosáhla horšího skóre u generování jednoduchého boilerplate kódu. To zdůrazňuje potřebu používat správnou dovednost pro správný úkol, místo hledání jediného „božského promptu“, který by vládl všem.

Skryté náklady: Rozvláčnost a negativní skóre

Nejbezprostřednější nevýhodou tohoto vzoru je rozvláčnost. Odpověď od dovednosti využívající adversariální plánování může být 3-5x delší než odpověď od čistého Claude. Zahrnuje plán, úplnou kritiku a poté finální odpověď. Ačkoli mezikroky mohou poskytnout vhled do „myšlení“ modelu, zvyšují také spotřebu tokenů a kognitivní zátěž pro vývojáře, který to vše musí přečíst.

Ještě znepokojivější je riziko negativního výkonu. Špatně implementovaná dovednost je horší než žádná dovednost. Ve SkillProof není naším nejdůležitějším zjištěním seznam dovedností, které fungují, ale seznam těch, které nefungují. K dnešnímu dni dosáhlo 60 námi testovaných dovedností horšího skóre NEŽ čistý Claude. Aktivně snižují přesnost, efektivitu nebo spolehlivost modelu.

Několik námi testovaných dovedností pro adversariální plánování spadalo do této kategorie. Režim selhání byl konzistentní: fáze kritiky se zacyklila, nebo si „expertní persony“ navzájem odporovaly, což vedlo ke zmatenému a nesprávnému finálnímu výstupu. V jednom testu se dovednost zaměřená na optimalizaci SQL dotazů dostala do kritické smyčky, kde debatovala o výhodách JOIN vs. INNER JOIN (které jsou ve většině dialektů funkčně identické) a nakonec nevytvořila žádný dotaz.

Toto je realita ekosystému AI dovedností, která jde proti hypu. Popularita a hvězdičky na GitHubu nekorelují s výkonem. Chytrý vzor promptu může stejně tak uškodit, jako pomoci. Jediný způsob, jak to zjistit, je otestovat ho.

Vyplatí se tedy tento vzor?

Vraťme se k původní otázce. Vyplatí se vzor z CLAUDE.md inspirovaného Karpathym?

Jako nástroj pro učení, rozhodně ano. Pročítání Changova CLAUDE.md a podobných promptů je vynikající způsob, jak pochopit koncepty „chain-of-thought“ (myšlenkového řetězce) a sebekorekce. Manuální experimentování s ním vám může pomoci rozvinout lepší intuici pro psaní promptů.

Jako produkční nástroj ve formě nainstalovaného SKILL.md, je odpověď jednoznačné „záleží na okolnostech“. Naše data ukazují, že pro specifické, vysoce komplexní úkoly může být dobře implementovaná adversariální dovednost mocným nástrojem pro seniorní inženýry. Může fungovat jako neúnavný, logický oponent pro složité problémy. Pro každodenní kódování bude pravděpodobně pomalý, drahý a potenciálně kontraproduktivní.

To je přesně problém, k jehož řešení byl SkillProof vytvořen. Místo spoléhání se na hype nebo počet hvězdiček se můžete spolehnout na naše data. Oddělujeme dovednosti, které poskytují skutečné, měřitelné zlepšení, od těch, které jsou jen chytrými, ale neefektivními prompty.

Související články: podíl dovedností, které skutečně překonávají čistého Claude · jak testujeme každou dovednost před jejím zařazením.

Otestovali jsme desítky dovedností, které využívají adversariální plánování a další pokročilé techniky. Chcete-li zjistit, které z nich prošly našimi reálnými testy a získaly skóre SkillProof, můžete si prohlédnout kategorii Produktivita a workflow v našem adresáři. Nejvýkonnější dovednosti napříč všemi kategoriemi také sdružujeme do startovacího balíčku za 10$, který vám poskytne sadu ověřených nástrojů, jež skutečně fungují.

★ 9.6/10 × 3

Startovací balíček zdarma

3 skills s nejvyšším skóre z našich testů plus instalační checklist — sestava, kterou bychom nasadili na čistý stroj. Zdarma, e-mailem.

Jeden e-mail s balíčkem + krátký týdenní přehled nových výsledků testů. Odhlásit se můžete kdykoli.