Proč polovina Claude skillů nefunguje – data z testů

Proč polovina Claude skillů nefunguje – data z testů

Pokud jsi hledal/a "claude skill nefunguje", tady je krátká verze: pravděpodobně za to nemůžeš ty. Každý skill, který uvádíme, nainstalujeme a otestujeme na čistém prostředí podle instrukcí samotného autora a výsledek pak porovnáme s Claudem bez jakéhokoli skillu. Vzorce selhání jsou natolik konzistentní, že je dokážeme seřadit podle četnosti.

Delší verze má čísla a každé z nich je spočítané z našich veřejných testovacích dat. Náš katalog má momentálně 73 skillů. 45 prošlo celým protokolem, 28 čeká ve frontě na test. Z 45 testovaných jich 35 získalo čisté hodnocení "prošel". Zbylých 10, tedy 22 %, dostalo verdikt "funguje po doladění" – to znamená, že skill tak, jak byl publikován, nefungoval a museli jsme zasáhnout: doinstalovat chybějící závislost, zapojit MCP připojení nebo doplnit konfiguraci, kterou README vůbec nezmiňovalo. V celém katalogu tak zůstává 35 ze 73 skillů, 48 %, s dnešním verdiktem "otestováno, funguje". Těsně pod polovinou. Odtud název článku.

A i to problém podhodnocuje, protože 45 testovaných skillů jsou už survivoři. Náš crawler prohledává GitHub každých 12 hodin a do fronty k objevení zařadil 267 repozitářů. Skilly, které jsou opuštěné, duplicitní nebo zjevně rozbité, vypadnou už při prvním třídění a k ohodnocenému testu se nikdy nedostanou. Vzorce selhání níže jsou to, co nacházíme u skillů dost dobrých na to, aby stálo za to je testovat.

Čísla, než začne vyprávění

Naše skóre má 25 bodů rozdělených do čtyř kritérií: čistá instalace (5), spolehlivé spouštění (5), výstup vs. základ (10), dokumentace a upřímnost (5), normalizováno na stupnici 0–10. Takto dopadlo 45 testovaných skillů v každém kritériu:

Kritérium Plný počet bodů Ztratil aspoň bod Skóre 3/5 nebo horší
Čistá instalace (/5) 34 z 45 11 (24 %) 8 (18 %)
Spolehlivé spouštění (/5) 14 z 45 31 (69 %) 0
Výstup vs. základ (/10) 2 z 45 na 10 5 uvízlo na dně 7/10
Dokumentace a upřímnost (/5) 5 z 45 40 (89 %) 12 (27 %)

Ani jeden z 45 skillů nedostal plných 25 bodů. Celkové skóre se pohybuje od 6,8 do 9,6 z 10, s mediánem 8,4, a 9 ze 45 skončilo pod 8,0. Čtyři vzorce selhání odpovídají čtyřem řádkům tabulky.

Vzorec selhání č. 1: popis triggeru, který se nikdy nespustí

Tohle je nejrozšířenější defekt v našich datech. Jen 14 ze 45 testovaných skillů, 31 %, dostalo plných 5/5 za "spolehlivé spouštění". Zbylých 31 se spouští nekonzistentně: buď minou formulace, které by měly zachytit, nebo se aktivují u nesouvisející práce. Všimni si ale nuly v posledním sloupci tabulky. Žádný testovaný skill nedostal pod 4/5 za spouštění, a to je survivorship bias, ne kvalita. Skill, jehož trigger je úplně mrtvý, se odchytí už při prvním třídění a skóre vůbec nedostane. Ty, které se dostanou k testování, jen chybují.

Mechanismus je neefektní. Když pošleš prompt, Claude rozhoduje, jestli má skill načíst, na základě jedné jediné věci: pole description ve frontmatteru SKILL.md. Ne README, ne kódu, ne 400 řádků pečlivých instrukcí pod frontmatterem. Pokud popis nepropojí tvá slova s úkolem skillu, skill jen sedí ve tvém adresáři a nic nedělá – a ty dojdeš k závěru, že Claude skilly nefungují.

Autoři pořád píšou toto pole, jako by šlo o vstupní stránku webu. Dvě anonymizované dvojice z našeho testování, lehce parafrázované:

Popis, který se nikdy nespustí:

"Nakopni svůj content workflow s AI-powered writing intelligence. Piš líp, rychleji, chytřeji."

Stejná práce, napsaná skillem, který dostal 5/5 za spouštění:

"Použij, když uživatel chce vytvořit, přečíst nebo upravit Word dokument (.docx). Spusť se při jakékoli zmínce 'Word dokument', '.docx' nebo požadavku na zprávu, memo či dopis jako Word soubor. Nepoužívej pro PDF nebo tabulky."

Ještě jeden příklad, z datové kategorie:

"Tvůj ultimátní SQL asistent na úplně všechno kolem dat."

Versus:

"Použij, když uživatel chce napsat, odladit nebo optimalizovat SQL dotaz, jmenuje tabulku či schéma, nebo vloží chybu z dotazu. Nespouštěj se u obecných otázek o datech bez konkrétního dotazu."

Rozdíl není v spisovatelském talentu. Dobré popisy pojmenovávají přesné fráze, které by uživatel napsal, a říkají, kdy se nemají spustit. V našem protokolu testujeme oba směry: prompty, které skill tvrdí, že zvládá, blízké formulace a záměrně nesouvisející požadavky. Většina hodnocení 4/5 pochází ze skillů, které projdou první kontrolou a zakopnou o druhou nebo třetí.

Tohle si můžeš ověřit ještě před instalací. SKILL.md je obyčejný markdown, čitelný přímo na GitHubu. Pokud by popis mohl fungovat jako billboard, skill bude podvýkonný. Pokud ladíš vlastní skill, vlož ho do našeho bezplatného validátoru skillů, který odhalí marketingové formulace i strukturální problémy.

Vzorec selhání č. 2: hniloba instalace

Všech 10 našich verdiktů "funguje po doladění" jsou nějaký typ selhání instalace. Vzorec je vidět čistě v číslech: skilly, které prošly bez zásahu, mají v průměru 4,97 z 5 bodů za instalaci. Skilly s verdiktem "po doladění" v průměru jen 3,2.

Co se konkrétně rozbilo, podle našich testovacích poznámek:

  • Nedeklarované závislosti na jiných skillech. Skill na extrakci dat z faktur, který potichu vyžaduje předchozí instalaci PDF skillu pro naskenované dokumenty, plus jednořádkovou úpravu lokalizace pro evropský formát data, kterou README vůbec nezmiňuje. Výstup byl po rozlousknutí problému opravdu dobrý (8/10). Rozlousknutí zabralo celý večer.
  • Nedeklarované závislosti na službách. Plánovací skill, který je jen poradní, dokud nepřipojíš MCP kalendáře. Skill na třídění inboxu, který potřebuje napojený Gmail nebo Outlook. Metrický skill, který předpokládá existenci exportu z analytiky. Žádný z těchto požadavků není nepřiměřený. Všechny ale patří na první řádek README, ne do supportního ticketu.
  • Špatná hloubka adresáře. Klasika. Instrukce, které nechají skill na skills/nazev/nazev/SKILL.md, o úroveň hlouběji, kde ho Claude nikdy nenajde. Skill se "nainstaluje" bez chybové hlášky a pak se nikdy nespustí, což tě pošle honit vzorec selhání č. 1, i když skutečný problém je v cestě.
  • Instrukce psané pro starší Claude Code. Git-workflow je mírný případ: commity a správa větví fungují ihned, ale návod na interaktivní rebase počítá se schopnostmi, které Claude Code záměrně blokuje, takže tyhle kroky musíš dělat ručně.

Jedna poctivá výjimka stojí za zmínku: brand-guidelines má verdikt "po doladění", protože je k ničemu, dokud nevyplníš vlastní brand paletu a tón hlasu – a přímo to tak píše. Doladění podle záměru je v pořádku. Doladění kvůli opomenutí je vzorec selhání.

Poznávací znamení ještě před instalací: README, jehož instalační sekce má jeden vágní řádek. Porovnej to s instalačním blokem u libovolného skillu s hodnocením 5/5, třeba DOCX. Konkrétní příkazy, konkrétní cesty, uvedené prerekvizity. Má dva řádky, protože dva řádky jsou vše, co funkční instalace potřebuje.

Vzorec selhání č. 3: skill se spustí a nic se nezlepší

Nejjemnější selhání, a důvod, proč naše hodnocení váží výstup vs. základ na 10 z 25 bodů, dvojnásobek jakéhokoli jiného kritéria. Test je přímočarý: pustíme stejný reálný úkol dvakrát, jednou se skillem, jednou bez, a porovnáme. Skill musí porazit holého Clauda, jinak nemá důvod zabírat kontext.

Dno v našem testovaném vzorku je 7/10 a přesně na něm sedí pět skillů. To znamená, že i mezi skilly, které projdou, zhruba jeden z devíti přináší zlepšení, které bys bez porovnání vedle sebe ani nepostřehl/a. Pod 7 bodů se skilly do listingu vůbec nedostanou a fronta objevených kandidátů je jich plná: "vylepšovače psaní" v kategoriích, kde je základní model už silný, a skilly, které jsou jen jeden systémový prompt říkající v podstatě "buď skvělý".

Jen dva skilly získaly 10/10 za výstup a ukazují, jak vypadá zasloužený rozdíl. Frontend-design dostal stejné zadání na landing page se skillem i bez něj; verze se skillem měla skutečnou typografickou škálu a promyšlenou paletu, bez neonových přechodů typických pro výchozí výstup. Humanizer odstranil nadužívání pomlček a slovník typu "ponořit se do" z AI konceptů natolik důkladně, že dva editoři nedokázali spolehlivě poznat, že jde o text s pomocí AI. Devatenáct ze 45 skillů dostalo za výstup 9 nebo víc. Koncept skillů funguje. Jen ne automaticky.

STARTOVACÍ BALÍČEK ZDARMA

Všechny 3 skilly v našem startovacím balíčku porazily základ v testování, což je laťka, na které padne většina. Pošleme ti je e-mailem spolu s instalačním checklistem, který používáme u každého testu. Zdarma.

Získat startovací balíček zdarma

Vzorec selhání č. 4: README slibuje víc, než skill dokáže splnit

Dokumentace a upřímnost je nejslabší kritérium v celém datasetu. Jen 5 ze 45 skillů dostalo 5/5. Čtyřicet ztratilo body, 12 mělo 3/5. Zopakujme: mediánový testovaný skill má lepší výstup než dokumentaci.

Co tady nejčastěji stojí body, seřazeno podle četnosti:

  • Sliby, které test vyvrátí. README tvrdící "funguje s libovolným formátem faktury", zatímco skill potřebuje nastavení lokalizace pro neamerické datumy. Pitch "kompletní git automatizace" u skillu, který v Claude Code vůbec neumí interaktivní rebase. Většinou to nepovažujeme za lež. Považujeme to za to, že autoři popisují skill, který chtěli napsat, ne ten, který skutečně napsali.
  • Chybějící prerekvizity. Každá nedeklarovaná závislost ze vzorce selhání č. 2 je zároveň selhání dokumentace, proto skilly s verdiktem "po doladění" mají v průměru 3,4/5 za dokumentaci, zatímco čisté průchody 3,97.
  • Mlčení o chování, o kterém bys chtěl/a vědět. Jestli skill "volá domů", co dělá s obsahem tvých souborů, na jakých verzích modelu byl psaný. Vzácné, ale závažné případy – skryté síťové volání nebo instrukce ve stylu prompt injection zakopané uprostřed souboru – jsou důvod, proč toto kritérium vůbec existuje. Každý SKILL.md, který uvádíme, čteme od začátku do konce. Měl/a bys to samé dělat u čehokoli mimo otestovaný adresář.

Regresi jsme nespočítali, ale neformální pozorování platí napříč 45 testy: počet odznaků v README a kvalita instalační sekce se pohybují opačným směrem.

Co dělá špičková vrstva jinak

Šest skillů, 13 % ze všeho, co jsme testovali, sdílí nejvyšší skóre 9,6/10: DOCX, skill-creator a frontend-design z oficiálního repozitáře Anthropicu, test-driven-development a systematic-debugging z kolekce Jesseho Vincenta Superpowers a humanizer z komunity. Dalších šest, včetně xlsx, pdf a sql-queries, má 9,2. Co má špičková vrstva společné, se dá ověřit:

Perfektní instalace a perfektní spouštění, bez výjimky. Všech šest dostalo 5/5 na obojí. Ať šla kreativní energie kamkoli, rozhodně ne do popisu; ty čte jako specifikace, s explicitními spouštěcími frázemi a explicitními výjimkami.

Zaměřeno na to, v čem je základní model slabý. Claude nepotřebuje skill, aby psal prózu. Potřebuje ho, aby vytvořil skutečný .docx se styly a sledovanými změnami, nebo aby přestal "opravovat" race condition hádáním. Systematic-debugging si vysloužil skóre na bugu, který Claude předtím třikrát "opravil", aniž by ho opravdu opravil; smyčka hypotéza-test-ověření hádání ukončila. Každý špičkový skill cílí na mezeru, kterou dokážeš pojmenovat jednou větou.

Dokumentace, která nepřehání. Nejnižší skóre za dokumentaci mezi těmito šesti je 4. Jejich README uvádí prerekvizity a přiznává limity; adjektiv je málo. Ukazuje se, že autoři, kteří testují vlastní instalační instrukce, taky píšou popisy, které se spouští. Řemeslná zručnost koreluje sama se sebou.

Za zmínku stojí i to, že pedigree pomáhá, ale nerozhoduje. Deset z jedenácti skillů od Anthropicu, které jsme testovali, prošlo čistě, a výjimka je "po doladění" záměrně. Ale třetina špičkové vrstvy je jeden komunitní autor, kterému na tom záleželo, a spousta komunitních skillů překonává oficiální ve své kategorii. Nejvíce ohvězdičkovaný repozitář v naší frontě objevování má přes 85 000 hvězd a pořád žádný verdikt, protože hvězdy nejsou test.

Pokud vybíráš skilly

Používej otestované. To je sebestředná věta na webu, jehož celý produkt je testování skillů, tak tady je logika, kterou si můžeš ověřit sám/sama: čtyři vzorce selhání výše jsou v GitHub listingu neviditelné. Počet hvězd měří marketingový dosah. README měří autorův optimismus. Jediný způsob, jak zjistit, jestli skill poráží základ, je spustit ten základ, což nám zabere zhruba večer na skill, krát 45 zatím otestovaných.

Začni nejlepšími skilly roku 2026 pro žebříček napříč kategoriemi, nebo jdi rovnou do své kategorie, například nejlepší skilly pro programování. Každý záznam odkazuje na testovací poznámky, včetně obchodů, které skilly potřebující doladění vyžadují.

SKILLPROOF BALÍČEK

Optimizer Pack je to, jak vypadá otestovaná vrstva v praxi: čtyři skilly na efektivitu, které prošly celým protokolem, předkonfigurované tak, aby výše popsaná selhání instalace nemohla nastat. Ušetři si ten večer třídění.

Získat Optimizer Pack – 10 $

Pokud skill píšeš

Vzorce selhání fungují zároveň jako checklist a tři ze čtyř se dají levně obejít.

Piš popis jako specifikaci triggeru: fráze, které by uživatel napsal, plus co má skill ignorovat. Pak otestuj instalační instrukce na stroji, který není tvůj, nebo aspoň v čistém adresáři, a deklaruj každou závislost, včetně jiných skillů a MCP připojení. Před publikací spusť náš validátor skillů; během pár vteřin odhalí strukturální problémy i problém billboardového popisu. Kompletní návod, od frontmatteru po publikaci, najdeš v článku jak napsat vlastní Claude skill.

Čtvrtý vzorec selhání, porazit základ, je ten, který vyžaduje skutečné přemýšlení. Než cokoli napíšeš, pusť svůj cílový úkol přes Clauda bez skillu. Pokud je výstup už v pořádku, nemáš skill, máš readme pro funkci, kterou Claude umí z výroby. Vrstva 9,6 existuje, protože její autoři našli skutečné mezery. Ironicky, nejlepší nástroj na tuhle práci je sám skill: skill-creator nám v jedné session vytvořil funkční interní skill a jeho krok optimalizace popisu měřitelně zlepšil spouštění v našem testu.

Nepříjemná část

Nic v těchto datech neříká, že ekosystém je špatný. Říká, že ekosystém je nezrecenzovaný, což je jiný problém se známým tvarem. Prohlížečová rozšíření kolem roku 2010, npm kolem roku 2016: nízká bariéra pro publikování plus žádná vrstva ověřování produkuje katalog, kde je mediánová položka průměrná, ty nejlepší jsou opravdu výborné a žádný povrchový signál je od sebe neodliší. Skilly, které padnou u naší instalační kontroly, mají stovky hvězd. Dva z našich šesti nejlépe hodnocených pocházejí z repozitářů, o kterých většina lidí nikdy neslyšela.

Obvyklá náprava nakonec přijde, nějaká kombinace recenzních vrstev a reputace. Než k tomu dojde, břemeno leží na tom, kdo instaluje, a čísla výše jsou to, jak to břemeno vypadá: 22 % testovaných skillů rozbitých už z výroby, 69 % s nedokonalým spouštěním, 89 % s dokumentací, která ztratila body. My budeme data publikovat dál tak jako tak. Celý protokol a hodnoticí systém jsou na stránce metodologie a každé číslo v tomto článku je reprodukovatelné z testovacích poznámek jednotlivých skillů.

Časté dotazy

Proč se můj Claude skill nespouští?

Zkontroluj tři věci v tomto pořadí. Nejdřív cestu: SKILL.md musí být na ~/.claude/skills/<nazev>/SKILL.md, ne o adresář hlouběji; špatně vnořený skill selže potichu. Za druhé popis ve frontmatteru: pokud zní jako slogan, Claude nemá s čím porovnávat tvůj prompt. Přepiš ho tak, aby pojmenovával přesné fráze, které opravdu píšeš, nebo ho pusť přes validátor skillů. Za třetí, napiš prompt slovy přímo z popisu; pokud se to spustí, problém je v pokrytí popisu.

Jak rozhodujete, že skill "funguje"?

Čistá instalace na čistém prostředí podle vlastních instrukcí autora, kontrola spouštění oběma směry (spustí se u deklarovaných promptů, mlčí u nesouvisejících) a reálný úkol ohodnocený proti základu bez skillu, v hodnotě 10 z 25 bodů. Verdikty: prošel, funguje po doladění, nebo zatím ve frontě. Stránka metodologie má hodnoticí systém, každá stránka skillu má poznámky.

Jsou oficiální skilly od Anthropicu spolehlivější než komunitní?

V průměru ano: 10 z 11, které jsme testovali, prošlo čistě, a výjimka (brand-guidelines) vyžaduje konfiguraci záměrně. Ale průměr není to zajímavé číslo. Dva z našich šesti nejlépe hodnocených skillů pocházejí z repozitáře jednoho komunitního autora a humanizer, komunitní skill, je jeden ze dvou jediných skillů s 10/10 za výstup. Výsledky testů porážejí původ.

Znamenají tyto výsledky, že bych se měl/a Claude skillům vyhýbat?

Naopak. Otestovaná vrstva je tiše excelentní: 19 ze 45 skillů dostalo za výstup vs. základ 9 nebo víc a špičková šestice je rozdíl mezi Claudem jako chatovacím oknem a Claudem jako nástrojem, který produkuje hotovou práci. Zjištění je užší než "skilly nefungují". Je to spíš to, že polovina publikovaného má defekt, který z listingu nevidíš, takže instaluj podle testovacích dat, ne podle hvězd.

★ 9.6/10 × 3

Startovací balíček zdarma

3 skills s nejvyšším skóre z našich testů plus instalační checklist — sestava, kterou bychom nasadili na čistý stroj. Zdarma, e-mailem.

Jeden e-mail s balíčkem + krátký týdenní přehled nových výsledků testů. Odhlásit se můžete kdykoli.