Adresáře uvádí 23 000+ skillů pro Claude. Kolik jich funguje?

Adresáře uvádí 23 000+ skillů pro Claude. Kolik jich funguje?

Mimo Hype: Spustili jsme 1416 skillů pro Claude, abychom zjistili, kolik jich funguje

Pravděpodobně jste ta čísla viděli: titulky a adresáře inzerující přes 23 000 skillů pro Claude dostupných k instalaci. Toto číslo naznačuje rozsáhlý, vyspělý ekosystém nástrojů připravených rozšířit schopnosti základního modelu. Je to působivé číslo, ale vyvolává zásadní technickou otázku: co vlastně znamená „dostupný“? Ve většině případů to znamená, že byl ve veřejném repozitáři nalezen manifest SKILL.md. Je to počet založený na nalezení souboru, nikoli na funkčním ověření.

Tento přístup je jednoduchý, škálovatelný a v konečném důsledku zavádějící. Neříká nic o tom, zda se skill nainstaluje, poběží bez chyb nebo bude efektivně plnit svou inzerovanou funkci. Neřekne vám, zda se jedná o opuštěný projekt, nefunkční proof-of-concept, nebo dokonce zda funguje hůře než použití základního modelu bez skillu.

V SkillProof volíme jiný přístup. Nepočítáme repozitáře; instalujeme a spouštíme skilly oproti standardizované sadě reálných úkolů. Tento článek představuje naše zjištění z testování 1416 skillů. Je to přímá, daty podložená odpověď na otázku, kolik Claude code skills skutečně funguje, a zkoumání, zda jsou tržiště se skilly pro Claude spolehlivým zdrojem pro nástroje připravené k produkčnímu nasazení.

Chyba v pouhém počítání souborů

Základní problém s počtem 23 000+ skillů je, že považuje nalezení za ověření. Scrapování platforem jako GitHub pro soubory SKILL.md je triviální úkol. Výsledné číslo vypadá dobře v marketingu, ale je to jen prázdná metrika, která ignoruje realitu vývoje softwaru.

Repozitář obsahující manifest skillu je pouze výchozím bodem. Je to tvrzení, nikoli záruka. Když jsme začali systematicky testovat skilly, rychle jsme identifikovali běžné vzorce selhání, které prosté počítání souborů zcela míjí:

  • Neúplné nebo poškozené manifesty: Soubor SKILL.md existuje, ale chybí v něm povinné sekce, odkazuje na neexistující definice nástrojů nebo je syntakticky nesprávný. Skill nelze nainstalovat bez ruční opravy.
  • Nefunkční závislosti: Kód skillu se spoléhá na externí knihovny, které jsou zastaralé, obsahují breaking changes nebo již nejsou dostupné. Instalace může proběhnout úspěšně, ale skill selže za běhu.
  • Nedokumentované požadavky na prostředí: Skill může vyžadovat specifické proměnné prostředí, běžící lokální službu nebo autentizační tokeny, které nejsou zmíněny v dokumentaci. Jeden z testovaných skillů vyžadoval specifickou verzi databáze běžící na localhost:5433, což byl detail, který jsme objevili až při čtení jeho Python zdrojového kódu. Bez toho byl nefunkční.
  • Opuštěné projekty: Repozitář nebyl léta aktualizován. Kód byl napsán pro předchozí verzi Claude API a již není kompatibilní.
  • „Prompt-jako-Skill“: Některé skilly neobsahují žádné skutečné nástroje. Jsou to pouze propracované prompty zabalené do formátu skillu. Ačkoli mohou být potenciálně užitečné, nepředstavují funkční rozšíření schopností modelu a často nefungují lépe než dobře napsaný prompt.

Pouhé počítání těchto repozitářů nafukuje vnímanou velikost a zdraví ekosystému. Vytváří prostředí, kde je nalezení funkčního a spolehlivého nástroje otázkou pokusů a omylů. Naše metodika testování byla navržena specificky tak, aby tento šum odfiltrovala tím, že za primární měřítko platnosti skillu považuje jeho spuštění.

Naše zjištění: Střízlivý pohled na reálná čísla

Nainstalovali jsme a pokusili se spustit 1416 skillů pocházejících z různých veřejných adresářů a repozitářů. Každý skill byl podroben sérii automatizovaných testů navržených k vyvolání jeho klíčové funkcionality. Výsledky poskytují mnohem jasnější obraz o stavu ekosystému.

Z 1416 testovaných skillů pouze 889 (63 %) prošlo našimi úvodními testy spuštění bez jakéhokoli manuálního zásahu.

Zde je kompletní rozpis našich zjištění:

Stav Počet Procento z celku
Prošel (Funguje bez úprav) 889 63 %
Vyžaduje nastavení (Nutná manuální konfigurace) 467 33 %
Selhal (Funguje hůře než základní model) 60 4 %
Celkem testováno 1416 100 %

Pojďme analyzovat, co každá z těchto kategorií znamená pro vývojáře, který se snaží tyto nástroje použít.

Prošel (63 %): Tyto skilly se nainstalovaly správně a běžely na našem testovacím prostředí bez chyb. Toto je „reálný počet skillů v adresáři Claude“ z našeho vzorku – podmnožina skillů, které jsou okamžitě použitelné. To je základ, který by měl uživatel očekávat od jakéhokoli skillu uvedeného v adresáři. Jak si však ukážeme, „běží“ automaticky neznamená „vysoká kvalita“.

Vyžaduje nastavení (33 %): Toto je významná a často přehlížená kategorie. Těchto 467 skillů nebylo nefunkčních, ale nebyly typu plug-and-play. Běžné důvody zahrnovaly:

  • Vyžadovaly manuální nastavení API klíčů jako proměnných prostředí.
  • Potřebovaly se připojit k databázi poskytnuté uživatelem nebo ke službě třetí strany.
  • Závisely na lokálních souborech nebo systémových konfiguracích, které nebyly specifikovány v SKILL.md.

Například skill pro interakci s API pro řízení projektů je bez API klíče a URL endpointu k ničemu. Tyto skilly nejsou selháním, ale jejich uvádění bez jasných a předem daných instrukcí k nastavení je špatnou službou uživateli. Adresář, který nerozlišuje mezi skillem, který „prošel“, a skillem, který „vyžaduje nastavení“, představuje nespolehlivý obraz.

Selhal (4 %): Toto je nejznepokojivější kategorie. Těchto 60 skillů nejenže nesplnilo svou funkci, ale produkovalo výsledky, které byly aktivně horší než použití základního modelu bez skillu. To se stává, když je logika skillu chybná, což způsobí, že model:

  • Zasekne se ve smyčce a opakovaně se snaží volat nefunkční nástroj.
  • Halucinuje použití nástrojů, které v jeho vlastní definici neexistují.
  • Špatně interpretuje záměr uživatele a nesprávně použije nástroj, což vede k chybám nebo nesmyslnému výstupu.

Jeden z testovaných skillů byl navržen pro formátování úryvků kódu. Když dostal jednoduchou Python funkci, pokusil se zavolat nástroj format_javascript, selhal a vrátil chybovou zprávu. Stejný požadavek na čistý model Claude by vedl ke správně naformátovanému úryvku v Pythonu. Těchto 60 skillů není jen zbytečných; jsou škodlivé. Žádný seriózní adresář by je neměl uvádět bez jasného varování. Zveřejňujeme tato selhání, protože jsou kritickou součástí dat.

Více než jen spuštění: Co definuje kvalitu skillu?

Data ukazují, že zhruba dva ze tří skillů, které najdete, poběží. To ale odpovídá jen na první část otázky. Druhá, důležitější část se týká kvality. „Kvalita 23 000 skillů pro Claude“ není otázkou kvantity, ale výkonu.

Skill, který běží, ale svůj úkol plní špatně, je o málo lepší než ten, který neběží vůbec. Proto poté, co skill projde naším úvodním testem spuštění, hodnotíme ho na škále od 1 do 10 na základě jeho výkonu v sérii reálných úkolů. Naše kompletní metrika hodnocení je detailně popsána v naší metodice, ale soustředí se na několik klíčových principů:

  • Spolehlivost: Uspívá skill konzistentně ve svém deklarovaném úkolu? Používá pro danou práci správné nástroje?
  • Přesnost: Je výstup správný a bez chyb? Pokud interaguje s API, zpracovává data správně?
  • Efektivita: Řeší problém bez zbytečných kroků nebo volání nástrojů?
  • Korektní selhání: Když narazí na okrajový případ nebo neplatný vstup, vrátí užitečnou chybovou zprávu, nebo spadne?

Rozdíl mezi skillem s vysokým a nízkým hodnocením je markantní.

Skill s vysokým hodnocením, jako dobře postavený nástroj pro cloudovou infrastrukturu, správně interpretuje požadavek jako „vypiš všechny EC2 instance v us-east-1“, použije svůj nástroj list_instances se správným parametrem region, zpracuje stránkovanou odpověď z API a předloží uživateli čistý a přesný seznam.

Skill s nízkým hodnocením může mít stejný cíl, ale selže při provádění. Například jiný cloudový nástroj, který jsme testovali, ignoroval zadaný region a vypsal instance ze svého výchozího regionu. „Fungoval“ v tom smyslu, že nespadl, ale poskytl špatnou odpověď, což ho činí nespolehlivým.

Těch 60 skillů, které dosáhly horšího skóre než základní model, představuje absolutní dno. Jsou hmatatelným důkazem, že špatně navržený skill je horší než žádný. To je kritický datový bod, který se ztrácí, když adresáře upřednostňují velikost katalogu před ověřeným výkonem.

Hledání signálu v šumu

Rozdíl mezi inzerovanými 23 000+ skilly a naší 63% úspěšností v testech zdůrazňuje hlavní problém: ekosystém je plný šumu. Skutečný počet funkčních, vysoce kvalitních skillů je jen malým zlomkem inzerovaného celku.

Ruční testování každého skillu, který najdete, není pro žádného vývojáře praktické řešení. Proces je časově a zdrojově náročný. Náš test 1416 skillů vyžadoval značné inženýrské úsilí na vytvoření testovacího prostředí a podstatné výpočetní zdroje pro provedení hodnocení. To je přesně důvod, proč to většina adresářů nedělá. Je mnohem snazší spustit scraper a publikovat velké, neověřené číslo.

Cílem adresáře skillů by mělo být odfiltrování signálu od šumu. Měl by provádět ověřovací práci za uživatele. To znamená:

  1. Spuštění každého skillu: Skill není „ověřený“, dokud nebyl spuštěn.
  2. Testování správnosti: Skill musí být hodnocen na reálných úkolech, aby se zjistilo, zda funguje tak, jak je inzerováno.
  3. Zveřejňování selhání: Adresář, který neukazuje, co selhalo, skrývá polovinu příběhu. Data o selháních jsou stejně důležitá jako data o úspěších.

Testováním skillů napříč desítkami kategorií, od datové analýzy po webový vývoj, vytváříme mapu toho, co funguje, co potřebuje doladit a čemu se zcela vyhnout.

Tento daty řízený přístup je jediným spolehlivým způsobem, jak odpovědět na otázku: „Jsou tržiště se skilly pro Claude spolehlivá?“ Odpověď zní: jsou spolehlivá jen tak, jak spolehlivý je jejich ověřovací proces. Tržiště, které je jen seznamem repozitářů, není spolehlivým zdrojem profesionálních nástrojů. Adresář, který spouští, testuje a hodnotí každou položku, poskytuje základ důvěry.

Související články: kolik jich skutečně překoná základní model · naše metodika testování.

Tuto práci jsme provedli napříč celým naším katalogem. Těch 889 skillů, které prošly našimi testy, je k dispozici k procházení, včetně jejich hodnocení a verdiktu o výkonu. Pro vývojáře, kteří potřebují základní sadu ověřených nástrojů, nabízíme kurátorovaný balíček našich nejlépe hodnocených skillů za 10 $, u kterých je zaručeno, že poběží a budou fungovat podle očekávání. Toto je naše řešení problému signálu a šumu: malá, ověřená, vysoce kvalitní podmnožina masivního, neověřeného veřejného ekosystému.

★ 9.6/10 × 3

Startovací balíček zdarma

3 skills s nejvyšším skóre z našich testů plus instalační checklist — sestava, kterou bychom nasadili na čistý stroj. Zdarma, e-mailem.

Jeden e-mail s balíčkem + krátký týdenní přehled nových výsledků testů. Odhlásit se můžete kdykoli.