
Dlaczego połowa skilli Claude nie działa — dane z testów
Jeśli szukałeś "claude skill nie działa", oto krótka wersja: to prawdopodobnie nie twoja wina. Instalujemy i testujemy każdy skill z naszego katalogu, na czystym środowisku, dokładnie według instrukcji autora, a potem oceniamy wynik względem Claude bez żadnego skilla. Wzorce awarii są na tyle spójne, że możemy je już uszeregować według częstotliwości.
Dłuższa wersja ma liczby, a każda z nich jest policzona na podstawie naszych publicznych danych testowych. Nasz katalog liczy obecnie 73 skille. 45 przeszło pełny protokół; 28 wciąż czeka w kolejce testowej. Z 45 przetestowanych 35 dostało czysty pass. Pozostałe 10, czyli 22%, otrzymało werdykt "działa po konfiguracji", co oznacza, że skill w takiej formie, w jakiej został wydany, nie działał i musieliśmy interweniować: doinstalować brakującą zależność, podpiąć połączenie MCP albo uzupełnić konfigurację, o której README nawet nie wspominało. W całym katalogu daje to 35 z 73 skilli, czyli 48%, z werdyktem "przetestowany, działa" na dziś. Odrobinę mniej niż połowa. Stąd tytuł.
I to jeszcze zaniża skalę problemu, bo 45 przetestowanych skilli to już ocaleńcy. Nasz crawler przeczesuje GitHuba co 12 godzin i wrzucił do kolejki odkryć 267 repozytoriów. Skille porzucone, zduplikowane albo ewidentnie zepsute odpadają na etapie wstępnej selekcji i nigdy nie trafiają do ocenianego testu. Poniższe tryby awarii to to, co znajdujemy w skillach na tyle dobrych, że w ogóle warto je testować.
Liczby, zanim zacznie się opowieść
Nasz wynik to 25 punktów w czterech kryteriach: czysta instalacja (5), niezawodne wyzwalanie (5), jakość wyniku vs. baza odniesienia (10), dokumentacja i uczciwość (5), znormalizowane do skali 10. Oto jak 45 przetestowanych skilli wypadło w każdym z nich:
| Kryterium | Perfekcyjny wynik | Ucięty co najmniej punkt | Ocena 3/5 lub gorzej |
|---|---|---|---|
| Czysta instalacja (/5) | 34 z 45 | 11 (24%) | 8 (18%) |
| Niezawodne wyzwalanie (/5) | 14 z 45 | 31 (69%) | 0 |
| Wynik vs. baza odniesienia (/10) | 2 z 45 na 10 | — | 5 utknęło na poziomie 7/10 |
| Dokumentacja i uczciwość (/5) | 5 z 45 | 40 (89%) | 12 (27%) |
Ani jeden z 45 skilli nie zdobył perfekcyjnych 25 punktów. Wyniki ogólne wahają się od 6,8 do 9,6 na 10, mediana to 8,4, a 9 z 45 leży poniżej 8,0. Cztery tryby awarii odpowiadają czterem wierszom tej tabeli.
Tryb awarii 1: opis wyzwalacza, który nigdy nie odpala
To najbardziej rozpowszechniony defekt w naszych danych. Tylko 14 z 45 przetestowanych skilli, 31%, zdobyło perfekcyjne 5/5 za "niezawodne wyzwalanie". Pozostałe 31 odpala się niekonsekwentnie: pomija sformułowania, które powinno łapać, albo aktywuje się przy niepowiązanych zadaniach. Zwróć jednak uwagę na zero w ostatniej kolumnie tej tabeli. Żaden testowany skill nie zdobył poniżej 4/5 za wyzwalanie, a to jest efekt przetrwania, nie jakości. Skill, którego wyzwalacz jest całkowicie martwy, zostaje wyłapany na etapie wstępnej selekcji i nigdy nie dostaje oceny. Te, które docierają do testowania, po prostu odpalają się nierówno.
Mechanizm jest niezbyt efektowny. Kiedy wysyłasz prompt, Claude decyduje, czy załadować skill, na podstawie jednej rzeczy: pola description we frontmatterze SKILL.md. Nie README, nie kodu, nie 400 linii starannych instrukcji poniżej frontmattera. Jeśli opis nie łączy twoich słów z zadaniem skilla, skill siedzi w twoim katalogu i nic nie robi, a ty wyciągasz wniosek, że skille Claude nie działają.
Autorzy wciąż piszą to pole tak, jakby to była strona lądowania. Dwie zanonimizowane pary z naszych testów, lekko sparafrazowane:
Opis, który nigdy się nie odpala:
"Naładuj swój content workflow inteligencją pisania napędzaną AI. Pisz lepiej, szybciej, mądrzej."
To samo zadanie, napisane przez skill, który dostał 5/5 za wyzwalanie:
"Use when the user wants to create, read, or edit Word documents (.docx). Trigger on any mention of 'Word doc', '.docx', or a request for a report, memo, or letter as a Word file. Do not use for PDFs or spreadsheets."
Jeszcze jeden, z kategorii danych:
"Twój ostateczny asystent SQL do wszystkiego, co związane z danymi."
Kontra:
"Use when the user asks to write, debug, or optimize a SQL query, names a table or schema, or pastes a query error. Do not trigger on general data questions with no query involved."
Różnica to nie talent pisarski. Dobre opisy nazywają dokładne frazy, które wpisałby użytkownik, i mówią, kiedy skill NIE powinien się odpalać. W naszym protokole testujemy obie strony: prompty, które skill deklaruje obsługiwać, pokrewne sformułowania i celowo niepowiązane prośby. Większość ocen 4/5 pochodzi ze skilli, które przechodzą pierwszy test i potykają się na drugim albo trzecim.
Możesz to sprawdzić, zanim cokolwiek zainstalujesz. SKILL.md to zwykły markdown, czytelny na GitHubie. Jeśli opis mógłby posłużyć za billboard, skill będzie działał słabiej. Jeśli debugujesz własny, wklej go do naszego darmowego walidatora skilli, który wyłapuje marketingowe opisy razem z problemami strukturalnymi.
Tryb awarii 2: gnicie instalacji
Wszystkie 10 naszych werdyktów "działa po konfiguracji" to awarie instalacji tego czy innego rodzaju. Wzorzec widać wyraźnie w ocenach: skille, które przeszły od razu, mają średnio 4,97 na 5 za instalację. Skille z werdyktem "po konfiguracji" — 3,2.
Co realnie się psuło, z naszych notatek testowych:
- Niezadeklarowane zależności między skillami. Skill do ekstrakcji faktur, który po cichu wymaga wcześniejszej instalacji skilla PDF do dokumentów skanowanych, plus jednolinijkowej edycji locale dla europejskich formatów dat, o czym README nie wspomina. Wynik był naprawdę dobry (8/10), gdy już to rozgryźliśmy. Rozgryzanie zajęło cały wieczór.
- Niezadeklarowane zależności serwisowe. Skill do harmonogramowania, który jest tylko doradczy, dopóki nie podepniesz MCP do kalendarza. Skill do porządkowania skrzynki, który potrzebuje podłączonego Gmaila albo Outlooka. Skill do metryk, który zakłada istnienie eksportu z analityki. Żadne z tych wymagań nie jest nierozsądne. Wszystkie powinny być w pierwszej linijce README, nie w zgłoszeniu supportowym.
- Zła głębokość katalogu. Klasyk. Instrukcje, które zostawiają skill w
skills/name/name/SKILL.md, jeden poziom za głęboko, gdzie Claude nigdy go nie znajdzie. Skill "instaluje się" bez komunikatu błędu, a potem nigdy się nie odpala, co wysyła cię w pogoń za trybem awarii 1, choć prawdziwym problemem jest ścieżka. - Instrukcje pisane pod starszą wersję Claude Code. Git-workflow to łagodny przypadek: commity i zarządzanie branchami działają od razu, ale wskazówki dotyczące interaktywnego rebase'a zakładają możliwości, które Claude Code celowo blokuje, więc te kroki trzeba wykonać ręcznie samemu.
Jeden uczciwy wyjątek wart wymienienia: brand-guidelines dostaje werdykt "po konfiguracji", bo jest bezużyteczny, dopóki nie uzupełnisz własnej palety marki i tonu głosu, i mówi o tym wprost. Konfiguracja z założenia jest w porządku. Konfiguracja przez przemilczenie to tryb awarii.
Sygnał ostrzegawczy przed instalacją: README, którego sekcja instalacji to jedna mętna linijka. Porównaj to z blokiem instalacyjnym dowolnego skilla, który dostał 5/5, jak DOCX. Konkretne komendy, konkretne ścieżki, wymienione wymagania wstępne. Ma dwie linijki, bo dwie linijki to wszystko, czego potrzebuje działająca instalacja.
Tryb awarii 3: skill się odpala i nic się nie poprawia
Najsubtelniejsza awaria i powód, dla którego nasz system oceniania waży wynik vs. bazę odniesienia na 10 z 25 punktów, dwa razy więcej niż jakiekolwiek inne kryterium. Test jest prosty: uruchamiamy to samo realne zadanie dwa razy, raz z zainstalowanym skillem i raz bez, i porównujemy. Skill musi pokonać nagiego Claude, inaczej nie ma powodu, żeby zajmować kontekst.
Dolna granica w naszym przetestowanym zbiorze to 7/10, i pięć skilli siedzi dokładnie na niej. To oznacza, że nawet wśród skilli, które przechodzą test, mniej więcej co dziewiąty dostarcza poprawę, którą trzeba by zobaczyć obok siebie, żeby ją w ogóle zauważyć. Poniżej 7 skille nie przetrwają do wpisu na listę, a kolejka odkryć jest pełna kandydatów w tym przedziale: skille "poprawiające pisanie" w kategoriach, gdzie model bazowy jest już mocny, oraz skille, które są jednym system promptem mówiącym, w gruncie rzeczy, bądź świetny.
Tylko dwa skille zdobyły 10/10 za wynik, i pokazują, jak wygląda zasłużona różnica. Frontend-design dostał ten sam brief na landing page z i bez skilla; wersja ze skillem miała realną skalę typograficzną i przemyślaną paletę, i żadnych neonowo-gradientowych tików charakterystycznych dla domyślnego wyniku. Humanizer usunął nadużywanie pauz i słownictwo klasy "zgłębiać" z draftów AI na tyle dokładnie, że dwóch redaktorów nie potrafiło wiarygodnie oznaczyć wyniku jako wspomaganego przez AI. Dziewiętnaście z 45 skilli dostało 9 lub więcej za wynik. Koncepcja skilli działa. Tylko nie działa automatycznie.
DARMOWY PAKIET STARTOWY
Wszystkie 3 skille w naszym darmowym pakiecie startowym pokonały bazę odniesienia w testach, a to poprzeczka, której większość nie przeskakuje. Wyślemy ci je mailem razem z checklistą instalacyjną, której używamy przy każdym teście. Za darmo.
Odbierz darmowy pakiet startowyTryb awarii 4: README wypisuje czeki, których skill nie może pokryć
Dokumentacja i uczciwość to najsłabsze kryterium w całym zbiorze danych. Pięć z 45 skilli dostało 5/5. Czterdzieści straciło punkty, a 12 dostało 3/5. Powtórzmy: przeciętny testowany skill ma lepszy wynik niż dokumentację.
Co najczęściej kosztuje punkty, w kolejności częstotliwości:
- Obietnice, którym test przeczy. README, które twierdzi "działa z dowolnym formatem faktur", podczas gdy skill potrzebuje ustawienia locale dla dat spoza USA. Pitch "pełnej automatyzacji gita" na skillu, który w ogóle nie potrafi wykonać interaktywnego rebase'a w Claude Code. Zwykle nie traktujemy tego jako kłamstwa. Traktujemy to jako autorów dokumentujących skill, który zamierzali napisać, a nie ten, który faktycznie napisali.
- Brakujące wymagania wstępne. Każda niezadeklarowana zależność z trybu awarii 2 to też awaria dokumentacyjna, dlatego skille z werdyktem "po konfiguracji" mają średnio 3,4/5 za dokumentację, podczas gdy te, które przeszły od razu, mają 3,97.
- Milczenie o zachowaniu, o którym chciałbyś wiedzieć. Czy skill dzwoni do domu, co robi z zawartością twoich plików, pod jakie wersje modelu został napisany. Rzadkie, ale poważne przypadki, ukryte wywołania sieciowe albo instrukcje w kształcie prompt injection zakopane w środku pliku, to powód, dla którego to kryterium w ogóle istnieje. Czytamy każdy SKILL.md, który wpisujemy na listę, od góry do dołu. Powinieneś robić to samo z czymkolwiek spoza przetestowanego katalogu.
Nie przeprowadziliśmy regresji, ale nieformalna obserwacja trzyma się w 45 testach: liczba odznak w README i jakość sekcji instalacyjnej poruszają się w przeciwnych kierunkach.
Co robi inaczej najlepsza warstwa
Sześć skilli, 13% wszystkiego, co przetestowaliśmy, dzieli najwyższy wynik 9,6/10: DOCX, skill-creator i frontend-design z oficjalnego repozytorium Anthropic, test-driven-development i systematic-debugging z kolekcji superpowers Jesse'ego Vincenta, oraz humanizer ze społeczności. Kolejne sześć, w tym xlsx, pdf i sql-queries, siedzi na 9,2. To, co łączy najlepszą warstwę, da się sprawdzić:
Perfekcyjne instalacje i perfekcyjne wyzwalanie, bez wyjątków. Wszystkie sześć dostało 5/5 w obu kategoriach. Cała kreatywna energia, jaka poszła w te skille, nie poszła w opis; te czyta się jak specyfikacje, z jawnymi frazami wyzwalającymi i jawnymi wykluczeniami.
Wycelowane w to, co model bazowy robi słabo. Claude nie potrzebuje skilla, żeby pisać prozę. Potrzebuje go, żeby stworzyć realny plik .docx ze stylami i śledzonymi zmianami, albo żeby przestać "naprawiać" race condition przez zgadywanie. Systematic-debugging zdobył swój wynik na buggu, który Claude wcześniej "naprawiał" trzy razy, ani razu go nie naprawiając. Pętla hipoteza-test-weryfikacja skilla skończyła zgadywanie. Każdy top skorer celuje w lukę, którą da się nazwać jednym zdaniem.
Dokumentacja, która nie zawyża. Najniższy wynik za dokumentację wśród tej szóstki to 4. Ich README podają wymagania wstępne i przyznają się do ograniczeń; przymiotników jest niewiele. Okazuje się, że autorzy, którzy testują własne instrukcje instalacyjne, piszą też opisy, które się odpalają. Rzemiosło koreluje samo ze sobą.
Warto też odnotować: pochodzenie pomaga, ale nie przesądza. Dziesięć z jedenastu przetestowanych przez nas skilli od Anthropic przeszło czysto, a wyjątek to konfiguracja z założenia. Ale jedna trzecia najlepszej warstwy to jeden autor ze społeczności, któremu zależało, a mnóstwo skilli społecznościowych bije oficjalne w swoich kategoriach. Najbardziej wygwiazdkowane repozytorium w naszej kolejce odkryć ma ponad 85 000 gwiazdek i wciąż żadnego werdyktu, bo gwiazdki to nie test.
Jeśli wybierasz skille
Wybieraj przetestowane. To zdanie w interesie własnym na stronie, której całym produktem jest testowanie skilli, więc oto rozumowanie, które możesz sam sprawdzić: cztery powyższe tryby awarii są niewidoczne w listingu na GitHubie. Liczba gwiazdek mierzy zasięg marketingowy. README mierzy optymizm autora. Jedynym sposobem, żeby wiedzieć, czy skill bije bazę odniesienia, jest uruchomienie tej bazy, co zajmuje nam mniej więcej wieczór na skill, razy 45 dotychczas.
Zacznij od najlepszych skilli 2026 po zestawienie międzykategoryjne, albo idź prosto do swojej kategorii, na przykład najlepszych skilli do kodowania. Każdy wpis linkuje swoje notatki testowe, łącznie z obejściami dla skilli, które ich potrzebują.
PAKIET SKILLPROOF
Optimizer Pack to warstwa przetestowanych skilli w praktyce: cztery skille do wydajności, które przeszły pełny protokół, wstępnie skonfigurowane, żeby powyższe awarie instalacji nie mogły się zdarzyć. Oszczędź sobie wieczoru sortowania.
Odbierz Optimizer Pack — 10 $Jeśli piszesz własny
Tryby awarii da się przekuć w checklistę, a trzy z czterech są tanie do uniknięcia.
Napisz opis jako specyfikację wyzwalacza: frazy, które wpisałby użytkownik, plus to, co skill ma ignorować. Potem przetestuj instrukcje instalacyjne na maszynie, która nie jest twoja, albo przynajmniej w świeżym katalogu, i zadeklaruj każdą zależność, łącznie z innymi skillami i połączeniami MCP. Uruchom nasz walidator skilli przed publikacją; wyłapuje problemy strukturalne i problem opisu-billboardu w kilka sekund. Pełny przewodnik, od frontmattera po publikację, znajdziesz w jak napisać własny skill Claude.
Czwarty tryb awarii, bicie bazy odniesienia, to jedyny, który wymaga faktycznego myślenia. Zanim cokolwiek napiszesz, przepuść swoje docelowe zadanie przez Claude bez żadnego skilla. Jeśli wynik jest już dobry, nie masz skilla, masz readme do funkcji, którą Claude ma wbudowaną. Warstwa 9,6 istnieje, bo ci autorzy znaleźli realne luki. Nie bez ironii, najlepszym narzędziem do tej roboty jest sam skill: skill-creator zbudował nam działający wewnętrzny skill w jednej sesji, a jego etap optymalizacji opisu wymiernie poprawił wyzwalanie w naszym teście.
Niewygodna część
Nic w tych danych nie mówi, że ekosystem jest zły. Mówi, że ekosystem jest nierecenzowany, a to inny problem o znajomym kształcie. Rozszerzenia przeglądarek około 2010, npm około 2016: niski próg wejścia do publikowania plus brak warstwy weryfikacji tworzą katalog, w którym przeciętny element jest przeciętny, najlepsze elementy są naprawdę świetne, a żaden powierzchowny sygnał ich nie rozdziela. Skille, które nie przechodzą naszego testu instalacji, mają setki gwiazdek. Dwa z naszych sześciu top skorerów pochodzą z repozytoriów, o których większość ludzi nigdy nie słyszała.
Zwykła korekta w końcu przychodzi, jakaś mieszanka warstw recenzji i reputacji. Dopóki nie przyjdzie, ciężar spoczywa na tym, kto instaluje, a powyższe liczby pokazują, jak ten ciężar wygląda: 22% przetestowanych skilli zepsutych w wydanej formie, 69% z niedoskonałym wyzwalaniem, 89% z dokumentacją, która straciła punkty. My i tak będziemy dalej publikować dane. Pełny protokół i rubryka oceniania są na stronie metodologii, a każda liczba w tym artykule da się odtworzyć z notatek testowych poszczególnych skilli.
FAQ
Dlaczego mój skill Claude się nie odpala?
Sprawdź trzy rzeczy po kolei. Najpierw ścieżkę: SKILL.md musi leżeć w ~/.claude/skills/<name>/SKILL.md, nie jeden katalog głębiej; źle zagnieżdżony skill zawodzi po cichu. Po drugie, description we frontmatterze: jeśli brzmi jak slogan, Claude nie ma z czym porównać twojego promptu. Przepisz go tak, żeby nazywał dokładne frazy, które faktycznie wpisujesz, albo przepuść przez walidator skilli. Po trzecie, wpisz prompt słowami dosłownie z opisu; jeśli to się odpali, problemem jest pokrycie opisu.
Jak oceniacie, że skill "działa"?
Czysta instalacja na świeżym środowisku według instrukcji autora, testy wyzwalania w obu kierunkach (odpala się na deklarowanych promptach, milczy na niepowiązanych), i realne zadanie ocenione względem bazy bez skilla, warte 10 z 25 punktów. Werdykty: pass, works-with-setup albo still-in-queue. Strona metodologii ma rubrykę; każda strona skilla ma notatki.
Czy oficjalne skille Anthropic są bardziej niezawodne niż społecznościowe?
Średnio bardziej niezawodne: 10 z 11 przetestowanych przez nas przeszło czysto, a wyjątek (brand-guidelines) wymaga konfiguracji z założenia. Ale średnia to nie najciekawsza liczba. Dwa z naszych sześciu najwyżej ocenionych skilli pochodzą z repozytorium jednego autora ze społeczności, a humanizer, skill społecznościowy, to jeden z tylko dwóch skilli, które zdobyły 10/10 za wynik. Wyniki testów biją pochodzenie.
Czy te wyniki oznaczają, że powinienem unikać skilli Claude?
Wręcz przeciwnie. Przetestowana warstwa jest po cichu znakomita: 19 z 45 skilli dostało 9 lub więcej za wynik vs. baza odniesienia, a najlepsza szóstka to różnica między Claude jako oknem czatu a Claude jako narzędziem, które produkuje skończoną pracę. Wniosek jest węższy niż "skille nie działają". Chodzi o to, że połowa opublikowanych rzeczy ma defekt, którego nie widać z listingu, więc instaluj na podstawie danych testowych, nie gwiazdek.
★ 9.6/10 × 3
Darmowy pakiet startowy
3 skille z naszymi najwyższymi ocenami z testów plus checklista instalacji — zestaw, który sami wgralibyśmy na świeżą maszynę. Za darmo, na e-mail.