Katalogi: 23 000+ skilli Claude. Ile z nich naprawdę działa?

Katalogi: 23 000+ skilli Claude. Ile z nich naprawdę działa?

Bez marketingowej otoczki: Uruchomiliśmy 1416 skilli Claude, by znaleźć te działające

Prawdopodobnie widziałeś te liczby: nagłówki i katalogi reklamujące ponad 23 000 skilli Claude dostępnych do instalacji. Liczba ta sugeruje istnienie ogromnego, dojrzałego ekosystemu narzędzi gotowych do rozszerzenia możliwości modelu bazowego. To imponująca liczba, ale rodzi kluczowe pytanie techniczne: co właściwie oznacza „dostępny”? W większości przypadków oznacza to, że w publicznym repozytorium kodu znaleziono manifest SKILL.md. Jest to liczba oparta na wykryciu pliku, a nie na weryfikacji funkcjonalnej.

Takie podejście jest proste, skalowalne i ostatecznie mylące. Nie mówi nic o tym, czy skill da się zainstalować, czy uruchomi się bez błędów, ani czy skutecznie wykona swoją deklarowaną funkcję. Nie informuje, czy jest to porzucony projekt, niedziałający proof-of-concept, a nawet czy jego działanie jest gorsze niż w przypadku nieużywania żadnego skilla.

W SkillProof podchodzimy do tego inaczej. Nie liczymy repozytoriów; instalujemy i wykonujemy skille w oparciu o standardowy zestaw zadań odzwierciedlających rzeczywiste zastosowania. Ten artykuł przedstawia nasze wyniki z testowania 1416 skilli. To bezpośrednia, poparta danymi odpowiedź na pytanie, ile faktycznie istnieje działających skilli Claude, oraz analiza, czy katalogi ze skillami są wiarygodnymi źródłami narzędzi gotowych do użytku produkcyjnego.

Błąd w metodzie liczenia plików

Podstawowym problemem z liczbą ponad 23 000 skilli jest to, że traktuje ona znalezienie pliku jako jego weryfikację. Scrapowanie platform takich jak GitHub w poszukiwaniu plików SKILL.md jest trywialnym zadaniem. Wynikowa liczba dobrze wygląda w materiałach marketingowych, ale jest to metryka próżności, która ignoruje realia tworzenia oprogramowania.

Repozytorium zawierające manifest skilla to tylko punkt wyjścia. To deklaracja, a nie gwarancja. Kiedy rozpoczęliśmy proces systematycznego testowania skilli, szybko zidentyfikowaliśmy typowe wzorce błędów, które proste liczenie plików całkowicie pomija:

  • Niekompletne lub błędne manifesty: Plik SKILL.md istnieje, ale brakuje w nim wymaganych sekcji, wskazuje na nieistniejące definicje narzędzi lub jest składniowo niepoprawny. Instalacja skilla jest niemożliwa bez ręcznej korekty.
  • Niedziałające zależności: Kod skilla opiera się na zewnętrznych bibliotekach, które są nieaktualne, zawierają zmiany powodujące błędy lub nie są już dostępne. Instalacja może się powieść, ale skill zakończy działanie błędem w czasie wykonania.
  • Niezadokumentowane wymagania środowiskowe: Skill może wymagać określonych zmiennych środowiskowych, działającej lokalnie usługi lub tokenów uwierzytelniających, o których nie wspomniano w dokumentacji. Jeden z testowanych przez nas skilli wymagał konkretnej wersji bazy danych działającej na localhost:5433 – szczegół odkryty dopiero po przeczytaniu jego kodu źródłowego w Pythonie. Bez tego był niefunkcjonalny.
  • Porzucone projekty: Repozytorium nie było aktualizowane od lat. Kod został napisany dla poprzedniej wersji API Claude i nie jest już kompatybilny.
  • „Prompt jako skill”: Niektóre skille nie zawierają żadnych rzeczywistych narzędzi. Są to po prostu rozbudowane prompty zapakowane w format skilla. Chociaż potencjalnie użyteczne, nie stanowią one funkcjonalnego rozszerzenia możliwości modelu i często działają nie lepiej niż dobrze napisany prompt.

Samo liczenie tych repozytoriów zawyża postrzeganą wielkość i kondycję ekosystemu. Tworzy to sytuację, w której znalezienie działającego, niezawodnego narzędzia jest kwestią prób i błędów. Nasza metodologia testowania została zaprojektowana specjalnie po to, by przebić się przez ten szum, czyniąc wykonanie kodu podstawową miarą wartości skilla.

Nasze wyniki: Trzeźwe spojrzenie na realne liczby

Zainstalowaliśmy i podjęliśmy próbę uruchomienia 1416 skilli pochodzących z różnych publicznych katalogów i repozytoriów. Każdy skill został poddany serii zautomatyzowanych testów mających na celu wywołanie jego podstawowej funkcjonalności. Wyniki dają znacznie jaśniejszy obraz stanu ekosystemu.

Spośród 1416 przetestowanych skilli, tylko 889 (63%) przeszło nasze wstępne testy wykonania bez żadnej ręcznej interwencji.

Oto pełne zestawienie naszych wyników:

Status Liczba Procent całości
Działa (Uruchamia się bez konfiguracji) 889 63%
Wymaga konfiguracji (Wymaga ręcznych ustawień) 467 33%
Błąd (Działa gorzej niż model bazowy) 60 4%
Łącznie przetestowano 1416 100%

Przeanalizujmy, co każda z tych kategorii oznacza dla dewelopera, który próbuje użyć tych narzędzi.

Działa (63%): Te skille zainstalowały się poprawnie i uruchomiły na naszym środowisku testowym bez błędów. To jest „rzeczywista liczba skilli Claude w katalogach” z naszej próbki – podzbiór skilli, które są natychmiast użyteczne. To jest podstawowy poziom, jakiego użytkownik powinien oczekiwać od każdego skilla w katalogu. Jednak, jak omówimy dalej, „działający” nie oznacza automatycznie „wysokiej jakości”.

Wymaga konfiguracji (33%): To znacząca i często pomijana kategoria. Te 467 skilli nie były zepsute, ale nie działały od razu po instalacji. Typowe przyczyny to:

  • Konieczność ręcznego ustawienia kluczy API jako zmiennych środowiskowych.
  • Potrzeba połączenia z bazą danych dostarczoną przez użytkownika lub usługą zewnętrzną.
  • Zależność od lokalnych plików lub konfiguracji systemowych, które nie zostały określone w SKILL.md.

Na przykład, skill do interakcji z API do zarządzania projektami jest bezużyteczny bez klucza API i adresu URL punktu końcowego. Te skille nie są błędne, ale umieszczanie ich na liście bez jasnych, wstępnych instrukcji konfiguracji jest wprowadzaniem użytkownika w błąd. Katalog, który nie rozróżnia skilli działających od razu („Pass”) od tych wymagających konfiguracji („Needs Setup”), przedstawia niewiarygodny obraz.

Błąd (4%): To najbardziej niepokojąca kategoria. Te 60 skilli nie tylko nie wykonało swojej funkcji, ale wygenerowało wyniki, które były znacznie gorsze niż w przypadku użycia modelu bazowego bez żadnego skilla. Dzieje się tak, gdy logika skilla jest wadliwa, co powoduje, że model:

  • Wpada w pętlę, wielokrotnie próbując wywołać niedziałające narzędzie.
  • „Halucynuje” użycie narzędzi, które nie istnieją w jego własnej definicji.
  • Błędnie interpretuje intencję użytkownika i nieprawidłowo stosuje narzędzie, co prowadzi do błędów lub bezsensownych wyników.

Jeden z testowanych przez nas skilli był przeznaczony do formatowania fragmentów kodu. Po otrzymaniu prostej funkcji w Pythonie, próbował wywołać narzędzie format_javascript, co zakończyło się niepowodzeniem i zwróceniem komunikatu o błędzie. To samo zapytanie skierowane do „czystego” Claude'a dałoby w rezultacie poprawnie sformatowany fragment kodu w Pythonie. Te 60 skilli jest nie tylko bezużytecznych; są szkodliwe. Żaden szanujący się katalog nie powinien ich listować bez wyraźnego ostrzeżenia. Publikujemy te niepowodzenia, ponieważ stanowią one kluczową część danych.

Więcej niż wykonanie: Co definiuje jakość skilla?

Dane pokazują, że mniej więcej dwa na trzy znalezione skille będą działać. Ale to odpowiada tylko na pierwszą część pytania. Druga, ważniejsza część, dotyczy jakości. „Jakość 23000 skilli Claude” to nie kwestia ilości, ale wydajności.

Skill, który działa, ale słabo wykonuje swoje zadanie, jest niewiele lepszy od tego, który nie działa wcale. Dlatego, gdy skill przejdzie nasz wstępny test wykonania, oceniamy go w skali od 1 do 10 na podstawie jego wydajności w serii zadań odzwierciedlających rzeczywiste zastosowania. Nasze pełne kryteria oceny są szczegółowo opisane w naszej metodologii, ale koncentrują się na kilku kluczowych zasadach:

  • Niezawodność: Czy skill konsekwentnie radzi sobie z deklarowanym zadaniem? Czy używa odpowiednich narzędzi do jego wykonania?
  • Dokładność: Czy wynik jest poprawny i wolny od błędów? Jeśli wchodzi w interakcję z API, czy poprawnie obsługuje dane?
  • Wydajność: Czy rozwiązuje problem bez zbędnych kroków lub wywołań narzędzi?
  • Prawidłowa obsługa błędów: Czy w przypadku napotkania przypadku brzegowego lub nieprawidłowych danych wejściowych zwraca pomocny komunikat o błędzie, czy też ulega awarii?

Różnica między skillem o wysokiej i niskiej ocenie jest ogromna.

Skill o wysokiej ocenie, podobnie jak dobrze zbudowane narzędzie do infrastruktury chmurowej, poprawnie zinterpretuje żądanie takie jak „list all EC2 instances in us-east-1”, użyje swojego narzędzia list_instances z poprawnym parametrem region, obsłuży paginowaną odpowiedź z API i przedstawi użytkownikowi przejrzystą, dokładną listę.

Skill o niskiej ocenie może mieć ten sam cel, ale zawodzić w wykonaniu. Na przykład, inne testowane przez nas narzędzie chmurowe ignorowało podany region i listowało instancje ze swojego domyślnego regionu. „Działało” w tym sensie, że nie uległo awarii, ale generowało błędną odpowiedź, co czyniło je niewiarygodnym.

Te 60 skilli, które uzyskały wynik niższy niż model bazowy, reprezentują absolutne minimum. Są namacalnym dowodem na to, że źle zaprojektowany skill jest gorszy niż brak skilla. To kluczowy punkt danych, który jest tracony, gdy katalogi priorytetowo traktują wielkość katalogu zamiast zweryfikowanej wydajności.

Oddzielanie sygnału od szumu

Rozbieżność między reklamowanymi ponad 23 000 skillami a naszym wskaźnikiem zdawalności na poziomie 63% podkreśla główny problem: ekosystem jest pełen szumu. Prawdziwa liczba funkcjonalnych, wysokiej jakości skilli to niewielki ułamek reklamowanej sumy.

Ręczne testowanie każdego znalezionego skilla nie jest praktycznym rozwiązaniem dla żadnego dewelopera. Proces ten jest czasochłonny i wymaga dużych zasobów. Nasz test 1416 skilli wymagał znacznego wysiłku inżynieryjnego w celu zbudowania platformy testowej oraz znacznych zasobów obliczeniowych do przeprowadzenia ocen. Właśnie dlatego większość katalogów tego nie robi. Znacznie łatwiej jest uruchomić scraper i opublikować dużą, niezweryfikowaną liczbę.

Celem katalogu ze skillami powinno być filtrowanie sygnału od szumu. Powinien on wykonywać pracę weryfikacyjną w imieniu użytkownika. Oznacza to:

  1. Uruchamianie każdego skilla: Skill nie jest „zweryfikowany”, dopóki nie zostanie uruchomiony.
  2. Testowanie poprawności: Skill musi być oceniony na podstawie rzeczywistych zadań, aby sprawdzić, czy działa zgodnie z opisem.
  3. Publikowanie niepowodzeń: Katalog, który nie pokazuje, co zawiodło, ukrywa połowę prawdy. Dane o niepowodzeniach są równie ważne jak dane o sukcesach.

Testując skille w dziesiątkach kategorii, od analizy danych po tworzenie stron internetowych, budujemy mapę tego, co działa, co wymaga poprawek, a czego należy unikać.

Takie podejście oparte na danych to jedyny wiarygodny sposób, aby odpowiedzieć na pytanie: „czy katalogi ze skillami Claude są wiarygodne?”. Odpowiedź brzmi: są tak wiarygodne, jak ich proces weryfikacji. Katalog, który jest tylko listą repozytoriów, nie jest wiarygodnym źródłem profesjonalnych narzędzi. Katalog, który uruchamia, testuje i ocenia każdy wpis, buduje fundament zaufania.

Warto przeczytać: ile skilli faktycznie przewyższa model bazowy · nasza metodologia testowania.

Wykonaliśmy tę pracę dla całego naszego katalogu. 889 skilli, które przeszły nasze testy, jest dostępnych do przeglądania, wraz z ich ocenami i werdyktem dotyczącym wydajności. Dla deweloperów, którzy potrzebują podstawowego zestawu sprawdzonych narzędzi, oferujemy wyselekcjonowany pakiet naszych najwyżej ocenianych skilli za 10 USD, z gwarancją, że wszystkie działają i zachowują się zgodnie z oczekiwaniami. To jest nasze rozwiązanie problemu sygnału i szumu: mały, zweryfikowany, wysokiej jakości podzbiór ogromnego, niezweryfikowanego publicznego ekosystemu.

★ 9.6/10 × 3

Darmowy pakiet startowy

3 skille z naszymi najwyższymi ocenami z testów plus checklista instalacji — zestaw, który sami wgralibyśmy na świeżą maszynę. Za darmo, na e-mail.

Jeden e-mail z pakietem + krótki cotygodniowy przegląd nowych wyników testów. Wypiszesz się, kiedy chcesz.