Serwer MCP do weryfikacji umiejętności Claude przed instalacją

Serwer MCP do weryfikacji umiejętności Claude przed instalacją

Instalacja umiejętności Claude to skok na głęboką wodę. Znajdujesz plik SKILL.md na GitHubie, README brzmi przekonująco, liczba gwiazdek wygląda obiecująco i kopiujesz go do ~/.claude/skills/. O tym, czy faktycznie robi coś pożytecznego, dowiadujesz się później — zazwyczaj w trakcie pracy, którą próbowałeś wykonać.

Spędzamy całe dnie, ręcznie niwelując tę lukę: instalujemy umiejętność, wykonujemy jedno rzeczywiste zadanie dwukrotnie (raz z nią i raz bez niej), a następnie publikujemy różnicę. Do tej pory 743 umiejętności. Najbardziej kłopotliwy był zawsze ostatni etap. Werdykty znajdowały się na stronie internetowej, a strony są dla ludzi. Narzędzie, które instaluje twoje umiejętności, to agent.

Dlatego umieściliśmy werdykty tam, gdzie agent już jest.

Jedna linia

claude mcp add skillproof -- npx -y skillproof-mcp

To cała konfiguracja. Bez klucza API, bez konta, bez pliku konfiguracyjnego do ręcznej edycji. Działa w każdym kliencie MCP — Claude Code, Claude Desktop, Cursor, Windsurf, Zed.

Teraz, zanim twój agent cokolwiek sklonuje, może zapytać.

Na co faktycznie odpowiada

Serwer udostępnia dwa narzędzia, które odpowiadają na dwa pytania, jakie faktycznie mają użytkownicy.

find_skill„czy istnieje przetestowana umiejętność do tego zadania?” Opisujesz zadanie; otrzymujesz pasujące wyniki uszeregowane według oceny, każdy z werdyktem, punktacją /10, wynikami naszego testu i komendą instalacyjną.

check_skill„ktoś polecił mi tę umiejętność, czy jest dobra?” Podajesz nazwę umiejętności, jej slug lub repozytorium na GitHubie; otrzymujesz nasz werdykt lub szczerą odpowiedź: „nie testowaliśmy tego — traktuj jako niezweryfikowane”.

Każda odpowiedź zawiera jeden z trzech werdyktów:

  • pass — zainstalowała się bez problemów, uruchomiła się, kiedy powinna, i okazała się lepsza od samego Claude w rzeczywistym zadaniu.
  • setup — działa, ale wymaga wstępnej konfiguracji. Notatka precyzuje, co należy najpierw zrobić.
  • didn't pass — uzyskała wynik poniżej poziomu bazowego (bez umiejętności). Albo nie dała się w ogóle uruchomić, albo jej działanie pogorszyło wynik w porównaniu do jej braku.

To właśnie ten trzeci werdykt sprawia, że warto to zainstalować.

Odpowiedź, z której jesteśmy najdumniejsi

Zapytaj serwer o umiejętność, która konwertuje Markdown na składnię wiki Confluence, a oto co otrzymasz:

Confluence — DIDN'T PASS Co wykazał nasz test: uruchomiliśmy dołączony skrypt convert_markdown_to_wiki.py na rzeczywistym przykładowym dokumencie. Po cichu zamienia tekst **bold** na kursywę wiki — to prawdziwy błąd w wyrażeniu regularnym, a nie kwestia stylu — i pozostawia standardowe tabele w stylu GitHub bez żadnej konwersji, mimo że plik SKILL.md jawnie wymienia „tabele” wśród obsługiwanych elementów.

Katalog, który wymienia tylko zwycięzców, pokazałby ci tę umiejętność z przyjaznym opisem i pozwolił samodzielnie odkryć błąd z zamianą pogrubienia na kursywę, w dokumencie już wysłanym do zespołu. Nasz mówi twojemu agentowi, żeby sobie darował.

W katalogu jest obecnie 31 takich umiejętności — przetestowanych, opublikowanych i oznaczonych na czerwono. Kolejne 59 remisuje ze zwykłym Claude: uruchamiają się, generują jakiś wynik, ale ten wynik nie jest lepszy od tego, co uzyskałbyś bez nich. Nikt inny nie publikuje żadnej z tych liczb, ponieważ żadna z nich nie schlebia ekosystemowi.

Skąd pochodzą dane

Serwer nie przechowuje własnych danych. Odczytuje dane z skillproof.dev/api/skills.json — tego samego katalogu, który na żywo renderuje strona internetowa — i przechowuje je w pamięci podręcznej przez piętnaście minut. Gdy umiejętność jest ponownie testowana po nowym wydaniu Claude, odpowiedź otrzymywana przez agenta zmienia się wraz z nią. Nic do aktualizowania, nic do ponownej instalacji.

System punktacji jest publiczny: instalacja /5, aktywacja /5, wynik w porównaniu do wersji bazowej /10, dokumentacja i rzetelność /5, znormalizowane do oceny w skali dziesięciopunktowej. Jest on w pełni opisany na naszej stronie z metodologią, wraz z wyjaśnieniem, dlaczego wynik jest wart tyle, co wszystkie pozostałe kryteria razem wzięte.

Jeśli tworzysz własne narzędzia, katalog jest otwarty na licencji CC BY — możesz pobrać plik JSON lub całość jako zwykły tekst, podając skillproof.dev jako źródło.

Uczciwe ograniczenia

Są dwie rzeczy, których to narzędzie nie robi.

Nie obejmuje wszystkiego. Przetestowaliśmy 743 z 16 682 zindeksowanych przez nas umiejętności — najlepszy wycinek pod względem liczby gwiazdek i naszej automatycznej selekcji. Jeśli twoje zadanie jest niszowe, odpowiedź może brzmieć „nie znaleziono jeszcze pasującej przetestowanej umiejętności”, a serwer powie dokładnie to, zamiast wymyślać rekomendację. Wolimy nie zwracać niczego, niż ręczyć za coś, czego nigdy nie uruchomiliśmy.

A każdy werdykt ma swoją datę. Umiejętności się zmieniają; umiejętność, która przeszła testy w czerwcu, może przestać działać, gdy zmieni się jej zależność. Każda karta zawiera datę przeprowadzenia testu, a serwer przekazuje tę datę dalej. Stare werdykty to fakt, a nie błąd, który możemy obejść w kodzie — ale zawsze będziesz wiedzieć, jak stary jest ten, który czytasz.

Zainstaluj i zapomnij

Najlepszy scenariusz jest taki, że już nigdy więcej o tym nie pomyślisz. Twój agent po cichu sprawdza umiejętności przed instalacją, pomija te trzy, które zmarnowałyby ci wieczór, i wybiera tę, która faktycznie została przetestowana pod kątem zadania, które wykonujesz.

claude mcp add skillproof -- npx -y skillproof-mcp

Kod źródłowy jest dostępny na GitHubie na licencji MIT. Jest wymieniony w oficjalnym rejestrze MCP jako io.github.Skillproofdev/skillproof. Jeśli otrzymasz złą odpowiedź, jest to błąd w naszych testach, a nie w samym mechanizmie — daj nam znać, a przetestujemy daną umiejętność ponownie.

★ 9.6/10 × 3

Darmowy pakiet startowy

3 skille z naszymi najwyższymi ocenami z testów plus checklista instalacji — zestaw, który sami wgralibyśmy na świeżą maszynę. Za darmo, na e-mail.

Jeden e-mail z pakietem + krótki cotygodniowy przegląd nowych wyników testów. Wypiszesz się, kiedy chcesz.