Postavili jsme MCP server pro ověření skillů Claude

Postavili jsme MCP server pro ověření skillů Claude

Instalace skillu pro Claude je skok do neznáma. Na GitHubu najdete soubor SKILL.md, README zní sebejistě, počet hvězdiček vypadá slibně a zkopírujete ho do ~/.claude/skills/. Zda skutečně dělá něco užitečného, zjistíte až později – obvykle uprostřed práce, kterou jste se snažili dokončit.

My tuto mezeru denně vyplňujeme ručně: nainstalujeme skill, spustíme jeden reálný úkol dvakrát, jednou s ním a jednou bez něj, a zveřejníme rozdíl. Doposud 743 skillů. Nešikovná část byla vždycky ta poslední. Výsledky testů byly na webové stránce a stránky jsou pro lidi. To, co instaluje vaše skilly, je agent.

Proto jsme výsledky testů umístili tam, kde už agent je.

Jeden řádek

claude mcp add skillproof -- npx -y skillproof-mcp

To je celé nastavení. Žádný API klíč, žádný účet, žádný konfigurační soubor k ruční úpravě. Funguje v jakémkoli MCP klientovi – Claude Code, Claude Desktop, Cursor, Windsurf, Zed.

Nyní se váš agent může zeptat, než začne cokoliv klonovat.

Na co skutečně odpovídá

Server zpřístupňuje dva nástroje, které odpovídají dvěma otázkám, jež si lidé skutečně kladou.

find_skill"existuje pro toto otestovaný skill?" Popíšete úkol; dostanete zpět shody seřazené podle skóre, každou s výsledkem testu, hodnocením /10, zjištěním našeho testu a instalačním příkazem.

check_skill"někdo mi doporučil tento, je k něčemu?" Zadáte název skillu, slug nebo GitHub repozitář; dostanete náš výsledek testu, nebo upřímnou odpověď „toto jsme netestovali – považujte za neověřené“.

Každá odpověď nese jeden ze tří výsledků:

  • pass – čistá instalace, spuštění ve správný moment a překonání samotného Claude na reálném úkolu.
  • setup – funguje, ale vyžaduje dodatečné nastavení. Poznámka přesně uvádí, co je třeba udělat jako první.
  • didn't pass – dosáhl horšího skóre než základní úroveň bez skillu. Buď se vůbec nespustil, nebo se spustil a výsledek byl horší, než kdybyste ho neinstalovali.

Právě třetí výsledek je důvod, proč se instalace vyplatí.

Odpověď, na kterou jsme nejvíc hrdí

Požádejte server o skill, který převádí Markdown na Confluence wiki markup, a toto je odpověď:

Confluence — DIDN'T PASS Co zjistil náš test: spustili jsme přiložený convert_markdown_to_wiki.py na reálném vzorovém dokumentu. Skript tiše převádí **bold** text na wiki kurzívu – což je skutečná chyba v regulárním výrazu, nikoli stylistická volba – a standardní tabulky ve stylu GitHubu nechává zcela nepřevedené, přestože SKILL.md explicitně uvádí „tabulky“ mezi prvky, které zpracovává.

Adresář, který uvádí pouze vítěze, by vám tento skill ukázal s přátelským popisem a nechal vás, abyste si chybu s převodem tučného písma na kurzívu našli sami, v dokumentu, který jste již poslali svému týmu. Náš adresář řekne vašemu agentovi, aby se tím vůbec nezabýval.

V katalogu je momentálně 31 takových skillů – otestovaných, zveřejněných a označených červeně. Dalších 59 dosahuje stejných výsledků jako samotný Claude: spustí se, něco vytvoří, ale výsledek není o nic lepší, než jaký byste dostali bez nich. Nikdo jiný tato čísla nezveřejňuje, protože ani jedno z nich ekosystému nelichotí.

Odkud pocházejí data

Server nedrží žádná vlastní data. Čte skillproof.dev/api/skills.json – stejný živý katalog, který vykresluje webová stránka – a ukládá jej do mezipaměti na patnáct minut. Když je skill po vydání nové verze Claude znovu otestován, odpověď, kterou váš agent obdrží, se změní s ním. Není třeba nic aktualizovat ani přeinstalovávat.

Systém hodnocení je veřejný: instalace /5, spuštění /5, výstup vs. základní úroveň /10, dokumentace a poctivost /5, normalizováno na skóre z deseti. Je plně popsán na naší stránce o metodologii, včetně toho, proč má výstup stejnou váhu jako vše ostatní dohromady.

Pokud si vytváříte vlastní nástroje, katalog je otevřený pod licencí CC BY – vezměte si JSON nebo vše jako prostý text a citujte skillproof.dev.

Upřímně o limitech

Dvě věci, které toto neřeší.

Nepokrývá vše. Otestovali jsme 743 skillů z 16 682, které jsme zaindexovali – horní vrstvu podle hvězdiček a našeho automatizovaného prověřování. Pokud je váš úkol specifický, odpověď může znít „zatím nic otestovaného neodpovídá“ a server řekne přesně toto, místo aby si vymýšlel doporučení. Raději nevrátíme nic, než abychom se zaručili za něco, co jsme nikdy nespustili.

A každý výsledek testu má datum. Skilly se mění; skill, který v červnu prošel, se může rozbít, když se změní jeho závislost. Každá karta nese datum, kdy jsme test provedli, a server toto datum předává dál. Staré výsledky jsou fakt, ne chyba, kterou bychom mohli opravit v kódu – ale vždy budete vědět, jak starý je ten, který čtete.

Nainstalujte a zapomeňte

Nejlepší scénář je, že na to už nikdy nebudete muset myslet. Váš agent tiše prověří skill před instalací, přeskočí ty tři, které by vám zbytečně zabraly večer, a vybere ten, který byl skutečně otestován pro úkol, který děláte.

claude mcp add skillproof -- npx -y skillproof-mcp

Zdrojový kód je na GitHubu, pod licencí MIT. Je uveden v oficiálním MCP registru jako io.github.Skillproofdev/skillproof. Pokud vám dá špatnou odpověď, je to chyba v našem testování, ne v infrastruktuře – dejte nám vědět a my skill znovu otestujeme.

★ 9.6/10 × 3

Startovací balíček zdarma

3 skills s nejvyšším skóre z našich testů plus instalační checklist — sestava, kterou bychom nasadili na čistý stroj. Zdarma, e-mailem.

Jeden e-mail s balíčkem + krátký týdenní přehled nových výsledků testů. Odhlásit se můžete kdykoli.