MCP-server lader Claude tjekke skills før installation

MCP-server lader Claude tjekke skills før installation

At installere en Claude-skill er en tillidssag. Du finder en SKILL.md på GitHub, README'en lyder overbevisende, antallet af stjerner ser betryggende ud, og du kopierer den ind i ~/.claude/skills/. Om den rent faktisk gør noget nyttigt, finder du først ud af senere – typisk midt i det arbejde, du forsøgte at få udført.

Vi bruger vores dage på at lukke det hul manuelt: installer skill'en, kør en reel opgave to gange, én gang med og én gang uden, og publicer forskellen. 743 skills indtil videre. Den besværlige del var altid den sidste etape. Vurderingerne lå på en hjemmeside, og hjemmesider er for mennesker. Det, der installerer dine skills, er en agent.

Så vi har placeret vurderingerne der, hvor agenten allerede er.

Én linje

claude mcp add skillproof -- npx -y skillproof-mcp

Det er hele opsætningen. Ingen API-nøgle, ingen konto, ingen konfigurationsfil, der skal redigeres manuelt. Det virker i enhver MCP-klient — Claude Code, Claude Desktop, Cursor, Windsurf, Zed.

Nu kan din agent spørge, før den kloner noget.

Hvad den rent faktisk svarer

Serveren eksponerer to værktøjer, og de svarer til de to spørgsmål, folk rent faktisk har.

find_skill'findes der en testet skill til dette?' Du beskriver opgaven; du får matches rangeret efter deres score, hver med en vurdering, scoren ud af 10, hvad vores test fandt, og installationskommandoen.

check_skill'nogen anbefalede denne, er den noget værd?' Du angiver en skill, et slug eller et GitHub-repo; du får vores vurdering af den, eller et ærligt "vi har ikke testet denne – betragt den som ubekræftet."

Hvert svar indeholder en af tre vurderinger:

  • pass — installerede rent, blev udløst, når den skulle, og klarede sig bedre end ren Claude på en reel opgave.
  • setup — den leverer, men ikke 'out of the box'. Noten beskriver præcis, hvad du skal gøre først.
  • didn't pass — den scorede under basislinjen uden en skill. Enten kunne den slet ikke køre, eller også kørte den og efterlod dig dårligere stillet end uden.

Den tredje vurdering er den, der gør dette værd at installere.

Svaret vi er mest stolte af

Spørg serveren om en skill, der konverterer Markdown til Confluence wiki markup, og her er, hvad der kommer tilbage:

Confluence — DIDN'T PASS Hvad vores test fandt: kørte den medfølgende convert_markdown_to_wiki.py på et reelt eksempeldokument. Den laver i al stilhed **bold** tekst om til wiki kursiv – en reel regex-fejl, ikke et stilistisk valg – og efterlader standard GitHub-stil tabeller fuldstændig ukonverterede, på trods af at SKILL.md eksplicit nævner "tables" blandt de elementer, den håndterer.

Et bibliotek, der kun lister vindere, ville have vist dig den skill med en venlig beskrivelse og ladet dig selv finde fejlen med fed-bliver-til-kursiv i et dokument, du allerede havde sendt til dit team. Vores fortæller din agent, at den ikke skal ulejlige sig.

Der er 31 skills som den i kataloget lige nu — testet, publiceret og markeret med rødt. Yderligere 59 er uafgjort med ren Claude: de kører, de producerer noget, og dette noget er ikke bedre, end hvad du ville have fået alligevel. Ingen andre publicerer nogen af disse tal, fordi ingen af dem smigrer økosystemet.

Hvor dataene kommer fra

Serveren indeholder ingen egne data. Den læser skillproof.dev/api/skills.json – det samme live-katalog, som hjemmesiden viser – og cacher det i femten minutter. Når en skill bliver gentestet efter en Claude-udgivelse, ændres det svar, din agent får, tilsvarende. Intet at opdatere, intet at geninstallere.

Scoringsmodellen er offentlig: installation /5, udløsning /5, output-vs-baselinje /10, dokumentation og ærlighed /5, normaliseret til en score ud af ti. Den er beskrevet fuldt ud på vores metodologiside, inklusive hvorfor output er lige så meget værd som alt andet tilsammen.

Hvis du bygger dine egne værktøjer, er kataloget åbent under CC BY – tag JSON-filen eller det hele som ren tekst, og citer skillproof.dev.

De ærlige begrænsninger

To ting, dette ikke gør.

Det dækker ikke alt. Vi har testet 743 skills ud af de 16.682, vi har indekseret – det øverste udsnit baseret på stjerner og vores automatiserede screening. Hvis din opgave er niche, kan svaret meget vel være "intet testet matcher dette endnu", og serveren siger præcis det i stedet for at opfinde en anbefaling. Vi vil hellere returnere ingenting end at stå inde for noget, vi aldrig har kørt.

Og en vurdering har en dato. Skills ændrer sig; en skill, der bestod i juni, kan gå i stykker, når dens afhængigheder opdateres. Hvert kort indeholder den dato, vi kørte testen, og serveren sender den dato videre. Gamle vurderinger er et faktum om verden, ikke en fejl, vi kan kode os udenom – men du vil altid vide, hvor gammel den, du læser, er.

Installer det, og glem det så

Det bedste scenarie for dette er, at du aldrig tænker over det igen. Din agent tjekker stille og roligt, før den installerer, springer de tre skills over, der ville have spildt din aften, og vælger den, der rent faktisk er testet til den opgave, du udfører.

claude mcp add skillproof -- npx -y skillproof-mcp

Kildekoden er på GitHub, MIT-licenseret. Den er listet i det officielle MCP-register som io.github.Skillproofdev/skillproof. Hvis den giver dig et dårligt svar, er det en fejl i vores test, ikke i selve systemet – fortæl os det, så gentester vi den pågældende skill.

★ 9.6/10 × 3

Den gratis startpakke

De 3 skills med vores højeste testscorer plus installations-tjeklisten — det setup, vi selv ville lægge på en frisk maskine. Gratis, på mail.

Én mail med pakken + et kort ugentligt overblik over nye testresultater. Afmeld når som helst.