MCP-server lar Claude verifisere ferdigheter før installasjon

MCP-server lar Claude verifisere ferdigheter før installasjon

Å installere en Claude-ferdighet er et sjansespill. Du finner en SKILL.md på GitHub, README-filen virker overbevisende, antall stjerner ser betryggende ut, og du kopierer den til ~/.claude/skills/. Om den faktisk gjør noe nyttig, finner du ut senere – vanligvis midt i arbeidet du prøvde å få gjort.

Vi bruker dagene våre på å tette dette gapet manuelt: installere ferdigheten, kjøre én reell oppgave to ganger, én gang med og én gang uten, og publisere forskjellen. 743 ferdigheter så langt. Den vanskelige delen var alltid den siste etappen. Vurderingene lå på et nettsted, og nettsteder er for mennesker. Det som installerer ferdighetene dine, er en agent.

Så vi plasserte vurderingene der agenten allerede er.

Én linje

claude mcp add skillproof -- npx -y skillproof-mcp

Det er hele oppsettet. Ingen API-nøkkel, ingen konto, ingen konfigurasjonsfil å redigere manuelt. Det fungerer i enhver MCP-klient – Claude Code, Claude Desktop, Cursor, Windsurf, Zed.

Nå kan agenten din spørre før den kloner noe som helst.

Hva den faktisk svarer

Serveren eksponerer to verktøy, og de svarer på de to spørsmålene folk faktisk har.

find_skill"finnes det en testet ferdighet for dette?" Du beskriver jobben; du får tilbake treff rangert etter poengsum, hver med en vurdering, poeng av 10, hva testen vår fant, og installeringskommandoen.

check_skill"noen anbefalte denne, er den noe bra?" Du oppgir en ferdighet, en slug eller et GitHub-repo; du får vår vurdering av den, eller et ærlig "vi har ikke testet denne – behandle den som uverifisert."

Hvert svar kommer med én av tre vurderinger:

  • bestått – ble installert rent, ble utløst når den skulle, og presterte bedre enn ren Claude på en reell oppgave.
  • krever oppsett – den leverer, men ikke rett ut av boksen. Notatet sier nøyaktig hva du må gjøre først.
  • ikke bestått – den scoret under grunnlinjen uten ferdigheter. Enten kunne den ikke kjøre i det hele tatt, eller så kjørte den og etterlot deg dårligere stilt enn om du ikke hadde installert den.

Det er den tredje vurderingen som gjør dette verdt å installere.

Svaret vi er mest stolt av

Spør serveren om en ferdighet som konverterer Markdown til Confluence wiki-markup, og her er hva som kommer tilbake:

Confluence – IKKE BESTÅTT Hva testen vår fant: kjørte den medfølgende convert_markdown_to_wiki.py på et reelt eksempeldokument. Den gjør **bold**-tekst om til wiki-kursiv uten varsel – en genuin regex-feil, ikke et stilvalg – og lar standard GitHub-tabeller stå helt ukonvertert, til tross for at SKILL.md eksplisitt lister "tabeller" blant elementene den håndterer.

Et register som bare lister vinnere, ville ha vist deg den ferdigheten med en hyggelig beskrivelse og latt deg finne fet-blir-kursiv-feilen selv, i et dokument du allerede hadde sendt til teamet ditt. Vårt forteller agenten din at den ikke skal bry seg.

Det er 31 slike ferdigheter i katalogen akkurat nå – testet, publisert og merket i rødt. Ytterligere 59 er likestilt med ren Claude: de kjører, de produserer noe, og resultatet er ikke bedre enn det du ville fått uansett. Ingen andre publiserer noen av disse tallene, fordi ingen av dem pynter på økosystemet.

Hvor dataene kommer fra

Serveren lagrer ingen egne data. Den leser skillproof.dev/api/skills.json – den samme sanntidskatalogen som nettstedet gjengir – og bufrer den i femten minutter. Når en ferdighet blir testet på nytt etter en Claude-utgivelse, endres svaret agenten din får tilsvarende. Ingenting å oppdatere, ingenting å installere på nytt.

Poengsystemet er offentlig: installasjon /5, utløsning /5, resultat-mot-grunnlinje /10, dokumentasjon og ærlighet /5, normalisert til en poengsum av ti. Det er beskrevet i sin helhet på vår metodologiside, inkludert hvorfor resultatet er verdt like mye som alt annet til sammen.

Hvis du bygger dine egne verktøy, er katalogen åpen under CC BY – ta JSON-filen, eller alt sammen som ren tekst, og siter skillproof.dev.

De ærlige begrensningene

To ting dette ikke gjør.

Den dekker ikke alt. Vi har testet 743 av de 16 682 ferdighetene vi har indeksert – det øverste sjiktet basert på stjerner og vår automatiserte siling. Hvis jobben din er nisje, kan svaret fort bli "ingenting testet matcher dette ennå," og serveren sier nøyaktig det i stedet for å finne på en anbefaling. Vi returnerer heller ingenting enn å gå god for noe vi aldri har kjørt.

Og en vurdering har en dato. Ferdigheter endrer seg over tid; en ferdighet som besto i juni, kan slutte å virke når en avhengighet endres. Hvert kort har datoen da vi kjørte den, og serveren sender denne datoen videre. Gamle vurderinger er et faktum, ikke en feil vi kan kode oss rundt – men du vil alltid vite hvor gammel den du leser er.

Installer det, og glem det

Det beste scenarioet er at du aldri tenker på dette igjen. Agenten din sjekker i det stille før den installerer, hopper over de tre ferdighetene som ville ha kastet bort kvelden din, og velger den som faktisk ble testet for jobben du gjør.

claude mcp add skillproof -- npx -y skillproof-mcp

Kildekoden er på GitHub, lisensiert under MIT. Den er listet i det offisielle MCP-registeret som io.github.Skillproofdev/skillproof. Hvis den gir deg et dårlig svar, er det en feil i testingen vår, ikke i selve systemet – gi oss beskjed, så kjører vi testen på nytt.

★ 9.6/10 × 3

Den gratis startpakken

De 3 skillsene med våre høyeste testscorer pluss installasjonssjekklisten — oppsettet vi selv ville lagt på en fersk maskin. Gratis, på e-post.

Én e-post med pakken + en kort ukentlig oppsummering av nye testresultater. Meld deg av når du vil.