MCP-server: Claude controleert skills voor installatie

MCP-server: Claude controleert skills voor installatie

Het installeren van een Claude-skill is vaak een gok. Je vindt een SKILL.md op GitHub, de README klinkt overtuigend, het aantal sterren stelt gerust, en je kopieert het naar ~/.claude/skills/. Of het daadwerkelijk iets nuttigs doet, ontdek je pas later — meestal midden in het werk dat je probeerde te doen.

Wij besteden onze dagen aan het handmatig dichten van die kloof: de skill installeren, een echte taak tweemaal uitvoeren (één keer met en één keer zonder), en het verschil publiceren. 743 skills tot nu toe. Het lastige deel was altijd de laatste stap. De oordelen stonden op een website, en websites zijn voor mensen. Hetgeen dat je skills installeert, is een agent.

Dus hebben we de oordelen daar geplaatst waar de agent al is.

Eén regel

claude mcp add skillproof -- npx -y skillproof-mcp

Dat is de volledige installatie. Geen API-sleutel, geen account, geen configuratiebestand om handmatig aan te passen. Het werkt in elke MCP-client — Claude Code, Claude Desktop, Cursor, Windsurf, Zed.

Nu kan je agent navraag doen voordat hij iets kloont.

Welke antwoorden het geeft

De server stelt twee tools beschikbaar, die overeenkomen met de twee vragen die men in de praktijk heeft.

find_skill"is hier een geteste skill voor?" Je beschrijft de taak; je krijgt matches terug, gerangschikt op score, elk met het oordeel, de score op 10, wat onze test heeft uitgewezen, en het installatiecommando.

check_skill"iemand raadde deze aan, is het wat?" Je noemt een skill, een slug, of een GitHub-repo; je krijgt ons oordeel erover, of een eerlijk "we hebben dit niet getest — beschouw het als ongeverifieerd."

Elk antwoord bevat een van de drie oordelen:

  • pass — schoon geïnstalleerd, getriggerd wanneer het hoort, en presteerde beter dan de standaard Claude op een reële taak.
  • setup — het levert resultaat, maar niet 'out of the box'. De notitie beschrijft exact wat je eerst moet doen.
  • didn't pass — het scoorde onder de baseline zonder skill. Ofwel het kon helemaal niet draaien, ofwel het draaide wel, maar liet je slechter af dan zonder installatie.

Dat derde oordeel is wat de installatie de moeite waard maakt.

Het antwoord waar we het trotst op zijn

Vraag de server om een skill die Markdown naar Confluence wiki markup converteert, en dit is wat je terugkrijgt:

Confluence — DIDN'T PASS Wat onze test uitwees: het meegeleverde convert_markdown_to_wiki.py uitgevoerd op een echt voorbeelddocument. Het zet **bold** tekst stilzwijgend om in wiki italic — een daadwerkelijke regex-bug, geen stijlkeuze — en laat standaard GitHub-stijl tabellen volledig ongemoeid, ondanks dat SKILL.md expliciet "tables" noemt onder de elementen die het ondersteunt.

Een catalogus die alleen winnaars toont, zou je die skill met een vriendelijke beschrijving hebben laten zien en je de 'bold-wordt-italic'-bug zelf hebben laten ontdekken, in een document dat je al naar je team had gestuurd. De onze vertelt je agent dat het de moeite niet waard is.

Er staan momenteel 31 van dat soort skills in de catalogus — getest, gepubliceerd en rood gemarkeerd. Nog eens 59 scoren gelijk met de standaard Claude: ze draaien, produceren iets, en dat iets is niet beter dan wat je anders ook had gekregen. Niemand anders publiceert deze cijfers, omdat geen van beide het ecosysteem flatteert.

Waar de data vandaan komt

De server bevat zelf geen data. Het leest skillproof.dev/api/skills.json — dezelfde live catalogus die de website rendert — en cashet deze voor vijftien minuten. Wanneer een skill opnieuw wordt getest na een Claude-release, verandert het antwoord dat je agent krijgt mee. Niets om te updaten, niets om opnieuw te installeren.

De scoremethode is openbaar: installatie /5, triggering /5, output-vs-baseline /10, documentatie en eerlijkheid /5, genormaliseerd naar een score op tien. Het is volledig uitgeschreven op onze methodologiepagina, inclusief waarom de output evenveel waard is als al het andere bij elkaar.

Als je je eigen tooling bouwt, is de catalogus open onder CC BY — gebruik de JSON, of het geheel als platte tekst, en vermeld skillproof.dev.

De eerlijke beperkingen

Twee dingen die dit niet doet.

Het dekt niet alles. We hebben 743 van de 16.682 geïndexeerde skills getest — het bovenste segment op basis van sterren en onze geautomatiseerde selectie. Als je taak niche is, kan het antwoord zijn "nog niets getest dat hieraan voldoet," en de server zegt dat precies in plaats van een aanbeveling te verzinnen. We geven liever niets terug dan in te staan voor iets dat we nooit hebben uitgevoerd.

En een oordeel heeft een datum. Skills veranderen; een skill die in juni slaagde, kan breken wanneer een afhankelijkheid wijzigt. Elke kaart vermeldt de datum waarop we de test uitvoerden, en de server geeft die datum door. Oude oordelen zijn een feit, geen bug die we kunnen omzeilen — maar je weet altijd hoe oud het oordeel is dat je leest.

Installeren en vergeten

Het beste scenario is dat je er nooit meer aan hoeft te denken. Je agent voert stilzwijgend een controle uit voor de installatie, slaat de drie skills over die je avond zouden hebben verpest, en kiest degene die daadwerkelijk is getest voor de taak die je uitvoert.

claude mcp add skillproof -- npx -y skillproof-mcp

De broncode staat op GitHub, onder MIT-licentie. Het staat in de officiële MCP-registry als io.github.Skillproofdev/skillproof. Als het een fout antwoord geeft, is dat een bug in onze tests, niet in de techniek — laat het ons weten en we testen de skill opnieuw.

★ 9.6/10 × 3

Het gratis starterspakket

De 3 skills met onze hoogste testscores plus de installatiechecklist — de setup die wij op een verse machine zouden zetten. Gratis, per e-mail.

Eén e-mail met het pakket + een korte wekelijkse digest met nieuwe testresultaten. Uitschrijven kan altijd.