
Un serveur MCP pour que Claude vérifie les skills avant installation
Installer une skill Claude est un acte de foi. Vous trouvez un fichier SKILL.md sur GitHub, le README semble convaincant, le nombre d'étoiles est rassurant, et vous le copiez dans ~/.claude/skills/. Vous ne découvrez que plus tard si la skill est réellement utile, généralement au milieu du travail que vous essayiez d'accomplir.
Nous passons nos journées à combler cette lacune manuellement : installer la skill, exécuter une tâche réelle deux fois (une fois avec et une fois sans), et publier la différence. 743 skills à ce jour. La partie délicate a toujours été le dernier kilomètre. Les verdicts se trouvaient sur un site web, et les sites web sont faits pour les humains. L'outil qui installe vos skills est un agent.
Nous avons donc placé les verdicts là où l'agent se trouve déjà.
Une seule ligne
claude mcp add skillproof -- npx -y skillproof-mcp
C'est toute la configuration. Pas de clé API, pas de compte, pas de fichier de configuration à éditer manuellement. Cela fonctionne avec n'importe quel client MCP — Claude Code, Claude Desktop, Cursor, Windsurf, Zed.
Désormais, avant que votre agent ne clone quoi que ce soit, il peut demander.
Ce à quoi il répond réellement
Le serveur expose deux outils, qui correspondent aux deux questions que les utilisateurs se posent réellement.
find_skill — « Existe-t-il une skill testée pour cela ? » Vous décrivez la tâche ; vous obtenez en retour des correspondances classées selon leur score, chacune avec le verdict, la note sur 10, les conclusions de notre test et la commande d'installation.
check_skill — « Quelqu'un m'a recommandé celle-ci, est-elle fiable ? » Vous nommez une skill, un slug ou un dépôt GitHub ; vous obtenez notre verdict à son sujet, ou une réponse honnête : « nous n'avons pas testé ceci — considérez-le comme non vérifié ».
Chaque réponse est accompagnée de l'un des trois verdicts suivants :
- pass — s'est installée sans erreur, s'est déclenchée quand il le fallait et a surpassé Claude de base sur une tâche réelle.
- setup — elle est efficace, mais nécessite une configuration préalable. La note indique précisément ce que vous devez faire en premier.
- didn't pass — son score est inférieur à celui de la référence sans skill. Soit elle n'a pas pu s'exécuter, soit elle s'est exécutée et a produit un résultat de moins bonne qualité que si vous ne l'aviez pas installée.
C'est ce troisième verdict qui justifie l'installation de cet outil.
La réponse dont nous sommes le plus fiers
Demandez au serveur une skill qui convertit le Markdown en balisage wiki Confluence, et voici ce que vous obtiendrez :
Confluence — N'A PAS PASSÉ LE TEST Ce que notre test a révélé : nous avons exécuté le script
convert_markdown_to_wiki.pyfourni sur un document d'exemple réel. Il transforme silencieusement le texte en**gras**en italique wiki — un authentique bug de regex, pas un choix de style — et laisse les tableaux standard de type GitHub complètement non convertis, bien que le fichierSKILL.mdliste explicitement les « tables » parmi les éléments qu'il gère.
Un répertoire qui ne listerait que les gagnants vous aurait présenté cette skill avec une description sympathique et vous aurait laissé découvrir par vous-même le bug du gras-devenant-italique, dans un document que vous auriez déjà envoyé à votre équipe. Le nôtre indique à votre agent de ne pas s'en préoccuper.
Il y a actuellement 31 skills de ce type dans le catalogue — testées, publiées et marquées en rouge. 59 autres sont à égalité avec Claude de base : elles s'exécutent, produisent un résultat, et ce résultat n'est pas meilleur que ce que vous auriez obtenu sans elles. Personne d'autre ne publie ces chiffres, car aucun des deux ne flatte l'écosystème.
D'où viennent les données
Le serveur ne stocke aucune donnée propre. Il lit le fichier skillproof.dev/api/skills.json — le même catalogue en direct que celui affiché par le site web — et le met en cache pendant quinze minutes. Lorsqu'une skill est re-testée après une nouvelle version de Claude, la réponse que votre agent reçoit change en conséquence. Rien à mettre à jour, rien à réinstaller.
La grille de notation est publique : installation /5, déclenchement /5, résultat vs référence /10, documentation et honnêteté /5, le tout normalisé sur une note de dix. Elle est décrite en détail sur notre page de méthodologie, y compris la raison pour laquelle le résultat vaut autant que tout le reste combiné.
Si vous développez vos propres outils, le catalogue est ouvert sous licence CC BY — vous pouvez utiliser le JSON, ou l'intégralité en texte brut, à condition de citer skillproof.dev.
Les limites, en toute transparence
Il y a deux choses que cet outil ne fait pas.
Il ne couvre pas tout. Nous avons testé 743 skills sur les 16 682 que nous avons indexées — la tranche supérieure sélectionnée par le nombre d'étoiles et par notre filtre automatisé. Si votre besoin est spécifique, la réponse pourrait bien être « aucune skill testée ne correspond pour le moment », et le serveur le dit explicitement au lieu d'inventer une recommandation. Nous préférons ne rien retourner plutôt que de nous porter garant d'une skill que nous n'avons jamais exécutée.
De plus, chaque verdict est daté. Les skills évoluent ; une skill qui fonctionnait en juin peut cesser de fonctionner suite à la mise à jour d'une de ses dépendances. Chaque fiche indique la date de notre test, et le serveur transmet cette date. Les anciens verdicts sont un fait, pas un bug que nous pouvons contourner par le code — mais vous saurez toujours de quand date celui que vous consultez.
Installez-le, puis oubliez-le
Le scénario idéal pour cet outil est que vous n'ayez plus jamais à y penser. Votre agent vérifie discrètement avant d'installer, ignore les trois skills qui vous auraient fait perdre votre soirée, et choisit celle qui a été réellement testée pour la tâche que vous effectuez.
claude mcp add skillproof -- npx -y skillproof-mcp
Le code source est sur GitHub, sous licence MIT. Il est listé dans le registre MCP officiel sous l'identifiant io.github.Skillproofdev/skillproof. S'il vous donne une mauvaise réponse, c'est un bug dans nos tests, pas dans l'outil lui-même — signalez-le nous et nous re-testerons la skill.
★ 9.6/10 × 3
Le pack de démarrage gratuit
Les 3 skills avec nos meilleurs scores de test, plus la checklist d'installation — le setup qu'on mettrait sur une machine neuve. Gratuit, par e-mail.