La moitié des Claude Skills ne marchent pas — les chiffres

La moitié des Claude Skills ne marchent pas — les chiffres

Si vous cherchez « claude skill ne fonctionne pas », voici la version courte : ce n'est probablement pas vous. Nous installons et testons chaque skill que nous référençons, sur une configuration propre, en suivant les instructions de l'auteur, puis nous comparons le résultat à Claude sans aucune skill. Les schémas d'échec sont si réguliers que nous pouvons désormais les classer par fréquence.

La version longue est chiffrée, et chaque chiffre provient de nos données de test publiques. Notre catalogue compte actuellement 73 skills. 45 sont passées par le protocole complet ; 28 sont encore dans la file de test. Sur les 45 testées, 35 ont obtenu un verdict propre. Les 10 autres, soit 22 %, ont reçu un verdict « fonctionne avec configuration », c'est-à-dire que la skill telle que livrée ne fonctionnait pas et qu'il a fallu intervenir : installer une dépendance manquante, brancher une connexion MCP, ou compléter une configuration que le README ne mentionnait jamais. Sur l'ensemble du catalogue, cela laisse 35 skills sur 73, soit 48 %, avec un verdict « testée, fonctionne » aujourd'hui. Un peu moins de la moitié. D'où le titre.

Et cela sous-estime le problème, car les 45 skills testées sont déjà des survivantes. Notre crawler parcourt GitHub toutes les 12 heures et a versé 267 dépôts dans la file de découverte. Les skills abandonnées, dupliquées ou manifestement cassées sont écartées au tri et n'atteignent jamais un test noté. Les modes d'échec ci-dessous sont ceux que nous trouvons dans les skills suffisamment bonnes pour mériter un test.

Les chiffres, avant les anecdotes

Notre score comporte 25 points répartis sur quatre critères : installation propre (5), déclenchement fiable (5), résultat vs. base (10), documentation et honnêteté (5), ramenés à une note sur 10. Voici comment les 45 skills testées se sont classées sur chaque critère :

Critère Score parfait Au moins un point perdu Note de 3/5 ou moins
Installation propre (/5) 34 sur 45 11 (24 %) 8 (18 %)
Déclenchement fiable (/5) 14 sur 45 31 (69 %) 0
Résultat vs. base (/10) 2 sur 45 à 10 5 bloquées au plancher de 7/10
Documentation et honnêteté (/5) 5 sur 45 40 (89 %) 12 (27 %)

Aucune des 45 skills n'a obtenu un 25 parfait. Les notes globales vont de 6,8 à 9,6 sur 10, avec une médiane de 8,4, et 9 des 45 sont sous la barre des 8,0. Les quatre modes d'échec correspondent aux quatre lignes du tableau.

Mode d'échec 1 : la description qui ne se déclenche jamais

C'est le défaut le plus répandu dans nos données. Seules 14 des 45 skills testées, soit 31 %, ont obtenu un 5/5 parfait sur « déclenchement fiable ». Les 31 autres se déclenchent de façon inconsistante : elles ratent des formulations qu'elles devraient capter, ou s'activent sur des tâches sans rapport. Remarquez le zéro dans la dernière colonne du tableau, cela dit. Aucune skill testée n'a obtenu moins de 4/5 sur le déclenchement, et c'est un biais de survie, pas un signe de qualité. Une skill dont le déclencheur est totalement mort est éliminée au tri et n'obtient jamais de note. Celles qui atteignent le test se contentent de mal viser.

Le mécanisme n'a rien de glamour. Quand vous envoyez un prompt, Claude décide de charger ou non une skill en se basant sur une seule chose : le champ description dans le frontmatter du SKILL.md. Pas le README, pas le code, pas les 400 lignes d'instructions soignées en dessous du frontmatter. Si la description ne relie pas vos mots au rôle de la skill, celle-ci reste dans votre dossier sans rien faire, et vous en concluez que les Claude skills ne marchent pas.

Les auteurs continuent d'écrire ce champ comme une page de vente. Deux paires anonymisées issues de nos tests, légèrement reformulées :

Une description qui ne se déclenche jamais :

« Boostez votre flux de travail éditorial avec une intelligence d'écriture propulsée par l'IA. Écrivez mieux, plus vite, plus intelligemment. »

Le même travail, écrit par une skill qui a obtenu 5/5 en déclenchement :

« À utiliser quand l'utilisateur veut créer, lire ou modifier des documents Word (.docx). Se déclenche sur toute mention de "document Word", ".docx", ou une demande de rapport, mémo ou lettre au format Word. Ne pas utiliser pour des PDF ou des tableurs. »

Encore une, issue de la catégorie données :

« Votre assistant SQL ultime pour tout ce qui touche aux données. »

Face à :

« À utiliser quand l'utilisateur demande d'écrire, déboguer ou optimiser une requête SQL, nomme une table ou un schéma, ou colle une erreur de requête. Ne pas déclencher sur des questions de données générales sans requête impliquée. »

La différence n'est pas une question de talent d'écriture. Les bonnes descriptions nomment les phrases exactes qu'un utilisateur taperait, et précisent quand ne pas se déclencher. Dans notre protocole, nous testons les deux directions : les prompts que la skill prétend gérer, des formulations voisines, et des demandes délibérément sans rapport. La plupart des notes de 4/5 viennent de skills qui passent le premier test et trébuchent sur le deuxième ou le troisième.

Vous pouvez vérifier cela avant d'installer quoi que ce soit. Le SKILL.md est du markdown ordinaire, lisible sur GitHub. Si la description pourrait faire office de panneau publicitaire, la skill sous-performera. Si vous déboguez la vôtre, collez-la dans notre validateur de skill gratuit, qui repère le discours marketing en plus des problèmes structurels.

Mode d'échec 2 : la pourriture d'installation

Les 10 verdicts « fonctionne avec configuration » sont tous des échecs d'installation d'une forme ou d'une autre. Le schéma ressort clairement dans les notes : les skills qui passent d'emblée obtiennent en moyenne 4,97 sur 5 à l'installation. Les skills avec verdict de configuration obtiennent en moyenne 3,2.

Ce qui a réellement cassé, d'après nos notes de test :

  • Dépendances de skills non déclarées. Une skill d'extraction de factures qui exige discrètement l'installation préalable de la skill PDF pour les documents scannés, plus une modification d'une ligne pour les formats de date européens que le README ne mentionne pas. Le résultat était réellement bon (8/10) une fois le problème identifié. L'identification a pris toute une soirée.
  • Dépendances de services non déclarées. Une skill de planification qui n'est que consultative tant qu'un MCP calendrier n'est pas connecté. Une skill de tri de boîte mail qui nécessite Gmail ou Outlook branché. Une skill de métriques qui suppose l'existence d'un export analytique. Aucune de ces exigences n'est déraisonnable en soi. Toutes devraient figurer en première ligne du README, pas dans un ticket de support.
  • Mauvaise profondeur de dossier. Le classique. Des instructions qui laissent la skill à skills/nom/nom/SKILL.md, un niveau trop profond, où Claude ne la trouve jamais. La skill « s'installe » sans message d'erreur puis ne se déclenche jamais, ce qui vous fait courir après le mode d'échec 1 alors que le vrai problème est un chemin de fichier.
  • Instructions écrites pour une ancienne version de Claude Code. Git-workflow est un cas léger : les commits et la gestion de branches fonctionnent immédiatement, mais les instructions de rebase interactif supposent des capacités que Claude Code bloque délibérément, donc ces étapes sont à exécuter vous-même.

Une exception honnête mérite d'être citée : brand-guidelines porte un verdict de configuration car elle est inutile tant que vous n'avez pas rempli votre propre palette de marque et votre ton, et elle le dit clairement. La configuration par conception, c'est très bien. La configuration par omission est le mode d'échec.

Le signe avant-coureur, avant d'installer : un README dont la section installation tient en une ligne vague. Comparez-la au bloc d'installation d'une skill notée 5/5, comme DOCX. Des commandes précises, des chemins précis, des prérequis énoncés. Deux lignes suffisent, car deux lignes suffisent à une installation qui fonctionne.

Mode d'échec 3 : la skill se déclenche et rien ne s'améliore

L'échec le plus subtil, et la raison pour laquelle notre notation pondère le résultat vs. base à 10 des 25 points, soit le double de tout autre critère. Le test est brutal : nous exécutons la même tâche réelle deux fois, une fois avec la skill installée et une fois sans, puis nous comparons. Une skill doit battre Claude nu, sinon elle n'a aucune raison d'occuper du contexte.

Le plancher dans notre échantillon testé est de 7/10, et cinq skills s'y trouvent exactement. Cela signifie que même parmi les skills qui passent, environ une sur neuf n'apporte une amélioration perceptible qu'avec une comparaison côte à côte. En dessous de 7, les skills ne survivent pas jusqu'au référencement, et la file de découverte regorge de candidates dans cette fourchette : des skills « d'amélioration de l'écriture » dans des catégories où le modèle de base est déjà solide, et des skills qui se résument à un system prompt disant, en substance, sois excellent.

Seules deux skills ont obtenu 10/10 sur le résultat, et elles montrent à quoi ressemble un écart mérité. Frontend-design a reçu le même brief de page d'atterrissage avec et sans la skill ; la version avec skill avait une vraie échelle typographique et une palette intentionnelle, sans aucun des signes de dégradé néon qui trahissent le résultat par défaut. Humanizer a supprimé l'excès de tirets cadratins et le vocabulaire du type « explorer en profondeur » des brouillons générés par IA, suffisamment pour que deux éditeurs ne puissent pas signaler de façon fiable le résultat comme assisté par IA. Dix-neuf des 45 skills ont obtenu 9 ou plus sur le résultat. Le concept de skill fonctionne. Il ne fonctionne simplement pas automatiquement.

PACK DE DÉMARRAGE GRATUIT

Les 3 skills de notre pack de démarrage gratuit battent toutes la base lors des tests, ce qui est la barre que la plupart ratent. Nous vous les envoyons par e-mail avec la checklist d'installation que nous utilisons à chaque test. Gratuit.

Obtenir le pack de démarrage gratuit

Mode d'échec 4 : le README fait des promesses que la skill ne peut pas tenir

Documentation et honnêteté est le critère le plus faible de tout le jeu de données. Cinq des 45 skills ont obtenu 5/5. Quarante ont perdu des points, et 12 ont obtenu 3/5. Pour le redire : la skill testée médiane a un meilleur résultat que sa documentation.

Ce qui coûte des points ici, par ordre de fréquence observée :

  • Des promesses que le test contredit. Un README qui prétend « fonctionne avec n'importe quel format de facture » alors que la skill nécessite un réglage de locale pour les dates non américaines. Un discours « automatisation Git complète » sur une skill incapable de réaliser des rebases interactifs dans Claude Code. Nous ne considérons généralement pas cela comme un mensonge. Nous y voyons des auteurs documentant la skill qu'ils avaient l'intention d'écrire plutôt que celle qu'ils ont réellement écrite.
  • Prérequis manquants. Chaque dépendance non déclarée du mode d'échec 2 est aussi un échec de documentation, ce qui explique pourquoi les skills à verdict de configuration obtiennent en moyenne 3,4/5 en documentation contre 3,97 pour les passages propres.
  • Silence sur des comportements que vous voudriez connaître. Si la skill « téléphone à la maison », ce qu'elle fait du contenu de vos fichiers, pour quelles versions de modèle elle a été écrite. Des cas rares mais sérieux, appels réseau cachés ou instructions à forme d'injection de prompt enfouies au milieu du fichier, justifient l'existence même de ce critère. Nous lisons chaque SKILL.md que nous référençons, du début à la fin. Vous devriez faire de même pour tout ce qui vient d'ailleurs que d'un répertoire testé.

Nous n'avons pas fait de régression formelle, mais l'observation informelle tient sur les 45 tests : le nombre de badges du README et la qualité de la section installation évoluent en sens inverse.

Ce que fait différemment le haut du panier

Six skills, soit 13 % de tout ce que nous avons testé, partagent le meilleur score de 9,6/10 : DOCX, skill-creator et frontend-design du dépôt officiel d'Anthropic, test-driven-development et systematic-debugging de la collection superpowers de Jesse Vincent, et humanizer de la communauté. Six autres, dont xlsx, pdf et sql-queries, se situent à 9,2. Ce que le haut du panier a en commun est vérifiable :

Installations et déclenchements parfaits, sans exception. Les six ont obtenu 5/5 sur les deux critères. Quelle que soit l'énergie créative investie dans ces skills, aucune n'a été dépensée sur la description ; elle se lit comme un cahier des charges, avec des phrases de déclenchement explicites et des exclusions explicites.

Ciblées sur ce que le modèle de base fait mal. Claude n'a pas besoin d'une skill pour écrire de la prose. Il en a besoin pour produire un vrai .docx avec styles et suivi des modifications, ou pour arrêter de « corriger » une race condition en devinant. Systematic-debugging a mérité sa note sur un bug que Claude avait déjà « corrigé » trois fois sans jamais le résoudre ; la boucle hypothèse-test-vérification de la skill a mis fin aux tâtonnements. Chaque skill du haut du panier cible une lacune que l'on peut nommer en une phrase.

Une documentation qui se sous-vend. La note de documentation la plus basse parmi les six est un 4. Leurs README énoncent les prérequis et admettent les limites ; les adjectifs sont rares. Il s'avère que les auteurs qui testent leurs propres instructions d'installation écrivent aussi des descriptions qui se déclenchent correctement. Le savoir-faire est corrélé à lui-même.

À noter aussi : le pedigree aide mais ne décide pas. Dix des onze skills d'Anthropic que nous avons testées sont passées proprement, et l'exception est une configuration par conception. Mais un tiers du haut du panier vient d'un seul auteur communautaire qui a soigné son travail, et de nombreuses skills communautaires devancent des skills officielles dans leur catégorie. Le dépôt le plus étoilé de notre file de découverte compte plus de 85 000 étoiles et n'a toujours aucun verdict, car les étoiles ne constituent pas un test.

Si vous choisissez des skills

Utilisez celles qui sont testées. C'est une phrase intéressée venant d'un site dont le produit entier consiste à tester des skills, voici donc le raisonnement à vérifier par vous-même : les quatre modes d'échec ci-dessus sont invisibles sur une page GitHub. Le nombre d'étoiles mesure la portée marketing. Un README mesure l'optimisme de l'auteur. La seule façon de savoir si une skill bat la base est d'exécuter la base, ce qui nous prend environ une soirée par skill, multipliée par 45 jusqu'à présent.

Commencez par les meilleures skills de 2026 pour le classement toutes catégories, ou allez directement à votre catégorie, par exemple les meilleures skills de code. Chaque fiche renvoie à ses notes de test, y compris les contournements pour les skills qui en ont besoin.

PACK SKILLPROOF

L'Optimizer Pack montre ce à quoi ressemble le niveau testé en pratique : quatre skills d'efficacité passées par le protocole complet, préconfigurées pour que les échecs d'installation ci-dessus ne puissent pas se produire. Économisez la soirée de tri.

Obtenir l'Optimizer Pack — 10 $

Si vous en écrivez une

Les modes d'échec font aussi office de checklist, et trois des quatre coûtent peu à éviter.

Rédigez la description comme un cahier des charges de déclenchement : les phrases qu'un utilisateur taperait, plus ce que la skill doit ignorer. Testez ensuite les instructions d'installation sur une machine qui n'est pas la vôtre, ou au moins dans un dossier neuf, et déclarez chaque dépendance, y compris les autres skills et les connexions MCP. Passez notre validateur de skill avant de publier ; il repère en quelques secondes les problèmes structurels et les descriptions à la panneau publicitaire. Pour le guide complet, du frontmatter à la publication, voir comment écrire votre propre Claude skill.

Le quatrième mode d'échec, battre la base, est celui qui exige une vraie réflexion. Avant d'écrire quoi que ce soit, faites passer votre tâche cible dans Claude sans skill. Si le résultat est déjà bon, vous n'avez pas une skill, vous avez un README pour une fonctionnalité que Claude possède déjà nativement. Le niveau 9,6 existe parce que ces auteurs ont trouvé de vraies lacunes. Ironiquement, le meilleur outil pour ce travail est lui-même une skill : skill-creator nous a échafaudé une skill interne fonctionnelle en une seule session, et son étape d'optimisation de la description a mesurablement amélioré le déclenchement dans notre test.

La partie inconfortable

Rien dans ces données ne dit que l'écosystème est mauvais. Cela dit que l'écosystème n'est pas relu, ce qui est un problème différent à la forme familière. Les extensions de navigateur vers 2010, npm vers 2016 : une barrière d'entrée basse à la publication plus l'absence de couche de vérification produisent un catalogue où l'élément médian est médiocre, les meilleurs éléments sont réellement excellents, et aucun signal de surface ne les distingue. Des skills qui échouent à notre contrôle d'installation ont des centaines d'étoiles. Deux de nos six meilleures notes viennent de dépôts que presque personne ne connaît.

La correction habituelle finit toujours par arriver, un mélange de couches de relecture et de réputation. En attendant, le fardeau repose sur celui qui installe, et les chiffres ci-dessus montrent à quoi ressemble ce fardeau : 22 % des skills testées cassées telles que livrées, 69 % avec des déclencheurs imparfaits, 89 % avec une documentation qui a perdu des points. Nous continuerons de publier les données quoi qu'il arrive. Le protocole complet et le barème de notation sont sur la page méthodologie, et chaque chiffre de cet article est reproductible à partir des notes de test par skill.

FAQ

Pourquoi ma Claude skill ne se déclenche-t-elle pas ?

Vérifiez trois choses dans l'ordre. D'abord, le chemin : SKILL.md doit se trouver à ~/.claude/skills/<nom>/SKILL.md, pas un dossier plus profond ; une skill mal imbriquée échoue silencieusement. Ensuite, la description du frontmatter : si elle ressemble à un slogan, Claude n'a rien à comparer à votre prompt. Réécrivez-la pour nommer les phrases exactes que vous tapez réellement, ou passez-la dans le validateur de skill. Enfin, formulez votre prompt avec des mots repris textuellement de la description ; si cela se déclenche, le problème vient de la couverture de la description.

Comment décidez-vous qu'une skill « fonctionne » ?

Installation propre sur une configuration neuve en suivant les instructions de l'auteur, contrôles de déclenchement dans les deux sens (se déclenche sur les prompts revendiqués, reste silencieuse sur les demandes sans rapport), et une tâche réelle notée face à une base sans skill, valant 10 des 25 points. Verdicts : réussi, fonctionne avec configuration, ou encore en file. La page méthodologie détaille le barème ; chaque fiche skill contient les notes.

Les skills officielles d'Anthropic sont-elles plus fiables que les skills communautaires ?

Plus fiables en moyenne : 10 des 11 que nous avons testées sont passées proprement, et l'exception (brand-guidelines) nécessite une configuration à dessein. Mais la moyenne n'est pas le chiffre intéressant. Deux de nos six meilleures skills viennent du dépôt d'un seul auteur communautaire, et humanizer, une skill communautaire, est l'une des deux seules skills à obtenir 10/10 sur le résultat. Les résultats de test battent la provenance.

Ces résultats signifient-ils que je devrais éviter les Claude skills ?

Au contraire. Le niveau testé est discrètement excellent : 19 des 45 skills ont obtenu 9 ou plus sur le résultat vs. base, et les six meilleures font la différence entre Claude comme fenêtre de discussion et Claude comme outil qui produit un travail fini. La conclusion est plus étroite que « les skills ne marchent pas ». C'est que la moitié de ce qui est publié a un défaut invisible depuis la fiche, donc installez à partir des données de test, pas des étoiles.

★ 9.6/10 × 3

Le pack de démarrage gratuit

Les 3 skills avec nos meilleurs scores de test, plus la checklist d'installation — le setup qu'on mettrait sur une machine neuve. Gratuit, par e-mail.

Un e-mail avec le pack + un court digest hebdomadaire des nouveaux résultats de test. Désinscription à tout moment.