CLAUDE.md style Karpathy : ce patron bat-il Claude de base ?

CLAUDE.md style Karpathy : ce patron bat-il Claude de base ?

Le CLAUDE.md inspiré de Karpathy : une vérification de ses capacités de planification contradictoire

Un dépôt GitHub contenant un unique fichier CLAUDE.md a accumulé plus de 100 000 étoiles à l'heure où nous écrivons ces lignes. Il est souvent désigné comme la « compétence Karpathy », en référence aux travaux d'Andrej Karpathy en IA et en éducation. Cette popularité soulève une question essentielle pour tout développeur cherchant à tirer le meilleur parti des grands modèles de langage : ce patron fonctionne-t-il réellement ?

Avant d'analyser les résultats de nos tests, deux points de clarification sont essentiels. Premièrement, le dépôt en question a été créé par Forrest Chang ; il est inspiré de Karpathy, mais n'est pas de Karpathy. Deuxièmement, le fichier est un CLAUDE.md, et non un SKILL.md. Il s'agit d'un ensemble d'instructions qu'un humain doit copier-coller dans une session de chat, et non d'une compétence formelle pouvant être installée pour modifier le comportement du modèle par programmation.

Chez SkillProof, nous ne testons pas les prompts à copier-coller. Nous testons des compétences. Nous les installons, les exécutons sur du code réel et mesurons leur performance par rapport au modèle de base. Pour enquêter sur cet engouement, nous avons identifié et testé une cohorte de compétences qui implémentent le même patron sous-jacent que le CLAUDE.md de Chang : la planification contradictoire. Cet article présente nos conclusions.

Déconstruction du patron « Grill-Me »

L'idée centrale du populaire CLAUDE.md est une forme d'auto-critique structurée. Le prompt demande au modèle non seulement de produire une réponse, mais aussi d'adopter une persona — un panel de critiques experts — pour remettre en question et affiner sa propre production avant de présenter une version finale. Le processus se déroule généralement comme suit :

  1. Plan initial : Le modèle génère un plan de haut niveau pour répondre à la demande de l'utilisateur.
  2. Auto-critique : Le modèle est invité à « passer sur le gril » son propre plan, en identifiant les failles potentielles, les cas limites et les risques d'implémentation. Il peut lister des faiblesses ou se poser des questions de clarification.
  3. Résultat affiné : Sur la base de cette critique, le modèle produit une réponse finale plus robuste.

Cette technique est une forme de planification contradictoire. Vous forcez le modèle à agir comme sa propre red team, simulant un processus de revue qui nécessiterait normalement une deuxième personne ou une étape de vérification distincte. L'hypothèse est que ce dialogue interne produit un résultat plus réfléchi et correct, en particulier pour des tâches complexes comme la conception de systèmes ou l'implémentation d'algorithmes.

C'est le patron que nous avons entrepris de tester. Lorsque les développeurs demandent une évaluation de la compétence Claude de Karpathy, c'est de ce mécanisme qu'ils parlent. Forcer un modèle à s'auto-critiquer conduit-il à un code mesurablement meilleur ?

CLAUDE.md vs. SKILL.md : une distinction essentielle

La différence entre un CLAUDE.md et un SKILL.md n'est pas seulement sémantique ; elle est fondamentale pour la manière dont nous évaluons la performance.

Un CLAUDE.md est un prompt manuel. Son efficacité peut varier considérablement en fonction de la capacité de l'utilisateur à l'adapter, des spécificités de son entrée et de l'état de sa session de chat. C'est une recette, pas un outil. On ne peut pas évaluer une recette de manière standardisée.

Un SKILL.md, tel que défini et utilisé dans le répertoire SkillProof, est un fichier canonique et versionné qui modifie par programmation le prompt système du modèle. Lorsque vous utilisez une compétence de notre répertoire, elle est installée une seule fois. Chaque requête ultérieure au modèle bénéficie (ou est entravée par) les instructions de cette compétence, sans aucun copier-coller manuel. Cela permet des tests reproductibles et objectifs.

Notre méthodologie de test complète est fondée sur ce principe. Nous prenons un SKILL.md, l'installons et l'exécutons sur une batterie de tâches réelles. Nous comparons sa sortie — en termes de correction, d'efficacité et de respect des exigences — à celle du même modèle sans aucune compétence installée. Le score qui en résulte est une mesure directe de la valeur ajoutée (ou soustraite) par cette compétence.

Pour cette investigation, nous n'avons pas testé directement le fichier de Forrest Chang. Au lieu de cela, nous avons sélectionné plusieurs compétences de la communauté qui formalisent le patron de planification contradictoire dans un format SKILL.md réutilisable. Cela nous a permis de répondre à la question : le patron lui-même, lorsqu'il est appliqué de manière cohérente, tient-il ses promesses ?

Notre méthodologie de test pour les compétences contradictoires

Pour mener une analyse juste grill-me claude skill tested, nous avons sélectionné un ensemble représentatif de tâches qui sont des points de douleur courants pour les développeurs et où un modèle plus « réfléchi » pourrait théoriquement exceller :

  • Refactorisation complexe : Réécrire une fonction monolithique à complexité cyclomatique élevée en unités plus petites et testables.
  • Génération de client API : Écrire une bibliothèque cliente pour une spécification OpenAPI modérément complexe, incluant la gestion des erreurs et les modèles de requête/réponse.
  • Implémentation d'algorithme : Implémenter un algorithme non trivial à partir d'une description en prose, comme le pathfinding A* ou une file de priorité.
  • Génération de tests unitaires : Écrire une suite complète de tests unitaires pour une classe avec de multiples dépendances et cas limites.

Pour chaque tâche, nous avons effectué deux essais : un avec Claude de base (le modèle sans compétence) et un avec une compétence de planification contradictoire installée. Nous avons noté les résultats sur la base d'une grille d'évaluation qui inclut la correction fonctionnelle, la qualité du code, l'exhaustivité et l'efficacité. Le score final d'une compétence représente son delta de performance moyen sur l'ensemble des tâches testées.

C'est par ce processus rigoureux que nous avons évalué les 1416 compétences actuellement suivies dans notre système. C'est un paysage bruyant : seulement 889 (63 %) de ces compétences passent notre seuil pour fournir un bénéfice net positif. 467 autres nécessitent une configuration non triviale ou ne sont utiles que dans des contextes très spécifiques. Les compétences de planification contradictoire que nous avons testées se sont retrouvées dans toutes ces catégories.

Le verdict : la compétence inspirée de Karpathy fonctionne-t-elle vraiment ?

La réponse est nuancée. L'efficacité du patron de planification contradictoire dépend fortement de la complexité de la tâche. Ce n'est pas une amélioration universelle. Pour certaines tâches, il est activement préjudiciable.

Nos tests ont montré une tendance claire :

Type de tâche Performance de Claude de base Performance de la compétence contradictoire Verdict
Boilerplate simple (ex: un composant React) Rapide, 95 % correct Plus lent, sur-critique, 90 % correct Impact négatif
Refactorisation complexe Manque souvent les cas limites Détecte plus de cas limites, mais verbeux Bénéfice net positif
Conception d'algorithme à partir de zéro Sujet aux lacunes logiques Meilleure structure logique, plus lent Bénéfice net positif
Débogage d'erreurs obscures Suggère souvent des correctifs superficiels Explore des causes profondes Bénéfice net positif

Pour des tâches simples et bien définies, le patron contradictoire ajoute une surcharge inutile. Le modèle dépense des jetons et du temps à critiquer un plan qui était déjà suffisant. Dans certains cas, le processus d'auto-critique a même introduit des erreurs, le modèle ayant halluciné des défauts puis les ayant « corrigés », cassant du code parfaitement fonctionnel. C'est une conclusion cruciale pour quiconque se demande si le karpathy claude md vaut la peine pour le codage quotidien.

Cependant, pour des tâches complexes et ouvertes — le genre qui déroute souvent un développeur junior — le patron apporte un bénéfice mesurable. Lorsqu'on lui demande de concevoir un système ou de refactoriser un morceau de code hérité complexe, la phase d'auto-critique force le modèle à considérer des interactions et des cas limites que Claude de base manque souvent. Le résultat final est plus robuste et nécessite moins de correction humaine, même s'il est plus long à générer et significativement plus verbeux.

Une compétence de planification contradictoire que nous avons testée a clairement dépassé le modèle de base sur des tâches de conception de système ouvertes, tout en obtenant un score inférieur sur la génération de boilerplate simple. Cela souligne la nécessité d'appliquer la bonne compétence à la bonne tâche, plutôt que de chercher un unique « prompt divin » pour tout gouverner.

Le coût caché : verbosité et scores négatifs

L'inconvénient le plus immédiat de ce patron est la verbosité. Une réponse d'une compétence utilisant la planification contradictoire peut être 3 à 5 fois plus longue qu'une réponse de Claude de base. Elle inclut le plan, la critique complète, puis la réponse finale. Bien que les étapes intermédiaires puissent offrir un aperçu de la « pensée » du modèle, elles augmentent également la consommation de jetons et la charge cognitive du développeur qui doit tout lire.

Plus préoccupant est le risque de performance négative. Une compétence mal implémentée est pire qu'aucune compétence du tout. Chez SkillProof, notre découverte la plus importante n'est pas la liste des compétences qui fonctionnent, mais la liste de celles qui ne fonctionnent pas. À ce jour, 60 compétences que nous avons testées ont obtenu un score INFÉRIEUR à celui de Claude de base. Elles rendent activement le modèle moins précis, moins efficace ou moins fiable.

Plusieurs des compétences de planification contradictoire que nous avons testées sont tombées dans cette catégorie. Le mode d'échec était constant : la phase de critique restait bloquée dans une boucle, ou les « personas expertes » se contredisaient, menant à un résultat final confus et incorrect. Lors d'un test, une compétence visant l'optimisation de requêtes SQL est entrée dans une boucle de critique où elle débattait des mérites de JOIN par rapport à INNER JOIN (qui sont fonctionnellement identiques dans la plupart des dialectes) et n'a produit aucune requête.

C'est la réalité anti-hype de l'écosystème des compétences d'IA. La popularité et les étoiles GitHub ne sont pas corrélées à la performance. Un patron de prompt astucieux a autant de chances de nuire que d'aider. La seule façon de le savoir est de le tester.

Alors, le patron en vaut-il la peine ?

Revenons à la question initiale. Le patron du CLAUDE.md inspiré de Karpathy en vaut-il la peine ?

En tant qu'outil d'apprentissage, absolument. Lire le CLAUDE.md de Chang et des prompts similaires est un excellent moyen de comprendre le concept de chaîne de pensée (chain-of-thought) et d'auto-correction. L'expérimenter manuellement peut vous aider à développer une meilleure intuition pour la création de prompts.

En tant qu'outil de production sous la forme d'un SKILL.md installé, la réponse est un « ça dépend » catégorique. Nos données montrent que pour des tâches spécifiques et très complexes, une compétence contradictoire bien implémentée peut être un outil puissant pour les ingénieurs seniors. Elle peut agir comme une caisse de résonance logique et infatigable pour des problèmes complexes. Pour le codage au quotidien, elle sera probablement lente, coûteuse et potentiellement contre-productive.

C'est précisément le problème que SkillProof a été conçu pour résoudre. Au lieu de vous fier à l'engouement ou au nombre d'étoiles, vous pouvez vous fier à nos données. Nous séparons les compétences qui apportent une amélioration réelle et mesurable de celles qui ne sont que des prompts astucieux mais inefficaces.

Lectures associées : la part des compétences qui surpassent réellement Claude de base · comment nous testons chaque compétence avant de la lister.

Nous avons testé des dizaines de compétences qui utilisent la planification contradictoire et d'autres techniques avancées. Pour voir celles qui ont réussi nos tests en conditions réelles et obtenu un score SkillProof, vous pouvez parcourir la catégorie Productivité & Workflow dans notre répertoire. Nous regroupons également les compétences les plus performantes de toutes les catégories dans un pack de démarrage à 10 $, vous offrant un ensemble d'outils vérifiés qui fonctionnent réellement.

★ 9.6/10 × 3

Le pack de démarrage gratuit

Les 3 skills avec nos meilleurs scores de test, plus la checklist d'installation — le setup qu'on mettrait sur une machine neuve. Gratuit, par e-mail.

Un e-mail avec le pack + un court digest hebdomadaire des nouveaux résultats de test. Désinscription à tout moment.