Même question, même modèle : avant/après en recherche IA

Même question, même modèle : avant/après en recherche IA

Une heure après la publication de research-discipline, nous avons mené l'expérience qu'on a vraiment envie de voir : non pas un benchmark préparé à l'avance, mais une seule question posée en direct, à deux reprises, avec les réponses vérifiées publiquement. Cet article est le protocole complet — ce que nous avons demandé, ce que chaque run a fait, et chaque étape de vérification — pour que vous puissiez le refaire vous-même.

Le protocole

La question. « Quels sont les skills Claude Code les plus populaires en ce moment ? Citez les 5 principaux dépôts de skills sur GitHub par nombre d'étoiles, avec les chiffres actuels. Comment le dépôt officiel d'Anthropic se compare-t-il aux dépôts communautaires ? » — une question dont la réponse est objectivement vérifiable et change chaque semaine, exactement le terrain où la recherche par IA pourrit en silence.

Les deux runs. Des agents Claude Sonnet identiques, un prompt identique, des outils identiques (recherche web, récupération web, shell). Une seule différence : le second agent a d'abord lu SKILL.md depuis une copie de research-discipline installée comme n'importe quel utilisateur le ferait —

git clone https://github.com/Skillproofdev/research-discipline ~/.claude/skills/research-discipline

C'est toute l'intervention : environ 1 500 tokens de règles que le modèle lit avant de se mettre au travail.

L'arbitre. Une fois les deux réponses obtenues, nous avons récupéré le nombre d'étoiles de chaque dépôt mentionné par l'une ou l'autre réponse — plus les candidats qu'aucune des deux n'a mentionnés — directement depuis l'API GitHub, la seule autorité sur ses propres chiffres. Pas de jugement par LLM ici, juste gh api repos/<owner>/<repo>.

Ce qui est ressorti

Le vrai top 5 des dépôts de skills par étoiles, et ceux que le run de base a manqués

La réponse de base a fière allure. Cinq dépôts, des descriptions plausibles, des comptages d'étoiles exacts au chiffre près, une synthèse assurée à la fin. Si nous n'avions pas vérifié, nous l'aurions publiée telle quelle.

Elle se trompe là où ça compte. Le vrai top 5, vérifié via l'API en direct, comprend trois dépôts que le run de base n'a jamais fait remonter — à 228k, 190k et 164k étoiles. Ce ne sont pas des dépôts obscurs : chacun dépasse trois des cinq dépôts que le run de base a cités. Son affirmation finale, « le dépôt officiel d'Anthropic n'est devancé que par Superpowers », est fausse — le dépôt officiel arrive cinquième. Rien de ce qu'a écrit le run de base n'était inventé ; chaque chiffre donné était réel. Il a simplement répondu à une autre question : « de quels dépôts parlent les articles de blog ? » — car ses six appels d'outils étaient des recherches web, et les résultats de recherche sont un concours de popularité éditoriale, pas d'étoiles.

Le run équipé du skill a répondu à la question posée. Sa première règle — les preuves doivent être en direct ; la mémoire et les premiers résultats de recherche sont des pistes, pas des preuves — l'a fait passer du réflexe Google à l'énumération : il a interrogé directement l'API GitHub et balayé trois listes de topics GitHub (agent-skills, claude-skills, claude-code-skills) pour s'assurer que rien de gros ne se cachait hors de la blogosphère. Ses cinq comptages correspondaient tous à l'API en direct lors de notre nouvelle vérification. Il a aussi fait deux choses que personne ne lui demandait mais qu'un chercheur rigoureux ferait : il a séparé les vrais dépôts de skills des listes de liens organisées (le run de base les mélangeait), et il a posé deux drapeaux d'incertitude — l'un notant que plusieurs des meilleurs dépôts n'ont que quelques mois avec une croissance d'étoiles anormalement rapide ([unverified] quant à son caractère organique), l'autre reconnaissant qu'une affirmation sur une marketplace remontait à un seul blog ([single-source]). Les deux drapeaux ont résisté à l'examen.

La méthode, en détail

Run de base contre run équipé du skill : appels d'outils, comportement et coût en tokens

Pourquoi un simple fichier texte change-t-il autant le comportement ? Parce que l'échec qu'il cible n'est pas de l'ignorance — le modèle de base sait que GitHub a une API — c'est l'habitude par défaut de répondre à partir de ce qui remonte en premier. Le skill transforme une bonne pratique de « quelque chose que le modèle pourrait faire » en « quelque chose que le modèle doit faire avant d'avoir le droit d'affirmer » :

  1. La règle 1 (preuves en direct) a imposé l'horodatage et les appels d'API plutôt que de faire confiance aux extraits de recherche.
  2. La règle 3 (sources indépendantes) explique pourquoi les balayages de topics ont eu lieu — un seul chemin de recherche ne suffit pas pour une affirmation « top 5 » qui doit tenir la route.
  3. La règle 5 (non vérifié doit être dit non vérifié) a produit les deux drapeaux au lieu d'une confiance silencieuse.
  4. La règle 7 (attaquer sa propre conclusion) explique pourquoi il est allé chercher des dépôts susceptibles de briser son propre classement — et en a trouvé.

Le coût, honnêtement, est le même que celui relevé par notre benchmark contrôlé : le run discipliné a utilisé 11 appels d'outils contre 6, et 64 445 tokens contre 49 988 — +29 % sur cette tâche. La vérification n'est pas gratuite. Elle est simplement bien moins coûteuse que de se tromper avec assurance dans un document sur lequel quelqu'un va agir.

Ce que cela ne prouve pas

Une seule question, c'est une anecdote, pas un benchmark — la version contrôlée à six questions avec vérification au niveau de chaque affirmation (13,0 % → 5,4 % d'affirmations fausses) constitue la preuve ; ceci n'est que la démonstration. Le skill n'est pas non plus un oracle d'exhaustivité : dans le run contrôlé, il a une fois chiffré un palier tarifaire d'un fournisseur en en manquant un moins cher. Et les comptages d'étoiles ci-dessus étaient exacts le 10 juillet 2026 et vont évoluer — ce qui est, à point nommé, exactement le genre de réserve que le skill vous oblige à formuler.

ESSAYEZ VOUS-MÊME

Toute l'expérience est reproductible en dix minutes : installez le skill, choisissez une question dont les chiffres sont vérifiables, lancez-la deux fois, vérifiez avec la source primaire. Le skill est gratuit, sous licence MIT, environ 1 500 tokens.

Récupérer research-discipline sur GitHub

FAQ

Avez-vous choisi la question à votre avantage ? C'était la première question que nous avons lancée après la publication du skill, choisie parce que les données de notre propre catalogue permettaient de la recouper. Le benchmark contrôlé à six questions préenregistrées en est la version systématique, et il confirme ce résultat.

Un modèle plus intelligent rendrait-il le skill inutile ? Le run de base ici était un modèle actuel avec accès complet au web. L'écart ne venait pas des capacités — il venait des réglages par défaut. Les règles changent les réglages par défaut.

Pourquoi les deux runs ont-ils obtenu les bons comptages d'étoiles, mais un seul le bon classement ? Parce que l'exactitude et l'exhaustivité échouent indépendamment l'une de l'autre. Chaque chiffre cité par le run de base était réel ; l'erreur se logeait dans ce qu'il n'a jamais cherché. C'est le mode d'échec le plus dangereux en recherche par IA : rien dans la réponse n'a l'air faux.

Et les +29 % de tokens ? Associez-le à token-discipline, qui réduit le gaspillage de session d'environ 20 % sur les tâches à plusieurs étapes. Discipline sur ce que vous lisez, discipline sur ce que vous affirmez — les deux sont conçus pour fonctionner ensemble.

★ 9.6/10 × 3

Le pack de démarrage gratuit

Les 3 skills avec nos meilleurs scores de test, plus la checklist d'installation — le setup qu'on mettrait sur une machine neuve. Gratuit, par e-mail.

Un e-mail avec le pack + un court digest hebdomadaire des nouveaux résultats de test. Désinscription à tout moment.