Hallucinations IA de Claude : 59 % en moins avec un skill

Hallucinations IA de Claude : 59 % en moins avec un skill

Posez une question de recherche à Claude et vous obtenez quelque chose de dangereux : une réponse assurée et bien écrite. Que cette réponse soit vraie est une tout autre affaire, et rien à la lecture ne permet de le deviner. Nous dirigeons un annuaire qui teste les skills Claude à longueur de journée, et nous avons décidé de mesurer la chose sérieusement : combien d'affirmations factuelles dans une réponse de recherche typique sont réellement fausses — et combien d'entre elles survivent quand on force le modèle à suivre des règles de vérification ?

Le résultat s'appelle research-discipline, notre troisième skill, et le premier de sa catégorie à publier un benchmark avant/après mesuré : 13,0 % des affirmations de base étaient fausses ou obsolètes ; avec le skill, 5,4 %. Une baisse de 59 %. Il est gratuit, sous licence MIT : github.com/Skillproofdev/research-discipline.

Le vide : les pipelines ne vérifient pas, les vérificateurs ne font pas de recherche

Avant d'écrire la moindre ligne, nous avons passé en revue 15 skills de recherche et de vérification des faits publiés, ainsi que notre propre index de 16 682 skills recensés. Le paysage se divise nettement en deux camps qui ne se croisent jamais.

Les pipelines de recherche approfondie — les plus populaires, avec jusqu'à 1,6k étoiles — orchestrent des recherches parallèles et génèrent de longs rapports. En lisant leurs jeux de règles, on trouve de l'ergonomie de workflow, pas de l'épistémologie : aucune citation par affirmation, aucune règle de qualité des sources, aucune obligation de vérifier quoi que ce soit deux fois. Les auditeurs de fact-checking — surtout des outils de journalisme et de milieu académique, deux ordres de grandeur moins populaires — imposent bien des verdicts et des citations, mais seulement a posteriori, sur un brouillon terminé qu'on leur confie.

Personne ne propose l'entre-deux : une discipline légère qui encadre les affirmations de l'agent pendant qu'il fait sa recherche, que la réponse fasse trois paragraphes ou trente. Et fait notable, personne dans aucun des deux camps ne publie de mesures. Le concurrent le plus bruyant affirme « surpasser OpenAI, Gemini et Claude Desktop » sans le moindre chiffre à l'appui ; un autre annonce « plus de 95 % de précision » comme un objectif jamais testé. Cette niche fonctionne au feeling.

Huit règles, trois inédites

Le skill tient en environ 1 500 tokens de règles contraignantes (SKILL.md complet). La partie familière : chaque affirmation factuelle porte une citation intégrée renvoyant à une liste de sources datées ; les affirmations non étayées reçoivent un marqueur explicite [unverified] au lieu d'une formulation assurée ; les sources sont hiérarchisées par niveaux, les fermes de contenu étant rejetées d'emblée. La partie que personne d'autre n'impose :

  1. La mémoire est une hypothèse. Pour tout ce qui est volatil — versions, prix, tout ce qui est « actuel » — le rappel des données d'entraînement est une piste à vérifier, jamais une preuve. Récupérer la date, chercher, puis affirmer.
  2. Deux sources indépendantes pour les faits porteurs. L'indépendance est définie précisément : deux articles qui reformulent le même communiqué de presse comptent pour une seule source. La seule mise en œuvre antérieure de ce contrôle que nous ayons trouvée était un gist avec une seule étoile.
  3. Les chiffres sont cités, jamais fabriqués. Valeur, unité et date reprises textuellement ; en cas de désaccord entre sources, indiquer la fourchette avec les deux citations — jamais une valeur de compromis passée sous silence.

S'y ajoute une passe adversariale, avec un mécanisme de forçage emprunté à la meilleure référence antérieure trouvée : effectuer une recherche sur le contraire de sa conclusion, identifier au moins deux faiblesses dans son propre brouillon, ou réexaminer ses affirmations les plus porteuses.

Le benchmark : chaque affirmation jugée face à des sources en direct

Six questions de recherche aux réponses objectivement vérifiables, choisies avant tout run : une recherche de version, une comparaison de tarifs, une synthèse de faits, une requête sur un dépôt GitHub, et deux pièges. Chaque question a été traitée deux fois — un agent Claude Sonnet nu, un autre ayant d'abord lu le skill, tous deux avec un accès web complet. Des agents vérificateurs indépendants ont ensuite établi la vérité terrain à partir de sources primaires en direct et jugé une par une les 110 affirmations factuelles réparties dans les 12 réponses.

Question Erreurs/obsolescence en base Avec le skill
Catalogue de modèles Claude (piège d'obsolescence) 3 0
Maturité de production de Bun (piège d'événement réel) 1 1
Tableau de faits Deno 1 0
Faits sur un dépôt GitHub 1 0
Historique des versions Astro 1 1
Comparaison de tarifs email 0 1
Total 7 sur 54 (13,0 %) 3 sur 56 (5,4 %)

C'est sur les deux pièges que le skill a fait ses preuves.

Le piège de l'obsolescence. Interrogé sur le catalogue actuel des modèles Claude, l'agent de base a répondu à partir d'une référence en cache, sans la moindre vérification en direct — trois chiffres de fenêtre de contexte se sont révélés faux. La règle 1 de l'agent avec skill a forcé la récupération de la page de documentation en direct ; verdict du vérificateur : « correspond à la documentation en direct sur chaque chiffre, sans exception ». Même modèle, même question, mêmes outils disponibles. La seule différence était une règle disant que la mémoire ne vaut pas preuve.

Le piège de l'événement réel. Interrogé sur la maturité de production de Bun en 2026, l'agent de base est tombé sur le fait qu'Anthropic a racheté Bun en décembre 2025 — et l'a écarté comme une rumeur SEO non vérifiée. Ses sources étaient des blogs tiers ; il n'a jamais ouvert bun.com ni anthropic.com, où se trouvent pourtant les deux annonces primaires. L'agent avec skill a cité les deux, et le vérificateur les a confirmées en direct. À relire : le seul marqueur d'incertitude posé par l'agent de base sur tout le benchmark visait un événement pourtant vrai. Le scepticisme sans vérification n'est qu'une autre façon de se tromper.

Là où le skill a perdu — publié quand même

Notre méthodologie impose de publier les échecs à côté des réussites, et il y en a eu deux.

Sur la question des tarifs email, l'agent de base a en fait battu le skill : il a chiffré les trois formules Postmark et trouvé la moins chère, tandis que l'agent avec skill n'a chiffré qu'une seule formule, l'a qualifiée de « solution la moins chère », et s'est trompé de 2,50 $/mois. La discipline de citation ne fait pas le calcul à votre place — une énumération incomplète est un échec de recherche que les règles ne détectent pas. Et sur la question de Bun, l'agent avec skill a repris le numéro de version erroné d'un média tech pour une vraie sortie au lieu de le recouper avec les notes de version de l'éditeur — une source de niveau 2 à qui l'on a fait un peu trop confiance.

Autre chose à assumer honnêtement : la discipline coûte environ +10 % de tokens — les récupérations en direct et la passe adversariale ne sont pas gratuites. Et sur les douze réponses au total, environ huit marqueurs proactifs [unverified]/[single-source] émis par le skill ont tous été jugés pertinents, ce qui constitue un résultat en soi : le skill ne se contente pas de réduire les affirmations fausses, il indique lesquelles, parmi celles qui survivent, méritent d'être revérifiées.

PACK SKILLPROOF

research-discipline est gratuit. Pour l'environnement d'efficacité complet autour — CLAUDE.md allégé, audit MCP et quatre skills testés préconfigurés — c'est l'Optimizer Pack.

Obtenir l'Optimizer Pack — 10 $

Installation

git clone https://github.com/Skillproofdev/research-discipline ~/.claude/skills/research-discipline

Redémarrez Claude Code. Il se déclenche sur les questions de recherche, les « quoi de neuf », les comparaisons et les demandes de vérification des faits — et reste en retrait pour le code, les opinions et le travail créatif. Il rejoint token-discipline dans notre série discipline : celui-là s'attaque à ce que la recherche coûte, celui-ci s'attaque à ce qu'elle rate.

PACK DE DÉMARRAGE GRATUIT

Vous voulez nos skills les mieux notés plus la checklist d'installation que nous suivons avant chaque test ? Nous vous envoyons le pack de démarrage gratuit par e-mail.

Recevoir le pack de démarrage gratuit

FAQ

Est-ce que cela remplace la recherche approfondie intégrée de Claude ? Non — il la complète. Les fonctionnalités de recherche intégrées génèrent des rapports ; ceci est une couche de discipline qui s'applique à toute réponse ayant une forme de recherche, y compris les plus courtes, et elle est inspectable : vous pouvez lire les huit règles sur un seul écran.

Claude ne va-t-il pas simplement refuser de répondre quand il ne peut pas vérifier ? Le skill l'interdit explicitement : une preuve insuffisante signifie répondre avec des marqueurs, pas se dérober. « Je n'ai pas pu confirmer ceci » accolé à une affirmation précise est plus utile que la fausse assurance ou que le refus.

Pourquoi seulement six questions ? Parce que chaque affirmation a été vérifiée à la main face à des sources primaires en direct — 110 affirmations réparties dans 12 réponses, chacune avec un verdict vérifiable. Nous préférons un petit benchmark où la vérité terrain est réelle à un grand benchmark noté par un juge non vérifié. L'ensemble des questions et les verdicts par affirmation sont dans le README du dépôt.

5,4 % reste-t-il trop élevé ? Oui. Le skill réduit les affirmations fausses de plus de moitié ; il ne rend pas Claude infaillible, et les deux erreurs résiduelles de notre propre benchmark sont documentées ci-dessus. Si une décision coûte cher en cas d'erreur, vérifiez vous-même les faits porteurs — les citations du skill permettent de le faire en quelques minutes plutôt qu'en quelques heures.

★ 9.6/10 × 3

Le pack de démarrage gratuit

Les 3 skills avec nos meilleurs scores de test, plus la checklist d'installation — le setup qu'on mettrait sur une machine neuve. Gratuit, par e-mail.

Un e-mail avec le pack + un court digest hebdomadaire des nouveaux résultats de test. Désinscription à tout moment.