
3 échecs avant que cet humanizer batte la base
La plupart des outils « humanizer » sont une liste de motifs non mesurée. Le plus gros du marché propose 33 motifs, 28 600 étoiles, et zéro chiffre — aucun score de détecteur, aucune vérification de sens, anglais uniquement. La foule des SaaS payants publie des chiffres, mais ce sont les mauvais : des taux de contournement revendiqués de 99 % que des tests indépendants mesurent à ~66 %, obtenus par des paraphraseurs qui massacrent vos faits au passage.
Nous construisons des skills Claude testés pour vivre, alors nous avons entrepris de construire un humanizer que nous pouvions vraiment mesurer. Et le mesurer a failli le tuer. Nous avons publié trois versions de SKILL.md qui ont perdu un test d'humanité en aveugle contre le texte IA brut, non traité. La quatrième a gagné. Cet article raconte tout l'arc — les trois défaites incluses — parce que ce sont les défaites qui rendent la victoire crédible.
La barre fixée avant d'écrire une ligne
Le dispositif était fixé à l'avance. Douze textes générés par IA sur différents genres, construits pour stresser des modes d'échec différents : intros de blog, texte produit, e-mails clients, explications techniques denses en faits, un mémo formel (stress de registre), un résumé de résultats trimestriels chargé de chiffres, un texte non anglophone. Chacun est réécrit deux fois — une fois par un agent Claude de base à qui on dit simplement « réécris pour que ça ne sonne pas généré par IA, garde le sens », et une fois par un agent identique qui lit d'abord notre SKILL.md.
Trois métriques, toutes pré-enregistrées :
- Un décompte scripté et reproductible des tics mécaniques d'IA (sur 103 dans le corpus).
- Un audit de sens affirmation par affirmation contre des inventaires de vérité terrain écrits avant toute réécriture (130 affirmations au total).
- Une préférence d'humanité A/B en aveugle : quelle réécriture se lit comme plus humaine ?
La barre de mise en service était brutale : le skill doit gagner, ou clairement égaler, la préférence en aveugle contre la réécriture de base naïve. Un humanizer que le lecteur en aveugle préfère à sa version non traitée n'a aucune raison d'exister.
Une réserve honnête d'emblée, parce qu'elle gouverne tout ce qui suit. Les API de détecteurs que nous prévoyions d'utiliser (GPTZero, Sapling, ZeroGPT) étaient toutes verrouillées par clé ou par paiement au moment de l'exécution — vérifié et consigné via curl. Donc l'« IA-itude » ici est un juge LLM en contexte et en aveugle, pas un score de détecteur, et nous l'étiquetons ainsi partout. Le décompte de tics et l'audit de sens sont les chiffres objectifs et reproductibles.
v1 : sur-corrigé jusqu'à la bouillie corporate
La première version réécrivait de façon agressive. Échanger les tics contre un vocabulaire plus riche, restructurer à main levée. Le résultat se lisait moins bien.
Troquer « leverage » contre un synonyme plus grandiloquent ne retire pas un tic — ça regonfle le texte. v1 a poncé les mots évidents et les a remplacés par le registre d'un communiqué de presse. Pire, la réécriture agressive a fait dériver le sens : elle a laissé tomber deux affirmations pré-enregistrées (une phrase de cadrage d'audience dans le blog sur le travail à distance, un mot d'un triplet de leadership dans le texte russe) et est devenue raide et corporate là où la source était chaleureuse.
Préférence en aveugle : base 8, v1 4. Le juge a continué de préférer la base pour avoir gardé un cadrage humain léger que v1 avait aplati. Première version, première défaite.
v2 et v3 : sous-corrigées, les tics laissés debout
Le diagnostic de v1 semblait évident : trop réécrit. Nous sommes donc partis dans l'autre sens — des modifications chirurgicales et minimales qui protègent la lisibilité et le sens. Ça a parfaitement réglé les faits, et ça a perdu plus fort.
v2 a réussi la préservation du sens à la perfection : 130/130 affirmations intactes, zéro altérée, abandonnée ou ajoutée. Mais l'édition minimale sous-corrige. Elle a laissé debout « cornerstone », « paradigm shift », « I hope this email finds you well », « personal health command center ». Treize tics résiduels contre quatre pour la base. Le juge en aveugle a repéré exactement ces expressions et noté v2 nettement plus machinal.
Préférence en aveugle : base 12, v2 0. Sur chaque texte, sans exception.
v3 a essayé de couper la poire en deux — une table de remplacement tic-vers-mot-simple plus une passe de re-scan à tolérance zéro : retirer chaque tic, remplacer plus simple, jamais plus recherché. Ça a fait passer les tics résiduels de 13 à 12 et n'a rien changé qui comptait.
Préférence en aveugle : base 12, v3 0. Encore, sur chaque texte.
L'intuition après trois défaites : ce n'était jamais une question de vocabulaire
Trois versions, zéro victoire en préférence aveugle — cumulé 4-0-28 en comptant v1, et 0-0-24 sur les deux tentatives chirurgicales. Quand on perd aussi systématiquement, le problème n'est pas un réglage mal ajusté. C'est le cadre.
Voici ce que les données hurlaient. La base gagne parce qu'elle restructure en une voix humaine : elle varie le rythme, ouvre au cœur du sujet, abandonne l'échafaudage promotionnel. Chacune de nos versions de skill est restée soudée au squelette IA de la source — l'ouverture par phrase-thème, la forme uniforme des paragraphes, la liste en trois points, le cadrage promotionnel. Nous polissions le vocabulaire sur une structure qui annonçait « machine » avant même qu'un mot ne soit lu.
C'est la tension centrale, démontrée trois fois de suite : notre argument de vente unique — figer le sens — est exactement ce qui gardait le skill si collé à l'original qu'il ne pouvait jamais surpasser une réécriture libre en humanité. La sécurité des faits et l'humanité tiraient dans des sens opposés, et la fidélité structurelle a fait perdre le lecteur à chaque fois.
Le texte IA se trahit par sa forme, pas par son vocabulaire. Échanger « delve » contre « regarder » laisse le squelette debout, et le lecteur sent quand même la machine en dessous.
v4 : figer les affirmations, reconstruire la structure
Le correctif était une inversion de méthode, pas un nouveau réglage fin. Arrêter de protéger la structure. Protéger seulement l'ensemble des affirmations — chaque fait, chiffre, nom, date, citation et nuance, plus la direction et la force de chaque affirmation — et reconstruire tout le reste librement. Réordonner. Fusionner des phrases. Écrire de nouvelles ouvertures. Couper l'échafaudage. Faire ce que fait un humain doué : lire le passage, comprendre ce qu'il affirme, puis le redire dans sa propre structure.
Le risque évident, c'est que la restructuration libre est la façon classique de faire dériver les faits — donc l'audit d'affirmations de v4 a été mené en mode extra-strict, et la passe finale obligatoire parcourt l'original affirmation par affirmation face à la réécriture, restaurant toute dérive même au prix d'une ligne moins nette.
Ça a marché. v4 est la première version à battre la base : préférence en aveugle 8-4. L'IA-itude était pratiquement à égalité (26 contre 27), et le décompte de tics le plus bas de tous les bras — 2. Les raisons du juge pour ses victoires étaient toutes structurelles : des ouvertures à froid qui démarrent au cœur du sujet (le résumé de résultats commence désormais par le chiffre de revenu comme une vraie dépêche), l'échafaudage en liste fusionné en prose, le registre resserré mais resté dans le genre (le mémo reste formel, l'e-mail reste professionnel).
Et les faits ont tenu. 129 des 130 affirmations intactes — 99.2 %, zéro altérée, zéro ajoutée, zéro nuance perdue. Chaque chiffre, nom, date, prix, et l'unique citation verbatim du PDG ont survécu. La restructuration libre n'a pas cassé la charge utile.
Le tableau honnête à cinq voies
Chaque bras, chaque chiffre, résultats négatifs inclus :
| Métrique | Base | v1 | v2 | v3 | v4 (mise en service) |
|---|---|---|---|---|---|
| Tics mécaniques restants (sur 103) | 4 | 4 | 13 | 12 | 2 |
| IA-itude, médiane¹ (plus bas = plus humain) | 27 | 32.5 | 46.5 | 45 | 26 |
| Affirmations intactes (sur 130) | 127 (97.7 %) | 127 (97.7 %) | 130 (100 %) | 130 (100 %) | 129 (99.2 %) |
| altérées / abandonnées / ajoutées | 2 / 1 / 0 | 1 / 2 / 0 | 0 / 0 / 0 | 0 / 0 / 0 | 0 / 1 / 0 |
| Préférence d'humanité en aveugle (skill V-N-D contre base) | — | 4-0-8 | 0-0-12 | 0-0-12 | 8-0-4 |
¹ Juge LLM en contexte et en aveugle (0–100), même famille de modèle que le réécrivain — étiqueté honnêtement, pas un détecteur. La médiane de la base a oscillé entre 27 et 30 selon les tours ; c'est la variance du juge, divulguée, pas lissée.
L'unique raté de v4 : l'explicatif OAuth a laissé tomber une glose d'acronyme — il a gardé « l'extension PKCE » et son objectif, mais pas le développement complet « Proof Key for Code Exchange ». Compté strictement comme une affirmation abandonnée, par souci d'honnêteté. C'est une glose explicative, pas un chiffre, un nom, une date, une citation ou une nuance, et aucune affirmation n'a dérivé. C'est exactement le mode d'échec que risque la restructuration libre, il s'est produit une fois sur 130 affirmations, et c'est désormais corrigé dans l'étape de relecture (« préserver les développements d'acronymes »).
OBTENIR LE SKILL
text-humanizer est gratuit et sous licence MIT. Le dépôt est le skill — le benchmark complet, les cinq bras, les journaux d'échec et chaque audit d'affirmation sont livrés dedans.
Obtenir text-humanizer sur GitHubCe que nous n'affirmons pas
La victoire est réelle, mais ce n'est pas un raz-de-marée, et prétendre le contraire irait à l'encontre du but même du benchmark. Plusieurs textes étaient proches du pile-ou-face (25 contre 26, 26 contre 27, 26 contre 26). C'est une notation par juge unique, en contexte, issu de la même famille de modèle que le rédacteur — pas un détecteur externe — et le corpus a été rédigé par le même projet. Traitez la préférence de 8-4 et les chiffres d'IA-itude comme directionnels : « v4 franchit la barre », pas « v4 domine ». Le décompte de tics et l'audit d'affirmations sont les métriques solides.
Nous ne promettons pas de résultats face aux détecteurs. Les détecteurs se contredisent sur 15 à 25 % des textes et donnent des faux positifs sur de l'écriture humaine réelle. Ce skill reconstruit un texte en une voix humaine ; il ne vend pas une garantie de contournement, et si votre contexte exige une divulgation d'usage de l'IA — travail académique, politique d'éditeur — divulguez-la. Un humanizer est un éditeur, pas un déguisement. Un tour avec évaluateur humain ou détecteur en direct est la confirmation que nous recommandons avant de considérer le 8-4 comme définitif.
Pourquoi ça rend SkillProof digne de confiance
Nous aurions pu tourner quatre versions, enterrer les trois défaites, et livrer une page disant « notre humanizer bat la base 8-4 ». Chaque concurrent de ce créneau fait effectivement ça — affirme un chiffre, ne montre aucun du travail derrière.
Nous avons publié les trois échecs à la place. La sur-correction de v1, les deux défaites chirurgicales à 0-12, le diagnostic, l'inversion. Vous pouvez tout lire, relancer vous-même le décompte de tics scripté, et vérifier chaque audit d'affirmation dans le dépôt. C'est toute la proposition : nous testons les skills des autres pour vivre, et nos propres skills reçoivent le même traitement — mesurés, résultats négatifs inclus.
Il rejoint notre série discipline : token-discipline réduit ce que vos prompts coûtent, research-discipline réduit ce que votre recherche se trompe, et celui-ci réduit ce que votre écriture trahit.
PACK DE DÉMARRAGE GRATUIT
Envie de nos skills les mieux notés et de la checklist d'installation que nous suivons avant chaque test ? Nous vous envoyons le pack de démarrage gratuit par e-mail.
Obtenir le pack de démarrage gratuitInstallation
git clone https://github.com/Skillproofdev/text-humanizer ~/.claude/skills/text-humanizer
Redémarrez Claude Code. Il se déclenche sur « humanize this », « this sounds like AI / like ChatGPT », « make it sound natural », et les inquiétudes de détection d'IA — dans n'importe quelle langue. Il reste en retrait pour l'écriture de contenu neuf depuis zéro, les travaux de traduction et les tâches non textuelles.
FAQ
Pourquoi publier les trois échecs ? Parce qu'ils sont la preuve. N'importe qui peut affirmer « 8-4 contre la base ». Les trois défaites montrent que la victoire n'était ni chance ni juge réglé sur mesure — elle vient d'une intuition précise et testable (la structure prime sur le vocabulaire) qui n'a émergé qu'après trois défaites honnêtes. Les échecs sont ce qui rend le chiffre crédible.
Est-ce que ça bat les détecteurs d'IA ? Nous ne pouvons pas le dire, et nous ne prétendrons pas le contraire. Les API de détecteurs que nous prévoyions d'utiliser étaient toutes verrouillées par clé ou par paiement au moment de l'exécution, donc notre chiffre d'« IA-itude » est un juge LLM en contexte et en aveugle, pas un score de détecteur. Le skill retire les tics et reconstruit le texte en une voix humaine ; il ne vend pas de garantie de contournement de détecteur. Les détecteurs se contredisent sur 15 à 25 % des textes et donnent des faux positifs sur de l'écriture humaine authentique.
Restructurer mon texte va-t-il changer ce qu'il dit ? C'est toute la contrainte de conception. L'ensemble des affirmations — chaque chiffre, nom, date, citation et nuance, plus la direction et la force de chaque affirmation — est figé, et une passe finale obligatoire parcourt l'original affirmation par affirmation face à la réécriture pour restaurer toute dérive. Dans le benchmark, la restructuration libre a gardé 129 des 130 affirmations intactes (0 altérée, 0 ajoutée), l'unique raté étant une glose d'acronyme non porteuse, désormais corrigée.
La marge de 8-4 est-elle assez large pour qu'on lui fasse confiance ? Elle franchit notre barre fixée d'avance — gagner la préférence en aveugle — là où trois versions précédentes avaient perdu. Mais c'est une victoire nette, pas un raz-de-marée, venant d'un juge unique en contexte sur un corpus auto-rédigé. Traitez-la comme directionnelle et vérifiez vous-même les décisions à fort enjeu ; le décompte de tics et l'audit d'affirmations sont les métriques sur lesquelles nous miserions l'affirmation la plus forte.
★ 9.6/10 × 3
Le pack de démarrage gratuit
Les 3 skills avec nos meilleurs scores de test, plus la checklist d'installation — le setup qu'on mettrait sur une machine neuve. Gratuit, par e-mail.