Drie keer gefaald voor deze humanizer de baseline versloeg

Drie keer gefaald voor deze humanizer de baseline versloeg

De meeste humanizer-tools zijn een ongemeten patroonlijst. De grootste op de markt levert 33 patronen, 28,6k sterren, en nul cijfers — geen detectorscores, geen betekeniscontrole, alleen Engels. De betaalde SaaS-groep publiceert wel cijfers, maar de verkeerde: beweerde bypass-percentages van 99% die onafhankelijke tests op ~66% klokken, bereikt door paraphrasers die je feiten onderweg verhaspelen.

Wij bouwen geteste Claude-skills voor de kost, dus wilden we een humanizer bouwen die we ook echt konden meten. En het meten had hem bijna gekilld. We publiceerden drie SKILL.md-versies die een blinde mensheidstest verloren van de ruwe, onbewerkte AI-tekst. De vierde won. Deze post is de hele boog — de drie verliezen inbegrepen — omdat de verliezen de reden zijn dat je de winst kunt vertrouwen.

De lat die we vastlegden voordat we een regel schreven

De opzet lag vooraf vast. Twaalf AI-gegenereerde teksten over verschillende genres, gebouwd om uiteenlopende faalpatronen te stresstesten: blog-intro's, productteksten, klantmails, feitendichte technische uitleg, een formeel memo (registerstress), een cijferdichte kwartaalsamenvatting, één niet-Engelse tekst. Elke tekst wordt twee keer herschreven — één keer door een baseline-Claude-agent die simpelweg te horen kreeg "herschrijf zodat het niet AI-gegenereerd klinkt, behoud de betekenis," en één keer door een identieke agent die eerst onze SKILL.md leest.

Drie metrieken, allemaal vooraf vastgelegd:

  1. Een gescripte, reproduceerbare telling van mechanische AI-tics (van 103 in het corpus).
  2. Een claim-voor-claim-betekenisaudit tegen ground-truth-inventarissen geschreven vóór elke herschrijving (130 claims totaal).
  3. Een blinde A/B-voorkeur voor menselijkheid: welke herschrijving leest menselijker?

De lat om te verzenden was bot: de skill moet winnen, of duidelijk gelijkspelen, tegen de naïeve baseline op de blinde voorkeur. Een humanizer waarvan een blinde lezer de onbewerkte versie verkiest, heeft geen bestaansrecht.

Eén eerlijke kanttekening vooraf, want die bepaalt alles hieronder. De detector-API's die we wilden gebruiken (GPTZero, Sapling, ZeroGPT) waren allemaal key- of betaalgated toen we draaiden — curl-geverifieerd en gelogd. Dus "AI-gehalte" hier is een geblindeerde in-context-LLM-rechter, geen detectorscore, en we labelen het overal als zodanig. De tics-telling en de claimaudit zijn de objectieve, reproduceerbare cijfers.

v1: overgecorrigeerd tot corporate drab

De eerste versie herschreef agressief. Ruil de tics voor rijkere woordenschat, herstructureer met een vrije hand. Het resultaat las slechter.

"Leverage" inruilen voor een groter synoniem verwijdert geen tic — het blaast de tekst opnieuw op. v1 schuurde de voor de hand liggende woorden weg en verving ze door het register van een persbericht. Erger nog, het agressieve herschrijven liet de betekenis afdrijven: het liet twee vooraf vastgelegde claims vallen (een doelgroep-framingzin in de remote-work-blog, een woord uit een leiderschapstrio in de Russische tekst) en werd corporate-stijf waar de bron warm was.

Blinde voorkeur: base 8, v1 4. De rechter bleef de baseline kiezen omdat die een lichte menselijke framing behield die v1 platsloeg. Eerste versie, eerste verlies.

v2 en v3: ondergecorrigeerd, tics bleven staan

De v1-diagnose leek duidelijk: hij herschreef te veel. Dus zwaaiden we de andere kant op — chirurgische, minimale wijzigingen die leesbaarheid en betekenis beschermen. Dat fixte de feiten perfect en verloor harder.

v2 spijkerde betekenisbehoud perfect vast: 130/130 claims intact, nul gewijzigd, weggevallen of toegevoegd. Maar minimaal bewerken ondercorrigeert. Het liet "hoeksteen," "paradigmaverschuiving," "ik hoop dat deze mail je goed bereikt," "persoonlijk gezondheidscommandocentrum" gewoon op de pagina staan. Dertien resterende tics tegenover de vier van de baseline. De blinde rechter markeerde precies die zinnen en beoordeelde v2 duidelijk machinaler.

Blinde voorkeur: base 12, v2 0. Elke tekst.

v3 probeerde het verschil te splitsen — een vervangingstabel van tic naar gewoon woord plus een nultolerantie-herscangate: verwijder elke tic, vervang simpeler, nooit chiquer. Dat schaafde de resterende tics van 13 naar 12 en veranderde niets wat ertoe deed.

Blinde voorkeur: base 12, v3 0. Weer, elke tekst.

Het inzicht na drie verliezen: het ging nooit om woordenschat

Drie versies, nul blinde-voorkeurswinsten — cumulatief 4-0-28 inclusief v1, en 0-0-24 over de twee chirurgische pogingen. Als je zo consistent verliest, ligt het probleem niet aan een knop die je verkeerd zette. Het is het frame.

Dit schreeuwden de data ons toe. De baseline wint omdat hij herstructureert naar een menselijke stem: hij varieert het ritme, opent midden in het onderwerp, laat de promotionele scaffolding vallen. Elke versie van onze skill bleef vastgelast aan het AI-skelet van de bron — de topiczin-opener, de uniforme alineavorm, de rule-of-three-lijst, de promoframing. We polijstten woordenschat op een structuur die "machine" al aankondigde voordat er één woord gelezen was.

Dat is de kernspanning, drie keer aangetoond: ons unieke verkoopargument — bevries de betekenis — is precies wat de skill zo strak aan het origineel liet vastplakken dat hij een vrije herschrijving nooit menselijker kon overtreffen. Feitenveiligheid en menselijkheid trokken tegen elkaar in, en structurele trouw verloor de lezer elke keer.

AI-tekst verraadt zichzelf door zijn vorm, niet zijn woordenlijst. "Uitdiepen" inruilen voor "bekijken" laat het skelet overeind — de lezer voelt de machine er nog steeds onder.

v4: bevries de claims, herbouw de structuur

De fix was een methode-inversie, geen nieuwe afstelronde. Stop met de structuur te beschermen. Bescherm alleen de claimset — elk feit, cijfer, naam, datum, citaat en voorbehoud, plus de richting en sterkte van elke claim — en herbouw al het andere vrij. Herschik. Voeg zinnen samen. Schrijf nieuwe openingen. Schrap scaffolding. Doe wat een scherpe mens doet: lees de passage, begrijp wat ze claimt, en zeg het dan opnieuw in je eigen structuur.

Het voor de hand liggende risico is dat vrije herstructurering de klassieke manier is om feiten te laten afdrijven — dus de claimaudit van v4 draaide extra strikt, en de verplichte laatste pass loopt de originele claim voor claim tegen de herschrijving langs, en herstelt elke afwijking, zelfs ten koste van een netter lopende zin.

Het werkte. v4 is de eerste versie die de baseline verslaat: blinde voorkeur 8-4. AI-gehalte stond vrijwel gelijk (26 tegen 27), en het laagste tics-aantal van elke arm — 2. De redenen van de rechter voor de winst waren allemaal structureel: koude openingen die midden in het onderwerp beginnen (de kwartaalsamenvatting opent nu met het omzetcijfer als een echte persbureau-lede), lijstscaffolding samengevoegd tot proza, register strakker maar in-genre gehouden (het memo blijft formeel, de mail blijft professioneel).

En de feiten hielden stand. 129 van de 130 claims intact — 99,2%, nul gewijzigd, nul toegevoegd, nul voorbehouden weggevallen. Elk cijfer, elke naam, elke datum, elke prijs, en het ene letterlijke CEO-citaat overleefden. Vrije herstructurering brak de lading niet.

De eerlijke tabel met vijf armen

Elke arm, elk cijfer, negatieve resultaten inbegrepen:

Metriek Base v1 v2 v3 v4 (verzonden)
Mechanische tics over (van 103) 4 4 13 12 2
AI-gehalte, mediaan¹ (lager = menselijker) 27 32,5 46,5 45 26
Claims intact (van 130) 127 (97,7%) 127 (97,7%) 130 (100%) 130 (100%) 129 (99,2%)
gewijzigd / weggevallen / toegevoegde feiten 2 / 1 / 0 1 / 2 / 0 0 / 0 / 0 0 / 0 / 0 0 / 1 / 0
Blinde mensheidsvoorkeur (skill W-T-L t.o.v. base) 4-0-8 0-0-12 0-0-12 8-0-4

¹ Geblindeerde in-context-LLM-rechter (0–100), zelfde modelfamilie als de herschrijver — eerlijk gelabeld, geen detector. Base's mediaan wiebelde 27–30 tussen rondes; dat is rechtervariantie, bekendgemaakt, niet gladgestreken.

De enige v4-misser: de OAuth-uitleg liet één afkortingsuitleg vallen — hij behield "de PKCE-extensie" en zijn doel maar niet de volledige naam "Proof Key for Code Exchange." Strikt geteld als één weggevallen claim voor de eerlijkheid. Het is een verklarende toelichting, geen cijfer, naam, datum, citaat of voorbehoud, en geen enkele claim dreef af. Dat is precies het faalpatroon dat vrije herstructurering riskeert, het kwam één keer voor in 130 claims, en het is nu gepatcht in de herleesstap ("bewaar afkortingsuitleg").

HAAL DE SKILL

text-humanizer is gratis en MIT-licensed. De repo is de skill — de volledige benchmark, alle vijf armen, de faallogs en elke claimaudit zitten erin.

Haal text-humanizer op GitHub

Wat we niet claimen

De winst is echt, maar het is geen uitblinker, en doen alsof zou het hele punt van de benchmark ondermijnen. Verschillende teksten waren bijna een muntworp (25 tegen 26, 26 tegen 27, 26 tegen 26). Dit is in-context enkelvoudige-rechter-scoring van de eigen modelfamilie van de herschrijver — geen externe detector — en het corpus is door hetzelfde project geschreven. Behandel de 8-4-voorkeur en de AI-gehalte-cijfers als richtinggevend: "v4 haalt de lat," niet "v4 domineert." De tics-telling en de claimaudit zijn de solide metrieken.

We beloven geen detectorresultaten. Detectoren zijn het bij 15–25% van de teksten oneens, en geven false positives op echt menselijke tekst. Deze skill herbouwt tekst naar een menselijke stem; hij verkoopt geen bypass-garantie, en als jouw context AI-bekendmaking vereist — academisch werk, uitgeversbeleid — maak dat dan bekend. Een humanizer is een redacteur, geen vermomming. Een menselijke-beoordelaar- of live-detectorronde is de bevestiging die we aanraden voordat iemand de 8-4-eindstand uitroept.

Waarom dit SkillProof betrouwbaar maakt

We hadden vier versies kunnen draaien, de drie verliezen kunnen begraven, en een pagina kunnen uitbrengen die zegt "onze humanizer verslaat de baseline 8-4." Elke concurrent in deze niche doet in feite precies dat — beweert een cijfer, toont er geen werk achter.

Wij publiceerden de drie mislukkingen in plaats daarvan. De v1-overcorrectie, de twee chirurgische verliezen op 0-12, de diagnose, de inversie. Je kunt het allemaal lezen, de gescripte tics-telling zelf herdraaien, en elke claimaudit in de repo controleren. Dat is het hele voorstel: wij testen andermans skills voor de kost, en onze eigen skills krijgen dezelfde behandeling — gemeten, met negatieve resultaten erbij.

Hij hoort bij onze discipline-reeks: token-discipline verlaagt wat je prompts kosten, research-discipline verlaagt wat je research fout heeft, en deze verlaagt wat je tekst verraadt.

GRATIS STARTERPACK

Wil je onze best scorende skills plus de installchecklist die we voor elke test draaien? We mailen je de gratis starterpack.

Haal de gratis starterpack

Installatie

git clone https://github.com/Skillproofdev/text-humanizer ~/.claude/skills/text-humanizer

Herstart Claude Code. Hij triggert op "humaniseer dit," "dit klinkt als AI / als ChatGPT," "laat het natuurlijk klinken," en zorgen over AI-detectie — in elke taal. Hij blijft weg bij het vanaf nul schrijven van nieuwe content, vertaalklussen en niet-tekstuele taken.

FAQ

Waarom de drie mislukkingen überhaupt publiceren? Omdat ze het bewijs zijn. Iedereen kan "8-4 tegenover baseline" beweren. De drie verliezen laten zien dat de winst geen geluk of een afgestelde rechter was — hij kwam uit een specifiek, testbaar inzicht (structuur wint van woordenschat) dat pas na drie eerlijke nederlagen naar boven kwam. De mislukkingen zijn wat het cijfer geloofwaardig maakt.

Verslaat dit AI-detectoren? Dat kunnen we niet zeggen, en we doen niet alsof. De detector-API's die we wilden gebruiken waren allemaal key- of betaalgated toen we draaiden, dus ons "AI-gehalte"-cijfer is een geblindeerde in-context-LLM-rechter, geen detectorscore. De skill verwijdert tics en herbouwt tekst naar een menselijke stem; hij verkoopt geen detector-bypassgarantie. Detectoren zijn het bij 15–25% van de teksten oneens en geven false positives op echte menselijke tekst.

Verandert herstructurering wat mijn tekst zegt? Dat is de hele ontwerpbeperking. De claimset — elk cijfer, naam, datum, citaat en voorbehoud, plus de richting en sterkte van elke claim — ligt vast, en een verplichte laatste pass loopt de originele claim voor claim tegen de herschrijving langs om afwijkingen te herstellen. In de benchmark hield vrije herstructurering 129 van de 130 claims intact (0 gewijzigd, 0 toegevoegd), waarbij de enige misser een niet-dragende afkortingsuitleg was die nu gepatcht is.

Is de marge van 8-4 groot genoeg om te vertrouwen? Hij haalt onze vooraf vastgelegde lat — win de blinde voorkeur — waar drie eerdere versies verloren. Maar het is een duidelijke winst, geen uitblinker, van één in-context-rechter op een zelfgeschreven corpus. Behandel het als richtinggevend en controleer de dragende beslissingen zelf; de tics-telling en de claimaudit zijn de metrieken waar we de sterkste claim op zouden durven zetten.

★ 9.6/10 × 3

Het gratis starterspakket

De 3 skills met onze hoogste testscores plus de installatiechecklist — de setup die wij op een verse machine zouden zetten. Gratis, per e-mail.

Eén e-mail met het pakket + een korte wekelijkse digest met nieuwe testresultaten. Uitschrijven kan altijd.