Vi fejlede 3 gange før humanizeren slog baseline

Vi fejlede 3 gange før humanizeren slog baseline

De fleste humanizer-værktøjer er en umålt mønsterliste. Det største på markedet leverer 33 mønstre, 28.6k stjerner og nul tal — ingen detektorscorer, intet betydningstjek, kun engelsk. SaaS-flokken med betaling udgiver tal, men de er de forkerte: påståede 99%-omgåelsesrater, som uafhængige tests klokker til ~66%, opnået af parafraser, der ødelægger dine fakta på vejen igennem.

Vi bygger testede Claude-skills til daglig, så vi satte os for at bygge en humanizer, vi faktisk kunne måle. Og at måle den var nær ved at slå den ihjel. Vi udgav tre SKILL.md-versioner, der tabte en blind menneskelighedstest til den rå, ubehandlede AI-tekst. Den fjerde vandt. Det her indlæg er hele forløbet — de tre tab inkluderet — fordi tabene er grunden til, at du bør stole på sejren.

Standarden vi satte, før vi skrev en linje

Opsætningen var fastlagt på forhånd. Tolv AI-genererede tekster på tværs af genrer bygget til at stresse forskellige fejlmåder: blogintroer, produkttekst, klient-e-mails, faktatunge tekniske forklaringer, et formelt memo (registerstress), et taltungt regnskabsresumé, én ikke-engelsk tekst. Hver bliver omskrevet to gange — én gang af en baseline-Claude-agent bedt simpelt om "rewrite so it doesn't sound AI-generated, keep the meaning," og én gang af en identisk agent, der læser vores SKILL.md først.

Tre metrikker, alle forhåndsregistreret:

  1. En scriptet, reproducerbar optælling af mekaniske AI-fyldord (af 103 i korpuset).
  2. En påstand-for-påstand-betydningsrevision mod grundsandheds-lister skrevet før nogen omskrivning (130 påstande i alt).
  3. En blindet A/B-menneskelighedspræference: hvilken omskrivning læser mest menneskeligt?

Ship-grænsen var ligeud: skillen skal vinde, eller klart få uafgjort med, den blinde præference mod den naive baseline. En humanizer, en blind læser foretrækker den ubehandlede version af, har ingen grund til at findes.

Ét ærligt forbehold på forhånd, fordi det styrer alt nedenfor. Detektor-API'erne, vi planlagde at bruge (GPTZero, Sapling, ZeroGPT), var alle nøgle- eller betalingslåst, da vi kørte — curl-verificeret og logget. Så "AI-lighed" her er en blindet in-context-LLM-dommer, ikke en detektorscore, og vi mærker det som sådan overalt. Fyldord-optællingen og påstandsrevisionen er de objektive, reproducerbare tal.

v1: overkorrigeret til virksomhedsslam

Den første version omskrev aggressivt. Byt fyldordene ud med rigere ordforråd, omstrukturér med fri hånd. Resultatet læste værre.

At bytte "leverage" ud med et grandiost synonym fjerner ikke et fyldord — det puster teksten op igen. v1 slebet de åbenlyse ord af og erstattede dem med en pressemeddelelses register. Værre: den aggressive omskrivning drev betydningen af kurs — den droppede to forhåndsregistrerede påstande (en målgruppe-indramningssætning i remote-work-bloggen, et ord fra en leder-triple i den russiske tekst) og gik virksomhedsstiv, hvor kilden var varm.

Blind præference: base 8, v1 4. Dommeren blev ved med at vælge baselinen for at bevare en let menneskelig indramning, v1 fladtrykte. Første version, første tab.

v2 og v3: underkorrigeret, fyldord stod tilbage

v1-diagnosen så oplagt ud: den overomskrev. Så vi svingede den anden vej — kirurgiske, minimale rettelser, der beskytter læsbarhed og betydning. Det fikserede fakta perfekt og tabte hårdere.

v2 ramte betydningsbevarelse plet: 130/130 påstande intakte, nul ændret, droppet eller tilføjet. Men minimal redigering underkorrigerer. Den lod "cornerstone," "paradigm shift," "I hope this email finds you well," "personal health command center" stå på siden. Tretten resterende fyldord mod baselinens fire. Den blinde dommer flagede præcis de fraser og bedømte v2 markant mere maskinlavet.

Blind præference: base 12, v2 0. Hver eneste tekst.

v3 forsøgte at dele forskellen — en fyldord-til-almindeligt-ord-erstatningstabel plus en nul-tolerance-genscannings-port: fjern hvert fyldord, erstat simplere, aldrig fancy. Den barberede de resterende fyldord fra 13 til 12 og ændrede intet, der betød noget.

Blind præference: base 12, v3 0. Igen, hver eneste tekst.

Indsigten efter tre tab: det handlede aldrig om ordforråd

Tre versioner, nul blinde-præference-sejre — kumulativt 4-0-28 inklusive v1, og 0-0-24 på tværs af de to kirurgiske forsøg. Når du taber så konsekvent, er problemet ikke en drejeknap, du satte forkert. Det er rammen.

Her er, hvad dataene skreg. Baselinen vinder, fordi den omstrukturerer til en menneskelig stemme: den varierer rytmen, åbner inde i emnet, dropper det promoverende stillads. Hver eneste af vores skill-versioner forblev svejset til kildens AI-skelet — emnesætnings-åbneren, den ensartede afsnitsform, tre-i-en-liste-mønsteret, promo-rammen. Vi polerede ordforråd på en struktur, der annoncerede "maskine," før et eneste ord blev læst.

Det er kernespændingen, demonstreret tre gange: vores unikke salgsargument — frys betydningen — er præcis det, der holdt skillen så tæt klemt til originalen, at den aldrig kunne slå en fri omskrivning ud på menneskelighed. Faktasikkerhed og menneskelighed trak mod hinanden, og strukturel troskab tabte læseren hver eneste gang.

AI-tekst afslører sig selv ved sin form, ikke sin ordliste. At bytte "delve" ud med "look at" lader skelettet stå tilbage, og læseren føler stadig maskinen indeni.

v4: frys påstandene, genopbyg strukturen

Løsningen var en metodeinversion, ikke endnu en justeringsrunde. Stop med at beskytte strukturen. Beskyt kun påstandssættet — hver fakta, hvert tal, navn, dato, citat og forbehold, plus retningen og styrken af hver påstand — og genopbyg alt andet frit. Omsekvensér. Slå sætninger sammen. Skriv nye åbninger. Skær stillads. Gør, hvad en skarp person gør: læs afsnittet, forstå hvad det påstår, sig det så igen i din egen struktur.

Den oplagte risiko er, at fri omstrukturering er den klassiske måde at drive fakta væk på — så v4's påstandsrevision blev kørt ekstra strengt, og det obligatoriske sidste trin går den originale påstand for påstand igennem mod omskrivningen og gendanner enhver afvigelse, selv på bekostning af en renere linje.

Det virkede. v4 er den første version, der slår baselinen: blind præference 8-4. AI-lighed var i det væsentlige uafgjort (26 mod 27), og det laveste fyldords-antal af nogen arm — 2. Dommerens begrundelser for sejrene var alle strukturelle: kolde åbninger, der starter inde i emnet (regnskabsresuméet leder nu med omsætningstallet som en rigtig telegramnyhed), listet stillads slået sammen til prosa, register strammet, men holdt i genre (memoet forbliver formelt, e-mailen forbliver professionel).

Og fakta holdt. 129 af 130 påstande intakte — 99.2%, nul ændret, nul tilføjet, nul forbehold tabt. Hvert tal, navn, dato, pris og det ene ordrette CEO-citat overlevede. Fri omstrukturering ødelagde ikke lasten.

Den ærlige 5-vejs-tabel

Hver arm, hvert tal, negative resultater inkluderet:

Metrik Base v1 v2 v3 v4 (leveres)
Mekaniske fyldord tilbage (af 103) 4 4 13 12 2
AI-lighed, median¹ (lavere = mere menneskelig) 27 32.5 46.5 45 26
Påstande intakte (af 130) 127 (97.7%) 127 (97.7%) 130 (100%) 130 (100%) 129 (99.2%)
ændret / droppet / tilføjet fakta 2 / 1 / 0 1 / 2 / 0 0 / 0 / 0 0 / 0 / 0 0 / 1 / 0
Blind menneskelighedspræference (skill V-U-T mod base) 4-0-8 0-0-12 0-0-12 8-0-4

¹ Blindet in-context-LLM-dommer (0–100), samme modelfamilie som omskriveren — mærket ærligt, ikke en detektor. Bases median vaklede 27–30 mellem runder; det er dommervarians, oplyst, ikke udjævnet.

Det ene v4-miss: OAuth-forklaringen droppede én forkortelses-udfoldning — den beholdt "the PKCE extension" og dens formål, men ikke den fulde udfoldning "Proof Key for Code Exchange." Talt strengt som én droppet påstand for ærlighedens skyld. Det er en forklarende udfoldning, ikke et tal, navn, dato, citat eller forbehold, og ingen påstand afveg. Det er præcis den fejlmåde, fri omstrukturering risikerer, den viste sig én gang ud af 130 påstande, og den er nu rettet ind i genlæsnings-trinnet ("preserve acronym expansions").

HENT SKILLEN

text-humanizer er gratis og MIT-licenseret. Repoet er skillen — hele benchmarken, alle fem arme, fejlloggene og hver eneste påstandsrevision leveres indeni.

Hent text-humanizer på GitHub

Hvad vi ikke påstår

Sejren er reel, men den er ikke et jordskred, og at lade som om andet ville besejre hele pointen med at køre benchmarken. Flere tekster var nær plat-eller-krone (25 mod 26, 26 mod 27, 26 mod 26). Det her er in-context enkelt-dommer-scoring fra omskriverens egen modelfamilie — ikke en ekstern detektor — og korpuset blev forfattet af det samme projekt. Behandl 8-4-præferencen og AI-lighedstallene som retningsgivende: "v4 clears the bar," ikke "v4 dominates." Fyldords-optællingen og påstandsrevisionen er de solide metrikker.

Vi lover ikke detektorresultater. Detektorer er uenige om 15–25% af tekster og falsk-positiv på ægte menneskeskrevet tekst. Den her skill genopbygger tekst til en menneskelig stemme; den sælger ikke en omgåelsesgaranti, og hvis din kontekst kræver AI-oplysning — akademisk arbejde, forlagspolitik — så oplys det. En humanizer er en redaktør, ikke en forklædning. En menneske-bedømmer- eller live-detektor-runde er den bekræftelse, vi anbefaler, før nogen kalder 8-4 for endelig.

Hvorfor det her gør SkillProof troværdig

Vi kunne have kørt fire versioner, begravet de tre tab og udgivet en side, der sagde "our humanizer beats the baseline 8-4." Enhver konkurrent i den her niche gør reelt det — påstår et tal, viser intet af arbejdet bag.

Vi udgav de tre fejl i stedet. v1-overkorrektionen, de to kirurgiske tab på 0-12, diagnosen, inversionen. Du kan læse det hele, gen-køre den scriptede fyldords-optælling selv og tjekke hver eneste påstandsrevision i repoet. Det er hele præmissen: vi tester andre folks skills til daglig, og vores egne skills får den samme behandling — målt, med negative resultater vedhæftet.

Den slutter sig til vores disciplin-serie: token-discipline skærer i, hvad dine prompts koster, research-discipline skærer i, hvad din research tager fejl om, og den her skærer i, hvad din tekst afslører.

GRATIS STARTERPAKKE

Vil du have vores højest scorede skills plus den installationstjekliste, vi kører før hver eneste test? Vi sender dig den gratis starterpakke på mail.

Få den gratis starterpakke

Installation

git clone https://github.com/Skillproofdev/text-humanizer ~/.claude/skills/text-humanizer

Genstart Claude Code. Den udløses af "humanize this," "this sounds like AI / like ChatGPT," "make it sound natural," og AI-detektionsbekymringer — på ethvert sprog. Den holder sig væk fra at skrive nyt indhold fra bunden, oversættelsesopgaver og ikke-tekst-opgaver.

FAQ

Hvorfor udgive de tre fejl overhovedet? Fordi de er beviset. Alle kan påstå "8-4 over baseline." De tre tab viser, at sejren ikke var held eller en tunet dommer — den kom fra en specifik, testbar indsigt (struktur slår ordforråd), der først dukkede op efter tre ærlige nederlag. Fejlene er det, der gør tallet troværdigt.

Slår det her AI-detektorer? Det kan vi ikke sige, og vi lader ikke som om. Detektor-API'erne, vi planlagde at bruge, var alle nøgle- eller betalingslåst ved kørselstidspunktet, så vores "AI-lighed"-tal er en blindet in-context-LLM-dommer, ikke en detektorscore. Skillen fjerner fyldord og genopbygger tekst til en menneskelig stemme; den sælger ikke en detektor-omgåelsesgaranti. Detektorer er uenige om 15–25% af tekster og falsk-positiv på ægte menneskeskrevet tekst.

Vil omstrukturering af min tekst ændre, hvad den siger? Det er hele designbegrænsningen. Påstandssættet — hvert tal, navn, dato, citat og forbehold, plus retningen og styrken af hver påstand — er frosset, og et obligatorisk sidste trin går den originale påstand for påstand igennem mod omskrivningen for at gendanne enhver afvigelse. I benchmarken holdt fri omstrukturering 129 af 130 påstande intakte (0 ændret, 0 tilføjet), det ene miss var en ikke-bærende forkortelses-udfoldning, nu rettet.

Er 8-4-marginen stor nok til at stole på? Den klarer vores forhåndssatte grænse — vind den blinde præference — hvor tre tidligere versioner tabte. Men det er en klar sejr, ikke et jordskred, fra en enkelt in-context-dommer på et selvforfattet korpus. Behandl det som retningsgivende, og bekræft selv de bærende beslutninger; fyldords-optællingen og påstandsrevisionen er de metrikker, vi ville sætte den stærkeste påstand på.

★ 9.6/10 × 3

Den gratis startpakke

De 3 skills med vores højeste testscorer plus installations-tjeklisten — det setup, vi selv ville lægge på en frisk maskine. Gratis, på mail.

Én mail med pakken + et kort ugentligt overblik over nye testresultater. Afmeld når som helst.