
Vi feilet 3 ganger før humanizeren slo baseline
De fleste humanizer-verktøy er en umålt mønsterliste. Den største på markedet leverer 33 mønstre, 28 600 stjerner, og null tall — ingen detektorscorer, ingen meningssjekk, kun engelsk. Den betalte SaaS-flokken publiserer tall, men de er de feile — påståtte 99 %-omgåelsesrater som uavhengige tester klokker til rundt 66 %, oppnådd av parafraserere som mudrer til faktaene dine på veien gjennom.
Vi bygger testede Claude-skills til daglig, så vi satte oss fore å bygge en humanizer vi faktisk kunne måle. Og å måle den nesten drepte den. Vi publiserte tre SKILL.md-versjoner som tapte en blind menneskelighets-test mot den rå, ubehandlede KI-teksten. Den fjerde vant. Dette innlegget er hele buen — de tre tapene inkludert — fordi tapene er grunnen til at du bør stole på seieren.
Terskelen vi satte før vi skrev en linje
Oppsettet var fastlåst på forhånd. Tolv KI-genererte tekster på tvers av sjangre bygget for å stresse ulike feilmåter: blogg-innledninger, produkttekst, kunde-e-poster, faktatette tekniske forklaringer, et formelt memo (register-stress), et talltungt kvartalssammendrag, én ikke-engelsk tekst. Hver blir skrevet om to ganger — én gang av en baseline-Claude-agent bedt enkelt om «skriv om så det ikke høres KI-generert ut, behold meningen», og én gang av en identisk agent som leser SKILL.md-en vår først.
Tre metrikker, alle forhåndsregistrerte:
- En scriptet, reproduserbar telling av mekaniske KI-avsløringer (av 103 i korpuset).
- En påstand-for-påstand-meningsrevisjon mot fasit-inventarer skrevet før noen omskriving (130 påstander totalt).
- En blindet A/B-menneskelighets-preferanse: hvilken omskriving leser mer menneskelig?
Leveringsterskelen var brutal: skillen må vinne, eller klart få uavgjort mot, den blinde preferansen mot den naive baselinen. En humanizer der en blind leser foretrekker den ubehandlede versjonen, har ingen grunn til å eksistere.
Ett ærlig forbehold på forhånd, fordi det styrer alt under. Detektor-API-ene vi planla å bruke (GPTZero, Sapling, ZeroGPT) var alle nøkkel- eller betalingssperret da vi kjørte — curl-verifisert og logget. Så «KI-likhet» her er en blindet in-context LLM-dommer, ikke en detektorscore, og vi merker det som sådan overalt. Avsløringstellingen og påstandsrevisjonen er de objektive, reproduserbare tallene.
v1: overkorrigert til korporativ grøt
Den første versjonen skrev om aggressivt. Bytt ut avsløringene med rikere vokabular, omstrukturer med fri hånd. Resultatet leste verre.
Å bytte «leverage» mot et grandiosere synonym fjerner ikke en avsløring — det blåser teksten opp på nytt. v1 slipte bort de opplagte ordene og erstattet dem med registeret til en pressemelding. Verre: den aggressive omskrivingen drev meningen bort — den droppet to forhåndsregistrerte påstander (en målgruppe-rammende setning i blogginnlegget om fjernarbeid, et ord fra en ledertriade i den russiske teksten) og gikk korporativt stivt der kilden var varm.
Blind preferanse: base 8, v1 4. Dommeren fortsatte å velge baselinen for å beholde en lett menneskelig rammelegging som v1 flatet ut. Første versjon, første tap.
v2 og v3: underkorrigert, avsløringer stående igjen
v1-diagnosen så opplagt ut: den skrev for mye om. Så vi svingte motsatt vei — kirurgiske, minimale redigeringer som beskytter lesbarhet og mening. Det fikset faktaene perfekt og tapte hardere.
v2 traff meningsbevaring blink: 130/130 påstander intakte, null endret, droppet eller lagt til. Men minimal redigering underkorrigerer. Den lot «hjørnestein», «paradigmeskifte», «håper alt er bra med deg», «personlig helsekommandosentral» stå igjen på siden. Tretten gjenværende avsløringer mot baselinens fire. Den blinde dommeren plukket ut nøyaktig de frasene og vurderte v2 som markant mer maskinlaget.
Blind preferanse: base 12, v2 0. Hver eneste tekst.
v3 prøvde å dele forskjellen — en avslørings-til-vanlig-ord-erstatningstabell pluss en null-toleranse-gjennomskanningsport: fjern hver avsløring, erstatt enklere, aldri fancier. Den barberte de gjenværende avsløringene fra 13 til 12 og endret ingenting som betydde noe.
Blind preferanse: base 12, v3 0. Igjen, hver eneste tekst.
Innsikten etter tre tap: det handlet aldri om vokabular
Tre versjoner, null blind-preferanse-seire — kumulativt 4-0-28 inkludert v1, og 0-0-24 på tvers av de to kirurgiske forsøkene. Når du taper så konsekvent, er problemet ikke en bryter du satte feil. Det er rammen.
Her er hva dataene skrek. Baselinen vinner fordi den restrukturerer til en menneskelig stemme: den varierer rytmen, åpner inne i emnet, dropper det promoterende stillaset. Hver eneste av skill-versjonene våre forble sveiset fast til kildens KI-skjelett — emnesetning-åpneren, det ensartede avsnitts-formatet, tre-tings-listen, promo-rammingen. Vi pusset vokabular på en struktur som ropte «maskin» før et eneste ord var lest.
Det er kjernespenningen, demonstrert tre ganger: vårt unike salgspunkt — frys meningen — er nøyaktig det som holdt skillen så tett omfavnet rundt originalen at den aldri kunne bli mer menneskelig enn en fri omskriving. Faktasikkerhet og menneskelighet dro mot hverandre, og strukturell troskap tapte leseren hver gang.
KI-tekst avslører seg gjennom formen sin, ikke ordlisten sin. Å bytte «delve» med «se på» lar skjelettet stå igjen, og leseren føler fortsatt maskinen under.
v4: frys påstandene, gjenoppbygg strukturen
Fiksen var en metode-inversjon, ikke enda en justeringsrunde. Slutt å beskytte strukturen. Beskytt bare påstandssettet — hvert faktum, tall, navn, dato, sitat og forbehold, pluss retningen og styrken til hver påstand — og gjenoppbygg alt annet fritt. Omsekvenser. Slå sammen setninger. Skriv nye åpninger. Kutt stillas. Gjør det en skarp person gjør: les passasjen, forstå hva den påstår, og si det så igjen i din egen struktur.
Den opplagte risikoen er at fri restrukturering er den klassiske måten fakta driver bort på — så v4s påstandsrevisjon ble kjørt ekstra strengt, og det obligatoriske siste passet går gjennom originalen påstand for påstand mot omskrivingen, og gjenoppretter enhver drift, selv på bekostning av en renere linje.
Det virket. v4 er den første versjonen som slår baselinen: blind preferanse 8-4. KI-likhet var praktisk talt uavgjort (26 mot 27), og lavest avsløringstelling av noen arm — 2. Dommerens begrunnelser for seirene var alle strukturelle: kalde åpninger som starter inne i emnet (kvartalssammendraget leder nå med inntektstallet som en ekte telegramledetekst), listete stillas smeltet inn i prosa, register strammet men holdt i sjanger (memoet forblir formelt, e-posten forblir profesjonell).
Og faktaene holdt. 129 av 130 påstander intakte — 99.2 %, null endret, null lagt til, null forbehold tapt. Hvert tall, navn, dato, pris, og det ene ordrette CEO-sitatet overlevde. Fri restrukturering ødela ikke lasten.
Den ærlige 5-veis-tabellen
Hver arm, hvert tall, negative resultater inkludert:
| Metrikk | Base | v1 | v2 | v3 | v4 (leveres) |
|---|---|---|---|---|---|
| Gjenværende mekaniske avsløringer (av 103) | 4 | 4 | 13 | 12 | 2 |
| KI-likhet, median¹ (lavere = mer menneskelig) | 27 | 32.5 | 46.5 | 45 | 26 |
| Intakte påstander (av 130) | 127 (97.7 %) | 127 (97.7 %) | 130 (100 %) | 130 (100 %) | 129 (99.2 %) |
| endrede / droppede / tilføyde fakta | 2 / 1 / 0 | 1 / 2 / 0 | 0 / 0 / 0 | 0 / 0 / 0 | 0 / 1 / 0 |
| Blind menneskelighets-preferanse (skill S-U-T mot base) | — | 4-0-8 | 0-0-12 | 0-0-12 | 8-0-4 |
¹ Blindet in-context LLM-dommer (0–100), samme modellfamilie som omskriveren — ærlig merket, ikke en detektor. Base sin median vaklet 27–30 mellom runder; det er dommervarians, avslørt, ikke glattet ut.
Den ene v4-bommen: OAuth-forklaringen droppet én forkortelsesutdyping — den beholdt «PKCE-utvidelsen» og formålet dens, men ikke fullnavnutdypingen «Proof Key for Code Exchange». Telt strengt som én droppet påstand for ærlighetens skyld. Det er en forklarende utdyping, ikke et tall, navn, dato, sitat eller forbehold, og ingen påstand driftet. Det er nøyaktig feilmåten fri restrukturering risikerer, den dukket opp én gang av 130 påstander, og den er nå patchet inn i gjennomlesnings-steget («bevar forkortelsesutdypinger»).
HENT SKILLEN
text-humanizer er gratis og MIT-lisensiert. Repoet er skillen — hele benchmarken, alle fem armer, feillogger og hver enkelt påstandsrevisjon følger med i det.
Hent text-humanizer på GitHubHva vi ikke påstår
Seieren er reell, men den er ikke et overkjør, og å late som noe annet ville motarbeide hele poenget med å kjøre benchmarken. Flere tekster var nesten myntkast (25 mot 26, 26 mot 27, 26 mot 26). Dette er in-context enkeltdommer-scoring fra omskriverens egen modellfamilie — ikke en ekstern detektor — og korpuset ble forfattet av det samme prosjektet. Behandle 8-4-preferansen og KI-likhets-tallene som retningsgivende: «v4 klarer terskelen», ikke «v4 dominerer». Avsløringstellingen og påstandsrevisjonen er de solide metrikkene.
Vi lover ikke detektorresultater. Detektorer er uenige på 15–25 % av tekster og gir falske positive på ekte menneskelig skrift. Denne skillen bygger tekst om til en menneskelig stemme; den selger ikke en omgåelsesgaranti, og hvis konteksten din krever KI-avsløring — akademisk arbeid, forlagspolicy — avslør det. En humanizer er en redaktør, ikke en forkledning. En menneske-bedømmer- eller live-detektor-runde er bekreftelsen vi anbefaler før noen kaller 8-4 endelig.
Hvorfor dette gjør SkillProof til å stole på
Vi kunne ha kjørt fire versjoner, begravd de tre tapene, og levert en side som sa «vår humanizer slår baseline 8-4». Hver konkurrent i denne nisjen gjør effektivt akkurat det — påstår et tall, viser ingenting av arbeidet bak.
Vi publiserte de tre feilene i stedet. v1-overkorrigeringen, de to kirurgiske tapene på 0-12, diagnosen, inversjonen. Du kan lese alt av det, kjøre den scriptede avslørings-tellingen selv på nytt, og sjekke hver påstandsrevisjon i repoet. Det er hele påstanden: vi tester andres skills til daglig, og våre egne skills får samme behandling — målt, med negative resultater vedlagt.
Den inngår i vår disiplin-serie: token-discipline kutter hva promptene dine koster, research-discipline kutter hva researchen din bommer på, og denne kutter hva skrivingen din avslører.
GRATIS STARTPAKKE
Vil du ha våre høyest scorede skills pluss installasjonssjekklisten vi kjører før hver test? Vi sender deg den gratis startpakken på e-post.
Få den gratis startpakkenInstallasjon
git clone https://github.com/Skillproofdev/text-humanizer ~/.claude/skills/text-humanizer
Start Claude Code på nytt. Den trigger på «humaniser dette», «dette høres ut som KI / som ChatGPT», «få det til å høres naturlig ut», og KI-deteksjons-bekymringer — på ethvert språk. Den holder seg unna å skrive nytt innhold fra bunnen av, oversettelsesjobber, og ikke-tekst-oppgaver.
Ofte stilte spørsmål
Hvorfor publisere de tre feilene i det hele tatt? Fordi de er beviset. Hvem som helst kan påstå «8-4 over baseline». De tre tapene viser at seieren ikke var flaks eller en justert dommer — den kom fra en spesifikk, testbar innsikt (struktur slår vokabular) som først dukket opp etter tre ærlige nederlag. Feilene er det som gjør tallet troverdig.
Slår dette KI-detektorer? Vi kan ikke si det, og vi later ikke som vi kan. Detektor-API-ene vi planla å bruke var alle nøkkel- eller betalingssperret ved kjøretid, så «KI-likhet»-tallet vårt er en blindet in-context LLM-dommer, ikke en detektorscore. Skillen fjerner avsløringer og bygger tekst om til en menneskelig stemme; den selger ikke en detektor-omgåelsesgaranti. Detektorer er uenige på 15–25 % av tekster og gir falske positive på ekte menneskelig skrift.
Vil restrukturering av teksten min endre hva den sier? Det er hele designbegrensningen. Påstandssettet — hvert tall, navn, dato, sitat og forbehold, pluss retningen og styrken til hver påstand — er frosset, og et obligatorisk siste pass går gjennom originalen påstand for påstand mot omskrivingen for å gjenopprette enhver drift. I benchmarken holdt fri restrukturering 129 av 130 påstander intakte (0 endret, 0 lagt til), og den ene bommen var en ikke-bærende forkortelsesutdyping som nå er patchet.
Er 8-4-marginen stor nok til å stole på? Den klarer terskelen vi satte på forhånd — vinn den blinde preferansen — der tre tidligere versjoner tapte. Men det er en klar seier, ikke et overkjør, fra en enkelt in-context-dommer på et selvforfattet korpus. Behandle det som retningsgivende og bekreft de bærende avgjørelsene selv; avsløringstellingen og påstandsrevisjonen er metrikkene vi ville satset den sterkeste påstanden på.
★ 9.6/10 × 3
Den gratis startpakken
De 3 skillsene med våre høyeste testscorer pluss installasjonssjekklisten — oppsettet vi selv ville lagt på en fersk maskin. Gratis, på e-post.