Vi misslyckades 3 gånger innan humanizern vann

Vi misslyckades 3 gånger innan humanizern vann

De flesta humanizer-verktyg är en omätt mönsterlista. Den största på marknaden levererar 33 mönster, 28 600 stjärnor och noll siffror — inga detektorpoäng, ingen betydelsekontroll, bara engelska. De betalda SaaS-aktörerna publicerar siffror, men det är fel siffror: påstådda 99%-kringgåendegrad som oberoende tester klockar till ~66%, uppnått av omskrivare som förvanskar dina fakta på vägen igenom.

Vi bygger testade Claude-skills för att leva, så vi satte oss för att bygga en humanizer vi faktiskt kunde mäta. Och att mäta den höll på att döda den. Vi publicerade tre SKILL.md-versioner som förlorade ett blint mänsklighetstest mot den råa, obehandlade AI-texten. Den fjärde vann. Det här inlägget är hela bågen — de tre förlusterna inkluderade — för förlusterna är anledningen till att du ska lita på vinsten.

Ribban vi satte innan vi skrev en rad

Upplägget fastställdes i förväg. Tolv AI-genererade texter över genrer byggda för att stressa olika felmönster: blogginledningar, produkttext, kundmejl, faktatäta tekniska förklaringar, ett formellt memo (registerstress), en siffertät resultatsammanfattning, en icke-engelsk text. Var och en skrivs om två gånger — en gång av en basagent ombedd helt enkelt "skriv om så det inte låter AI-genererat, behåll betydelsen," och en gång av en identisk agent som läser vår SKILL.md först.

Tre mått, alla förregistrerade:

  1. Ett skriptat, reproducerbart antal mekaniska AI-avslöjare (av 103 i korpusen).
  2. En betydelsegranskning påstående för påstående mot facitlistor skrivna innan någon omskrivning.
  3. En blindad A/B-preferens för mänsklighet: vilken omskrivning läses mer mänskligt?

Ribban var rak på sak: skillen måste vinna, eller tydligt dela, den blinda preferensen mot den naiva baslinjen. En humanizer som en blind läsare föredrar den obehandlade versionen av har ingen anledning att finnas.

Ett ärligt förbehåll först, för det styr allt nedan. Detektor-API:erna vi planerade att använda (GPTZero, Sapling, ZeroGPT) var alla nyckel- eller betalspärrade när vi körde — curl-verifierat och loggat. Så "AI-likhet" här är en blindad domare i kontext, inte en detektorpoäng, och vi märker det som sådant överallt. Antalet avslöjare och betydelsegranskningen är de objektiva, reproducerbara siffrorna.

v1: överkorrigerad till företagssörja

Den första versionen skrev om aggressivt. Byt ut avslöjarna mot rikare vokabulär, omstrukturera fritt. Resultatet läste sämre.

Att byta "leverage" mot en mer pampig synonym tar inte bort en avslöjare — den blåser upp texten igen. v1 slipade bort de uppenbara orden och ersatte dem med ett pressmeddelandes register. Värre, den aggressiva omskrivningen drev betydelsen: den tappade två förregistrerade påståenden (en målgruppsformulerande mening i distansarbetsbloggen, ett ord ur en ledarskapstrippel i den ryska texten) och blev företagsstel där källan var varm.

Blind preferens: bas 8, v1 4. Domaren fortsatte att välja baslinjen för att den behöll en lätt mänsklig framtoning v1 hade plattat till. Första versionen, första förlusten.

v2 och v3: underkorrigerade, avslöjare kvar

v1-diagnosen såg uppenbar ut: den skrev om för mycket. Så vi svängde åt andra hållet — kirurgiska, minimala ändringar som skyddar läsbarhet och betydelse. Det fixade fakta perfekt och förlorade hårdare.

v2 fick betydelsebevarande helt rätt: 130/130 påståenden intakta, noll ändrade, tappade eller tillagda. Men minimal redigering underkorrigerar. Den lämnade "hörnsten," "paradigmskifte," "jag hoppas det här mejlet finner dig väl," "personlig hälsokommandocentral" stående på sidan. Tretton kvarvarande avslöjare mot baslinjens fyra. Den blinda domaren flaggade precis de fraserna och bedömde v2 som markant mer maskinell.

Blind preferens: bas 12, v2 0. Varenda text.

v3 försökte dela skillnaden — en ersättningstabell från avslöjare till vanligt ord plus en nolltoleransgenomsökning: ta bort varje avslöjare, ersätt med enklare, aldrig finare. Den skar de kvarvarande avslöjarna från 13 till 12 och ändrade inget som spelade roll.

Blind preferens: bas 12, v3 0. Igen, varenda text.

Insikten efter tre förluster: det handlade aldrig om vokabulär

Tre versioner, noll vinster i blind preferens — sammanlagt 4-0-28 inklusive v1, och 0-0-24 över de två kirurgiska försöken. När du förlorar så konsekvent är problemet ingen ratt du ställde fel. Det är ramen.

Här är vad datan skrek. Baslinjen vinner för att den omstrukturerar till en mänsklig röst: den varierar rytm, öppnar inne i ämnet, tappar den säljande stödstrukturen. Varje version av vår skill förblev svetsad fast vid källans AI-skelett — inledningen med ämnesmening, det enhetliga styckeformatet, listan i tretal, säljramen. Vi polerade vokabulär på en struktur som ropade "maskin" innan ett enda ord hade lästs.

Det är kärnspänningen, visad tre gånger om: vår unika säljpunkt — frys betydelsen — är exakt det som höll skillen så tätt kramande om originalet att den aldrig kunde bli mer mänsklig än en fri omskrivning. Faktasäkerhet och mänsklighet drog åt olika håll, och strukturell trohet förlorade läsaren varje gång.

AI-text avslöjar sig genom sin form, inte sin ordlista. Att byta "delve" mot "titta på" lämnar skelettet stående, och läsaren känner fortfarande maskinen därunder.

v4: frys påståendena, bygg om strukturen

Fixen var en metodinvertering, inte ännu en justeringsrunda. Sluta skydda strukturen. Skydda bara påståendemängden — varje fakta, siffra, namn, datum, citat och reservation, plus riktningen och styrkan i varje påstående — och bygg om allt annat fritt. Ordna om. Slå ihop meningar. Skriv nya inledningar. Skär bort stödstrukturen. Gör det en skarp människa gör: läs passagen, förstå vad den påstår, säg det sedan igen med din egen struktur.

Den uppenbara risken är att fri omstrukturering är det klassiska sättet betydelse driver iväg på — så v4:s betydelsegranskning kördes extra strikt, och det obligatoriska sista passet går igenom originalet påstående för påstående mot omskrivningen och återställer all drift, även på bekostnad av en renare rad.

Det funkade. v4 är den första versionen som slår baslinjen: blind preferens 8-4. AI-likheten var i praktiken oavgjord (26 mot 27), och lägsta avslöjarantalet av alla grenar — 2. Domarens skäl för vinsterna var alla strukturella: kalla öppningar som börjar inne i ämnet (resultatsammanfattningen inleder nu med intäktssiffran som en riktig nyhetsbyråingress), listformad stödstruktur sammanslagen till prosa, register åtstramat men kvar i genren (memot förblir formellt, mejlet förblir professionellt).

Och fakta höll. 129 av 130 påståenden intakta — 99,2%, noll ändrade, noll tillagda, noll tappade reservationer. Varje siffra, namn, datum, pris och det enda ordagranna VD-citatet överlevde. Fri omstrukturering bröt inte lasten.

Den ärliga femvägstabellen

Varje gren, varje siffra, negativa resultat inkluderade:

Mått Bas v1 v2 v3 v4 (levereras)
Mekaniska avslöjare kvar (av 103) 4 4 13 12 2
AI-likhet, median¹ (lägre = mer mänskligt) 27 32,5 46,5 45 26
Påståenden intakta (av 130) 127 (97,7%) 127 (97,7%) 130 (100%) 130 (100%) 129 (99,2%)
ändrade / tappade / tillagda fakta 2 / 1 / 0 1 / 2 / 0 0 / 0 / 0 0 / 0 / 0 0 / 1 / 0
Blind mänsklighetspreferens (skill V-O-F mot bas) 4-0-8 0-0-12 0-0-12 8-0-4

¹ Blindad domare i kontext (0–100), samma modellfamilj som omskrivaren — ärligt märkt, inte en detektor. Basens median vinglade 27–30 mellan rundor; det är domarvarians, redovisad, inte utjämnad.

Det enda v4-missen: OAuth-förklaringen tappade en akronymförklaring — den behöll "PKCE-tillägget" och dess syfte men inte det fullständiga namnet "Proof Key for Code Exchange." Räknat strikt som ett tappat påstående för ärlighetens skull. Det är en förklarande gloss, ingen siffra, inget namn, datum, citat eller reservation, och inget påstående drev iväg. Det är exakt det felmönster fri omstrukturering riskerar, det dök upp en gång på 130 påståenden, och det är nu inpatchat i omläsningssteget ("bevara akronymförklaringar").

HÄMTA SKILLEN

text-humanizer är gratis och MIT-licensierad. Repot är skillen — hela benchmarket, alla fem grenarna, felloggarna och varje granskning per påstående levereras i det.

Hämta text-humanizer på GitHub

Vad vi inte påstår

Vinsten är riktig, men den är inget rent svep, och att låtsas något annat skulle motverka hela poängen med att köra benchmarket. Flera texter var nära myntkast (25 mot 26, 26 mot 27, 26 mot 26). Det här är enskild domarpoängsättning i kontext från omskrivarens egen modellfamilj — inte en extern detektor — och korpusen var skriven av samma projekt. Behandla preferensen 8-4 och AI-likhetssiffrorna som riktningsgivande: "v4 klarar ribban," inte "v4 dominerar." Antalet avslöjare och betydelsegranskningen är de solida måtten.

Vi lovar inte detektorresultat. Detektorer är oense om 15–25% av texterna och ger falska positiva på riktig mänsklig text. Den här skillen bygger om text till en mänsklig röst; den säljer ingen garanti om att kringgå detektorer, och om ditt sammanhang kräver AI-deklaration — akademiskt arbete, förlagspolicy — deklarera det. En humanizer är en redaktör, inte en förklädnad. En runda med mänskliga bedömare eller en levande detektor är den bekräftelse vi rekommenderar innan någon kallar 8-4 slutgiltigt.

Varför det här gör SkillProof pålitligt

Vi kunde ha kört fyra versioner, begravt de tre förlusterna och levererat en sida som sa "vår humanizer slår baslinjen 8-4." Varje konkurrent i den här nischen gör i praktiken precis det — påstår en siffra, visar inget av arbetet bakom.

Vi publicerade de tre misslyckandena istället. v1-överkorrigeringen, de två kirurgiska förlusterna på 0-12, diagnosen, inverteringen. Du kan läsa allt, köra om det skriptade avslöjarantalet själv och kontrollera varje betydelsegranskning i repot. Det är hela grejen: vi testar andras skills för att leva, och våra egna skills får samma behandling — uppmätt, med negativa resultat bifogade.

Den ansluter till vår disciplinserie: token-discipline minskar vad dina prompter kostar, research-discipline minskar vad din research har fel om, och den här minskar vad din text avslöjar.

GRATIS STARTPAKET

Vill du ha våra bäst testade skills plus installationschecklistan vi kör inför varje test? Vi mejlar dig det gratis startpaketet.

Hämta det gratis startpaketet

Installation

git clone https://github.com/Skillproofdev/text-humanizer ~/.claude/skills/text-humanizer

Starta om Claude Code. Den triggas av "humanisera det här," "det här låter som AI / som ChatGPT," "få det att låta naturligt," och oro för AI-detektering — på vilket språk som helst. Den håller sig undan från att skriva nytt innehåll från grunden, översättningsjobb och icke-textuppgifter.

FAQ

Varför publicera de tre misslyckandena överhuvudtaget? För att de är beviset. Vem som helst kan påstå "8-4 över baslinjen." De tre förlusterna visar att vinsten inte var tur eller en justerad domare — den kom från en specifik, testbar insikt (struktur slår vokabulär) som bara framträdde efter tre ärliga nederlag. Misslyckandena är det som gör siffran trovärdig.

Slår det här AI-detektorer? Det kan vi inte säga, och vi låtsas inte att vi kan. Detektor-API:erna vi planerade att använda var alla nyckel- eller betalspärrade vid körning, så vår "AI-likhet"-siffra är en blindad domare i kontext, inte en detektorpoäng. Skillen tar bort avslöjare och bygger om text till en mänsklig röst; den säljer ingen garanti om detektorkringgående. Detektorer är oense om 15–25% av texterna och ger falska positiva på äkta mänsklig text.

Kommer omstruktureringen ändra vad min text säger? Det är hela designbegränsningen. Påståendemängden — varje siffra, namn, datum, citat och reservation, plus riktningen och styrkan i varje påstående — är fryst, och ett obligatoriskt sista pass går igenom originalet påstående för påstående mot omskrivningen för att återställa all drift. I benchmarket behöll fri omstrukturering 129 av 130 påståenden intakta (0 ändrade, 0 tillagda), det enda missen var en akronymförklaring utan bärande vikt, nu inpatchad.

Är marginalen 8-4 tillräckligt stor för att lita på? Den klarar vår förutbestämda ribba — vinn den blinda preferensen — där tre tidigare versioner förlorade. Men det är en tydlig vinst, inget svep, från en enda domare i kontext på en självförfattad korpus. Behandla den som riktningsgivande och bekräfta de bärande besluten själv; antalet avslöjare och betydelsegranskningen är måtten vi skulle satsa det starkaste påståendet på.

★ 9.6/10 × 3

Gratis startpaket

De 3 skills som fått våra högsta testbetyg plus installationschecklistan — setupen vi själva skulle lägga på en ny maskin. Gratis, via e-post.

Ett mejl med paketet + en kort veckosammanfattning av nya testresultat. Avsluta prenumerationen när du vill.