Abbiamo fallito 3 volte prima che l'humanizer vincesse

Abbiamo fallito 3 volte prima che l'humanizer vincesse

La maggior parte degli strumenti humanizer è una lista di pattern non misurata. Il più grande sul mercato mette in campo 33 pattern, 28,6k stelle, e zero numeri — nessun punteggio dei detector, nessun controllo del senso, solo inglese. Il gruppo SaaS a pagamento pubblica numeri, ma sono quelli sbagliati — tassi di bypass dichiarati del 99% che test indipendenti misurano a ~66%, ottenuti con parafrasatori che storpiano i tuoi fatti lungo il percorso.

Costruiamo skill Claude testate per lavoro, quindi ci siamo messi a costruire un humanizer che potessimo davvero misurare. E misurarlo per poco non lo ha ucciso. Abbiamo pubblicato tre versioni del SKILL.md che hanno perso un test cieco di umanità contro il testo IA grezzo, non processato. La quarta ha vinto. Questo articolo è l'intero arco — le tre sconfitte incluse — perché le sconfitte sono il motivo per cui puoi fidarti della vittoria.

Il bar fissato prima di scrivere una riga

Il setup era fissato in anticipo. Dodici testi generati da IA su generi diversi, costruiti per stressare failure mode diversi: intro di blog, copy di prodotto, email a clienti, spiegazioni tecniche dense di fatti, un memo formale (stress sul registro), un riepilogo trimestrale pieno di numeri, un testo non in inglese. Ognuno viene riscritto due volte — una da un agente Claude base a cui viene detto semplicemente "riscrivi in modo che non sembri generato da IA, mantieni il significato", e una da un agente identico che legge prima il nostro SKILL.md.

Tre metriche, tutte pre-registrate:

  1. Un conteggio scriptato e riproducibile dei tell IA meccanici (su 103 nel corpus).
  2. Un audit del significato affermazione per affermazione contro inventari di ground truth scritti prima di ogni riscrittura (130 affermazioni totali).
  3. Una preferenza di umanità A/B alla cieca: quale riscrittura si legge più umana?

La soglia di pubblicazione era netta: la skill deve vincere, o chiaramente pareggiare, la preferenza cieca contro il baseline ingenuo. Un humanizer che un lettore cieco preferisce nella versione non processata non ha motivo di esistere.

Un avvertimento onesto in apertura, perché governa tutto quello che segue. Le API dei detector che avevamo pianificato di usare (GPTZero, Sapling, ZeroGPT) erano tutte bloccate da chiave o pagamento quando abbiamo eseguito i test — verificato via curl e registrato. Quindi "somiglianza IA" qui è un giudice LLM in-contesto alla cieca, non un punteggio di detector, e lo etichettiamo così ovunque. Il conteggio dei tell e l'audit delle affermazioni sono i numeri oggettivi e riproducibili.

v1: iper-corretta fino a diventare melassa aziendale

La prima versione riscriveva in modo aggressivo. Scambia i tell per vocabolario più ricco, ristruttura a mano libera. Il risultato si leggeva peggio.

Scambiare "leverage" con un sinonimo più altisonante non rimuove un tell — ri-gonfia il testo. v1 ha limato le parole ovvie e le ha sostituite col registro di un comunicato stampa. Peggio, la riscrittura aggressiva ha fatto deviare il significato: ha perso due affermazioni pre-registrate (una frase di framing del pubblico nel blog sul lavoro da remoto, una parola da una tripletta di leadership nel testo russo) ed è diventata rigidamente aziendale dove la fonte era calorosa.

Preferenza cieca: base 8, v1 4. Il giudice continuava a scegliere il baseline per aver mantenuto un framing umano leggero che v1 aveva appiattito. Prima versione, prima sconfitta.

v2 e v3: sotto-corrette, tell rimasti in piedi

La diagnosi di v1 sembrava ovvia: aveva riscritto troppo. Quindi siamo andati nella direzione opposta — modifiche chirurgiche e minime che proteggono leggibilità e significato. Ha corretto i fatti alla perfezione e ha perso ancora più nettamente.

v2 ha azzeccato perfettamente la preservazione del significato: 130/130 affermazioni intatte, zero alterate, perse o aggiunte. Ma l'editing minimo sotto-corregge. Ha lasciato in piedi sulla pagina "cornerstone", "paradigm shift", "spero che questa email ti trovi bene", "centro di comando della salute personale". Tredici tell residui contro i quattro del baseline. Il giudice cieco ha segnalato esattamente quelle frasi e ha valutato v2 nettamente più artificiale.

Preferenza cieca: base 12, v2 0. Ogni singolo testo.

v3 ha provato a dividere la differenza — una tabella di sostituzione tell-con-parola-semplice più un gate di ri-scansione a tolleranza zero: rimuovi ogni tell, sostituisci sempre con qualcosa di più semplice, mai più ricercato. Ha fatto scendere i tell residui da 13 a 12 e non ha cambiato nulla che contasse.

Preferenza cieca: base 12, v3 0. Di nuovo, ogni singolo testo.

L'intuizione dopo tre sconfitte: non è mai stato il vocabolario

Tre versioni, zero vittorie di preferenza cieca — cumulativamente 4-0-28 includendo v1, e 0-0-24 sui due tentativi chirurgici. Quando perdi con quella costanza, il problema non è una manopola girata male. È la cornice.

Ecco cosa urlavano i dati. Il baseline vince perché ristruttura in una voce umana: varia il ritmo, apre dentro l'argomento, elimina l'impalcatura promozionale. Ogni nostra versione della skill restava saldata allo scheletro IA della fonte — l'apertura a frase-tema, la forma uniforme dei paragrafi, l'elenco a tre, il framing promozionale. Stavamo lucidando il vocabolario su una struttura che annunciava "macchina" prima ancora di leggere una parola.

Ecco la tensione centrale, dimostrata tre volte di fila: il nostro punto di forza — congelare il significato — è esattamente ciò che teneva la skill così aderente all'originale da non poter mai battere in umanità una riscrittura libera. Sicurezza dei fatti e umanità tiravano in direzioni opposte, e la fedeltà strutturale perdeva il lettore ogni volta.

Il testo IA si tradisce per la sua forma, non per il suo lessico. Scambiare "delve" con "guardare" lascia lo scheletro in piedi, e il lettore sente comunque la macchina sotto.

v4: congela le affermazioni, ricostruisci la struttura

La correzione è stata un'inversione di metodo, non un'altra passata di tuning. Smetti di proteggere la struttura. Proteggi solo l'insieme delle affermazioni — ogni fatto, numero, nome, data, citazione e avvertenza, più la direzione e la forza di ogni affermazione — e ricostruisci tutto il resto liberamente. Riordina la sequenza. Fondi le frasi. Scrivi nuove aperture. Taglia l'impalcatura. Fai quello che farebbe un umano capace: leggi il passaggio, capisci cosa afferma, poi dillo di nuovo con la tua struttura.

Il rischio ovvio è che la ristrutturazione libera sia il modo classico in cui i fatti deviano — quindi l'audit delle affermazioni di v4 è girato in modalità extra rigorosa, e la passata finale obbligatoria confronta l'originale affermazione per affermazione con la riscrittura, ripristinando qualsiasi deriva anche al costo di una riga meno elegante.

Ha funzionato. v4 è la prima versione a battere il baseline: preferenza cieca 8-4. La somiglianza IA sostanzialmente pareggiata (26 contro 27), e il conteggio tell più basso di qualsiasi braccio — 2. Le ragioni del giudice per le vittorie erano tutte strutturali: aperture a freddo che iniziano dentro l'argomento (il riepilogo trimestrale ora apre con la cifra dei ricavi come un vero lancio d'agenzia), impalcatura a elenco fusa in prosa, registro stretto ma coerente col genere (il memo resta formale, l'email resta professionale).

E i fatti hanno tenuto. 129 affermazioni su 130 intatte — 99,2%, zero alterate, zero aggiunte, zero avvertenze perse. Ogni numero, nome, data, prezzo e l'unica citazione testuale del CEO sono sopravvissuti. La ristrutturazione libera non ha rotto il payload.

La tabella onesta a 5 vie

Ogni braccio, ogni numero, risultati negativi inclusi:

Metrica Base v1 v2 v3 v4 (in produzione)
Tell meccanici rimasti (su 103) 4 4 13 12 2
Somiglianza IA, mediana¹ (più basso = più umano) 27 32,5 46,5 45 26
Affermazioni intatte (su 130) 127 (97,7%) 127 (97,7%) 130 (100%) 130 (100%) 129 (99,2%)
fatti alterati / persi / aggiunti 2 / 1 / 0 1 / 2 / 0 0 / 0 / 0 0 / 0 / 0 0 / 1 / 0
Preferenza di umanità cieca (skill V-P-S vs base) 4-0-8 0-0-12 0-0-12 8-0-4

¹ Giudice LLM in-contesto alla cieca (0–100), stessa famiglia di modello del riscrittore — etichettato onestamente, non un detector. La mediana del base è oscillata tra 27 e 30 tra i round; è varianza del giudice, dichiarata, non appianata.

L'unica mancanza di v4: la spiegazione OAuth ha perso una glossa di acronimo — ha mantenuto "l'estensione PKCE" e il suo scopo ma non l'espansione completa "Proof Key for Code Exchange". Contato rigorosamente come un'affermazione persa per onestà. È una glossa esplicativa, non un numero, nome, data, citazione o avvertenza, e nessuna affermazione è deviata. È esattamente il failure mode che rischia la ristrutturazione libera, è comparso una volta su 130 affermazioni, ed è ora corretto nel passo di ri-lettura ("preserva le espansioni degli acronimi").

SCARICA LA SKILL

text-humanizer è gratis e con licenza MIT. Il repo è la skill — il benchmark completo, tutti e cinque i bracci, i log dei fallimenti, e ogni audit per affermazione sono dentro.

Scarica text-humanizer su GitHub

Cosa non affermiamo

La vittoria è reale, ma non è una vittoria schiacciante, e far finta del contrario vanificherebbe il senso di eseguire il benchmark. Diversi testi erano quasi testa-o-croce (25 contro 26, 26 contro 27, 26 contro 26). Questo è un punteggio da un singolo giudice in-contesto della stessa famiglia di modello del riscrittore — non un detector esterno — e il corpus è stato scritto dallo stesso progetto. Tratta la preferenza 8-4 e i numeri di somiglianza IA come indicativi: "v4 supera la soglia", non "v4 domina". Il conteggio dei tell e l'audit delle affermazioni sono le metriche solide.

Non promettiamo risultati sui detector. I detector sono in disaccordo sul 15–25% dei testi e danno falsi positivi su scrittura umana reale. Questa skill ricostruisce il testo in una voce umana; non vende una garanzia di bypass, e se il tuo contesto richiede una dichiarazione IA — lavoro accademico, policy editoriale — dichiaralo. Un humanizer è un editor, non un travestimento. Un round con valutatori umani o detector live è la conferma che raccomandiamo prima che chiunque chiami definitivo l'8-4.

Perché questo rende SkillProof affidabile

Avremmo potuto eseguire quattro versioni, seppellire le tre sconfitte, e pubblicare una pagina che diceva "il nostro humanizer batte il baseline 8-4". Ogni concorrente in questa nicchia in pratica fa proprio questo — afferma un numero, non mostra nulla del lavoro dietro.

Abbiamo pubblicato le tre sconfitte invece. L'iper-correzione di v1, le due sconfitte chirurgiche a 0-12, la diagnosi, l'inversione. Puoi leggere tutto, rieseguire tu stesso il conteggio scriptato dei tell, e controllare ogni audit delle affermazioni nel repo. Questa è l'intera proposta: testiamo le skill di altri per lavoro, e le nostre skill ricevono lo stesso trattamento — misurate, con i risultati negativi allegati.

Fa parte della nostra serie discipline: token-discipline taglia quanto costano i tuoi prompt, research-discipline taglia quanto la tua ricerca sbaglia, e questa taglia quanto la tua scrittura si tradisce.

STARTER PACK GRATUITO

Vuoi le nostre skill con il punteggio più alto più la checklist di installazione che usiamo prima di ogni test? Ti mandiamo lo starter pack gratuito via email.

Ottieni lo starter pack gratuito

Installazione

git clone https://github.com/Skillproofdev/text-humanizer ~/.claude/skills/text-humanizer

Riavvia Claude Code. Si attiva su "umanizza questo," "sembra scritto da IA / come ChatGPT," "rendilo naturale," e preoccupazioni sul rilevamento IA — in qualsiasi lingua. Resta fuori dai piedi per scrivere nuovi contenuti da zero, lavori di traduzione, e task non testuali.

FAQ

Perché pubblicare tutte e tre le sconfitte? Perché sono la prova. Chiunque può affermare "8-4 sul baseline". Le tre sconfitte mostrano che la vittoria non è stata fortuna o un giudice tarato ad arte — è arrivata da un'intuizione specifica e testabile (la struttura batte il vocabolario) emersa solo dopo tre sconfitte oneste. Le sconfitte sono ciò che rende credibile il numero.

Batte i detector IA? Non possiamo dirlo, e non facciamo finta. Le API dei detector che avevamo pianificato di usare erano tutte bloccate da chiave o pagamento al momento dei test, quindi la nostra cifra di "somiglianza IA" è un giudice LLM in-contesto alla cieca, non un punteggio di detector. La skill rimuove i tell e ricostruisce il testo in una voce umana; non vende una garanzia di bypass dei detector. I detector sono in disaccordo sul 15–25% dei testi e danno falsi positivi su scrittura umana genuina.

Ristrutturare il mio testo cambierà quello che dice? Quello è l'intero vincolo di progettazione. L'insieme delle affermazioni — ogni numero, nome, data, citazione e avvertenza, più direzione e forza di ogni affermazione — è congelato, e una passata finale obbligatoria confronta l'originale affermazione per affermazione con la riscrittura per ripristinare qualsiasi deriva. Nel benchmark, la ristrutturazione libera ha mantenuto intatte 129 affermazioni su 130 (0 alterate, 0 aggiunte), l'unica mancanza essendo una glossa di acronimo non portante ora corretta.

Il margine dell'8-4 è abbastanza per fidarsi? Supera la soglia che ci eravamo fissati — vincere la preferenza cieca — dove tre versioni precedenti avevano perso. Ma è una vittoria netta, non una vittoria schiacciante, da un singolo giudice in-contesto su un corpus scritto internamente. Trattala come indicativa e verifica di persona le decisioni portanti; il conteggio dei tell e l'audit delle affermazioni sono le metriche su cui rischieremmo l'affermazione più forte.

★ 9.6/10 × 3

Lo starter pack gratuito

I 3 skill con i nostri punteggi di test più alti, più la checklist di installazione: il setup che metteremmo su una macchina appena formattata. Gratis, via email.

Una email con il pack + un breve digest settimanale con i nuovi risultati dei test. Puoi disiscriverti quando vuoi.