
3× jsme selhali, než humanizer porazil baseline
Většina humanizačních nástrojů je neměřený seznam vzorů. Největší na trhu má 33 vzorů, 28,6 tis. hvězd a nula čísel — žádné skóre detektoru, žádnou kontrolu smyslu, jen angličtinu. Placená SaaS scéna čísla zveřejňuje, ale ta špatná: tvrzené 99% míry obejití, které nezávislé testy naměří na ~66 %, dosažené parafrázovači, co vám cestou pokazí fakta.
Stavíme testované Claude skilly na živobytí, takže jsme se rozhodli postavit humanizer, který dokážeme skutečně změřit. A měření ho skoro zabilo. Zveřejnili jsme tři verze SKILL.md, které prohrály slepý test lidskosti se syrovým, nezpracovaným AI textem. Čtvrtá vyhrála. Tenhle článek je celý oblouk — včetně tří proher —, protože prohry jsou důvod, proč věřit výhře.
Laťka, kterou jsme si nastavili dřív, než jsme napsali řádek
Nastavení bylo pevné předem. Dvanáct AI-generovaných textů napříč žánry, postavených tak, aby stresovaly různé vzorce selhání: úvody blogových příspěvků, produktové texty, e-maily klientům, faktograficky nabité technické vysvětlivky, formální memo (stres registru), číselně nabitý souhrn výsledků, jeden neanglický text. Každý se přepíše dvakrát — jednou baselinovým agentem Claude, kterému bylo řečeno prostě „přepiš to, ať to nezní jako AI, zachovej smysl", a jednou identickým agentem, který nejdřív přečte náš SKILL.md.
Tři metriky, všechny předregistrované:
- Skriptovaný, reprodukovatelný počet mechanických AI stop (ze 103 v korpusu).
- Audit smyslu tvrzení po tvrzení proti inventářům ground truth napsaným před jakýmkoli přepisem (130 tvrzení celkem).
- Slepá preference A/B lidskosti: který přepis se čte víc lidsky?
Laťka pro vydání byla tvrdá: skill musí vyhrát, nebo jasně remizovat, slepou preferenci proti naivní baseline. Humanizer, kterému slepý čtenář dá přednost před nezpracovanou verzí, nemá důvod existovat.
Jedna poctivá výhrada hned na úvod, protože ovládá všechno níže. API detektorů, které jsme plánovali použít (GPTZero, Sapling, ZeroGPT), byly v době běhu všechny zamčené za klíčem nebo platbou — ověřeno přes curl a zalogováno. Takže „AI-podobnost" tady je slepý soudce LLM v kontextu, ne skóre detektoru, a takhle to všude označujeme. Počet stop a audit tvrzení jsou objektivní, reprodukovatelná čísla.
v1: přehnaná korekce do korporátní kaše
První verze přepisovala agresivně. Vyměnit stopy za bohatší slovník, přestavět volnou rukou. Výsledek se četl hůř.
Vyměnit „leverage" za honosnější synonymum stopu neodstraní — jen text znovu nafoukne. v1 obrousila zjevná slova a nahradila je registrem tiskové zprávy. Horší je, že agresivní přepis odklonil smysl: vypustila dvě předregistrovaná tvrzení (větu rámující publikum v blogu o práci na dálku, slovo z leadership trojice v ruském textu) a tam, kde byl zdroj vřelý, přešla do korporátní strohosti.
Slepá preference: base 8, v1 4. Soudce si opakovaně vybíral baseline za to, že zachovala lehké lidské rámování, které v1 zploštila. První verze, první prohra.
v2 a v3: nedostatečná korekce, stopy zůstaly stát
Diagnóza v1 vypadala zjevně: přepsala příliš. Tak jsme se vychýlili opačným směrem — chirurgické, minimální úpravy chránící čitelnost a smysl. To fakta opravilo dokonale a prohrálo ještě víc.
v2 zvládla zachování smyslu bezchybně: 130/130 tvrzení neporušených, nula pozměněných, vypuštěných nebo přidaných. Ale minimální úprava nedostatečně koriguje. Na stránce nechala stát „cornerstone", „paradigm shift", „doufám, že vás tenhle e-mail zastihne v pořádku", „personal health command center". Třináct zbývajících stop proti čtyřem u baseline. Slepý soudce označil přesně tyhle fráze a ohodnotil v2 jako výrazně strojovější.
Slepá preference: base 12, v2 0. Úplně každý text.
v3 zkusila rozdíl vyrovnat — tabulku náhrad stopa-za-obyčejné-slovo plus bránu nulové tolerance s opětovným skenem: odstranit každou stopu, nahradit prostším, nikdy ozdobnějším. Osekala zbytkové stopy z 13 na 12 a nezměnila nic podstatného.
Slepá preference: base 12, v3 0. Znovu, úplně každý text.
Poznatek po třech prohrách: nikdy nešlo o slovník
Tři verze, nula výher ve slepé preferenci — kumulativně 4-0-28 včetně v1 a 0-0-24 napříč oběma chirurgickými pokusy. Když prohráváte takhle konzistentně, problém není v knoflíku, který jste špatně nastavili. Je to rámec.
Tady je, co data křičela. Baseline vyhrává, protože přestavuje do lidského hlasu: mění rytmus, otevírá zevnitř tématu, zahazuje propagační lešení. Každá naše verze skillu zůstala přivařená k AI kostře zdroje — úvodní věta s tématem, jednotný tvar odstavců, seznam pravidla tří, propagační rámování. Leštili jsme slovník na struktuře, která hlásila „stroj" dřív, než padlo jediné slovo.
To je jádro napětí, doložené třikrát: naše unikátní hodnota — zmrazit smysl — je přesně to, co drželo skill tak pevně přilepený k originálu, že nikdy nemohl vypřepsat volný přepis. Bezpečnost faktů a lidskost táhly proti sobě, a strukturální věrnost čtenáře prohrávala pokaždé.
AI text se prozrazuje svým tvarem, ne slovníkem. Vyměnit „delve" za „look at" nechá kostru stát a čtenář pod ní pořád cítí stroj.
v4: zmrazit tvrzení, přestavět strukturu
Oprava byla obrácení metody, ne další ladicí průchod. Přestat chránit strukturu. Chránit jen sadu tvrzení — každý fakt, číslo, jméno, datum, citát a výhradu, plus směr a sílu každého tvrzení — a všechno ostatní přestavět volně. Přeskupit. Sloučit věty. Napsat nové úvody. Škrtnout lešení. Dělat, co dělá ostrý člověk: přečíst pasáž, pochopit, co tvrdí, a pak to říct znovu ve vlastní struktuře.
Zjevné riziko je, že volná přestavba je klasická cesta k odklonu faktů — takže audit tvrzení u v4 běžel extra přísně a povinný poslední průchod projde originál tvrzení po tvrzení proti přepisu a obnoví jakýkoli odklon, i za cenu méně čistého řádku.
Fungovalo to. v4 je první verze, která porazila baseline: slepá preference 8-4. AI-podobnost v podstatě remizovala (26 vs. 27) a nejnižší počet stop ze všech větví — 2. Důvody soudcových výher byly všechny strukturální: chladné otevírky, které začínají zevnitř tématu (souhrn výsledků teď začíná číslem tržeb jako skutečná agenturní zpráva), seznamové lešení sloučené do prózy, register zpřísněný, ale zůstávající v žánru (memo zůstává formální, e-mail zůstává profesionální).
A fakta vydržela. 129 ze 130 tvrzení neporušených — 99,2 %, nula pozměněných, nula přidaných, nula ztracených výhrad. Každé číslo, jméno, datum, cena a jediný doslovný citát CEO přežily. Volná přestavba náklad nerozbila.
Poctivá tabulka pro pět verzí
Každá větev, každé číslo, negativní výsledky včetně:
| Metrika | Base | v1 | v2 | v3 | v4 (vydáno) |
|---|---|---|---|---|---|
| Zbylé mechanické stopy (ze 103) | 4 | 4 | 13 | 12 | 2 |
| AI-podobnost, medián¹ (nižší = víc lidské) | 27 | 32,5 | 46,5 | 45 | 26 |
| Neporušená tvrzení (ze 130) | 127 (97,7 %) | 127 (97,7 %) | 130 (100 %) | 130 (100 %) | 129 (99,2 %) |
| pozměněná / vypuštěná / přidaná fakta | 2 / 1 / 0 | 1 / 2 / 0 | 0 / 0 / 0 | 0 / 0 / 0 | 0 / 1 / 0 |
| Slepá preference lidskosti (skill V-R-P vs. base) | — | 4-0-8 | 0-0-12 | 0-0-12 | 8-0-4 |
¹ Slepý soudce LLM v kontextu (0–100), stejná rodina modelů jako přepisovač — poctivě označené, ne detektor. Medián base kolísal 27–30 mezi koly; to je variabilita soudce, přiznaná, ne uhlazená.
Jediné minutí u v4: vysvětlivka OAuth vypustila jedno rozvinutí zkratky — nechala „rozšíření PKCE" a jeho účel, ale ne celý rozvinutý název „Proof Key for Code Exchange". Přísně počítáno jako jedno vypuštěné tvrzení kvůli poctivosti. Je to vysvětlující rozvinutí, ne číslo, jméno, datum, citát nebo výhrada, a žádné tvrzení se neodklonilo. To je přesně vzorec selhání, které riskuje volná přestavba, objevilo se to jednou ze 130 tvrzení a je to teď zalátané do kroku opětovného čtení („zachovat rozvinutí zkratek").
GET THE SKILL
text-humanizer je zdarma a pod licencí MIT. Repo je skill — celý benchmark, všech pět větví, logy selhání a každý audit tvrzení jsou jeho součástí.
Získat text-humanizer na GitHubuCo netvrdíme
Výhra je reálná, ale není to drtivé vítězství, a předstírat opak by popřelo smysl spuštění benchmarku. Několik textů bylo skoro na hraně mince (25 vs. 26, 26 vs. 27, 26 vs. 26). Tohle je hodnocení jediným soudcem v kontextu z vlastní rodiny modelů přepisovače — ne externí detektor — a korpus napsal ten samý projekt. Berte preferenci 8-4 a čísla AI-podobnosti jako orientační: „v4 čistí laťku", ne „v4 dominuje". Počet stop a audit tvrzení jsou pevné metriky.
Neslibujeme výsledky detektorů. Detektory se neshodnou na 15–25 % textů a dávají falešně pozitivní na skutečném lidském textu. Tenhle skill přestavuje text do lidského hlasu; neprodává záruku obejití detektoru, a pokud váš kontext vyžaduje přiznání AI — akademická práce, politika vydavatele — přiznejte ho. Humanizer je editor, ne maska. Kolo s lidským hodnotitelem nebo živým detektorem je potvrzení, které doporučujeme, než někdo prohlásí 8-4 za finální.
Proč je díky tomu SkillProof důvěryhodný
Mohli jsme spustit čtyři verze, tři prohry pohřbít a vydat stránku s „náš humanizer porazí baseline 8-4". Skoro každý konkurent v téhle nice to přesně tak dělá — tvrdí číslo, neukáže žádnou práci za ním.
Místo toho jsme zveřejnili tři prohry. Přehnanou korekci v1, dvě chirurgické prohry na 0-12, diagnózu, obrácení. Můžete si přečíst úplně všechno, spustit si skriptovaný počet stop sami a zkontrolovat každý audit tvrzení v repozitáři. To je celá nabídka: testujeme skilly jiných lidí na živobytí a naše vlastní skilly dostávají stejné zacházení — měřené, s připojenými negativními výsledky.
Patří do naší disciplinární série: token-discipline snižuje, co vaše prompty stojí, research-discipline snižuje, co si váš výzkum splete, a tenhle snižuje, co váš text prozrazuje.
FREE STARTER PACK
Chcete naše nejlépe hodnocené skilly plus instalační checklist, který používáme před každým testem? Pošleme vám ho e-mailem zdarma.
Získat free starter packInstalace
git clone https://github.com/Skillproofdev/text-humanizer ~/.claude/skills/text-humanizer
Restartujte Claude Code. Spouští se na „humanizuj tohle", „tohle zní jako AI / jako ChatGPT", „ať to zní přirozeně" a obavy z AI detekce — v jakémkoli jazyce. Nezasahuje do psaní nového obsahu od nuly, překladatelských zakázek a netextových úkolů.
FAQ
Proč vůbec zveřejňovat tři prohry? Protože jsou to důkaz. Kdokoli může tvrdit „8-4 nad baseline". Tři prohry ukazují, že výhra nebyla štěstí ani vyladěný soudce — vzešla z konkrétního, testovatelného poznatku (struktura porazí slovník), který vyplaval na povrch až po třech poctivých porážkách. Prohry jsou to, co dělá to číslo věrohodným.
Porazí to AI detektory? Nevíme, a nebudeme to předstírat. API detektorů, které jsme plánovali použít, byla v době běhu zamčená za klíčem nebo platbou, takže naše číslo „AI-podobnost" je slepý soudce LLM v kontextu, ne skóre detektoru. Skill odstraňuje stopy a přestavuje text do lidského hlasu; neprodává záruku obejití detektoru. Detektory se neshodnou na 15–25 % textů a dávají falešně pozitivní na skutečném lidském textu.
Změní přestavba mého textu, co říká? To je celé konstrukční omezení. Sada tvrzení — každé číslo, jméno, datum, citát a výhrada, plus směr a síla každého tvrzení — je zmrazená, a povinný poslední průchod projde originál tvrzení po tvrzení proti přepisu, aby obnovil jakýkoli odklon. V benchmarku volná přestavba zachovala 129 ze 130 tvrzení neporušených (0 pozměněných, 0 přidaných), jediné minutí bylo nezátěžové rozvinutí zkratky, teď zalátané.
Je rozdíl 8-4 dost velký na to, aby se dal věřit? Čistí náš předem nastavený limit — vyhrát slepou preferenci —, kde tři předchozí verze prohrály. Ale je to jasná výhra, ne drtivé vítězství, od jediného soudce v kontextu na korpusu napsaném stejným projektem. Berte to jako orientační a nosná rozhodnutí si ověřte sami; počet stop a audit tvrzení jsou metriky, za kterými bychom si stáli nejvíc.
★ 9.6/10 × 3
Startovací balíček zdarma
3 skills s nejvyšším skóre z našich testů plus instalační checklist — sestava, kterou bychom nasadili na čistý stroj. Zdarma, e-mailem.