
3 razy zawiedliśmy, zanim humanizer pobił baseline
Większość narzędzi do humanizacji to niezmierzona lista wzorców. Największe na rynku dostarcza 33 wzorce, 28,6 tys. gwiazdek i zero liczb — żadnych wyników detektorów, żadnej kontroli sensu, tylko angielski. Płatny tłum SaaS publikuje liczby, ale niewłaściwe: deklarowane 99% wskaźniki obejścia, które niezależne testy mierzą na ~66%, osiągane przez parafrazery, które po drodze psują twoje fakty.
Na co dzień budujemy testowane skille Claude, więc postanowiliśmy zbudować humanizer, który faktycznie da się zmierzyć. A mierzenie go niemal go zabiło. Opublikowaliśmy trzy wersje SKILL.md, które przegrały ślepy test „ludzkości” z surowym, nieprzetworzonym tekstem AI. Czwarta wygrała. Ten wpis to cały łuk — razem z trzema porażkami — bo porażki są powodem, dla którego powinieneś zaufać zwycięstwu.
Poprzeczka, którą ustawiliśmy, zanim napisaliśmy linijkę
Konfiguracja była ustalona z góry. Dwanaście tekstów wygenerowanych przez AI w różnych gatunkach, zbudowanych, żeby stresować różne tryby awarii: wstępy do bloga, teksty produktowe, maile do klientów, gęste faktograficznie wyjaśnienia techniczne, formalne memo (stres rejestru), podsumowanie wyników pełne liczb, jeden tekst nieanglojęzyczny. Każdy zostaje przepisany dwa razy — raz przez agenta bazowego Claude, któremu powiedziano po prostu „przepisz tak, żeby nie brzmiało jak wygenerowane przez AI, zachowaj sens”, i raz przez identycznego agenta, który najpierw czyta nasz SKILL.md.
Trzy metryki, wszystkie zarejestrowane z góry:
- Skryptowe, odtwarzalne liczenie mechanicznych „tellów” AI (ze 103 w korpusie).
- Audyt sensu twierdzenie po twierdzeniu względem inwentarzy stanu faktycznego napisanych przed jakimkolwiek przepisaniem (130 twierdzeń razem).
- Ślepa preferencja A/B „ludzkości”: które przepisanie czyta się bardziej po ludzku?
Poprzeczka do wypuszczenia była brutalna: skill musi wygrać, albo wyraźnie zremisować, ślepą preferencję przeciwko naiwnemu baseline'owi. Humanizer, którego nieprzetworzoną wersję preferuje ślepy czytelnik, nie ma powodu istnieć.
Jedno uczciwe zastrzeżenie od razu, bo rządzi wszystkim poniżej. API detektorów, których planowaliśmy użyć (GPTZero, Sapling, ZeroGPT), były w momencie naszego przebiegu zablokowane kluczem lub płatnością — zweryfikowane przez curl i zapisane. Więc „podobieństwo do AI” tutaj to ślepy sędzia LLM w kontekście, nie wynik detektora, i tak to oznaczamy wszędzie. Liczba tellów i audyt twierdzeń to obiektywne, odtwarzalne liczby.
v1: nadgorliwa korekta w korporacyjne bagno
Pierwsza wersja przepisywała agresywnie. Zamień telle na bogatsze słownictwo, przebuduj z wolną ręką. Wynik czytał się gorzej.
Wymiana „leverage” na bardziej wyszukany synonim nie usuwa telle — na nowo nadmuchuje tekst. v1 zeszlifował oczywiste słowa i zastąpił je rejestrem komunikatu prasowego. Co gorsza, agresywne przepisywanie zdryfowało sens: porzuciło dwa z góry zarejestrowane twierdzenia (zdanie ramujące odbiorców w blogu o pracy zdalnej, słowo z potrójnej frazy przywódczej w rosyjskim tekście) i stało się korporacyjnie sztywne tam, gdzie źródło było ciepłe.
Ślepa preferencja: base 8, v1 4. Sędzia wciąż wybierał baseline za zachowanie lekkiego, ludzkiego ramowania, które v1 spłaszczyło. Pierwsza wersja, pierwsza porażka.
v2 i v3: niedostateczna korekta, telle pozostają na miejscu
Diagnoza v1 wyglądała oczywiście: przepisał za dużo. Więc poszliśmy w drugą stronę — chirurgiczne, minimalne edycje chroniące czytelność i sens. To naprawiło fakty idealnie i przegrało jeszcze bardziej.
v2 idealnie zachował sens: 130/130 twierdzeń nietkniętych, zero zmienionych, porzuconych czy dodanych. Ale minimalna edycja niedokorygowuje. Zostawiła na stronie „cornerstone”, „paradigm shift”, „mam nadzieję, że ten mail zastaje cię w dobrym zdrowiu”, „osobiste centrum dowodzenia zdrowiem”. Trzynaście resztkowych tellów wobec czterech u baseline'u. Ślepy sędzia oflagował dokładnie te frazy i ocenił v2 jako wyraźnie bardziej maszynowe.
Ślepa preferencja: base 12, v2 0. Każdy pojedynczy tekst.
v3 próbowało pójść na kompromis — tabela zamiany tellów na proste słowa plus brama ponownego skanu o zerowej tolerancji: usuń każdy tell, zamień na prostszy, nigdy bardziej wyszukany. Zeszlifowało resztkowe telle z 13 do 12 i niczego istotnego nie zmieniło.
Ślepa preferencja: base 12, v3 0. Znowu, każdy pojedynczy tekst.
Wgląd po trzech porażkach: nigdy nie chodziło o słownictwo
Trzy wersje, zero zwycięstw w ślepej preferencji — łącznie 4-0-28 wliczając v1, i 0-0-24 w obu chirurgicznych próbach. Kiedy przegrywasz tak konsekwentnie, problem nie jest w źle ustawionym pokrętle. Jest w ramie.
Oto, co krzyczały dane. Baseline wygrywa, bo przebudowuje strukturę w ludzki głos: różnicuje rytm, otwiera w środku tematu, porzuca rusztowanie promocyjne. Każda z naszych wersji skilla zostawała przyspawana do szkieletu AI źródła — otwarcie zdaniem tematycznym, jednolity kształt akapitu, lista rządząca się zasadą trójki, ramowanie promocyjne. My poprawialiśmy słownictwo na strukturze, która ogłaszała „maszyna”, zanim ktokolwiek przeczytał jedno słowo.
To jest sedno napięcia, udowodnione trzykrotnie: nasz unikalny wyróżnik — zamrożenie sensu — to dokładnie to, co trzymało skilla tak ciasno przy oryginale, że nigdy nie mógł prześcignąć ludzkością swobodnego przepisania. Bezpieczeństwo faktów i ludzkość ciągnęły w przeciwne strony, a wierność strukturalna za każdym razem przegrywała czytelnika.
Tekst AI zdradza się swoim kształtem, nie listą słów. Zamiana „delve” na „look at” zostawia szkielet stojący, a czytelnik i tak czuje maszynę pod spodem.
v4: zamroź twierdzenia, przebuduj strukturę
Naprawą było odwrócenie metody, nie kolejny przebieg strojenia. Przestań chronić strukturę. Chroń tylko zbiór twierdzeń — każdy fakt, liczbę, nazwisko, datę, cytat i zastrzeżenie, plus kierunek i siłę każdego twierdzenia — i przebuduj wszystko inne swobodnie. Zmień kolejność. Połącz zdania. Napisz nowe otwarcia. Wytnij rusztowanie. Rób to, co robi bystry człowiek: przeczytaj fragment, zrozum, co twierdzi, potem powiedz to jeszcze raz we własnej strukturze.
Oczywistym ryzykiem jest to, że swobodna przebudowa to klasyczny sposób na zdryfowanie faktów — więc audyt twierdzeń v4 przeprowadzono ekstra rygorystycznie, a obowiązkowy końcowy przebieg przechodzi oryginał twierdzenie po twierdzeniu względem przepisania, przywracając każdy dryf, nawet kosztem czystszej linijki.
Zadziałało. v4 to pierwsza wersja, która pobiła baseline: ślepa preferencja 8-4. Podobieństwo do AI zasadniczo zremisowane (26 vs 27), i najniższa liczba tellów spośród wszystkich wariantów — 2. Powody zwycięstw podane przez sędziego były czysto strukturalne: chłodne otwarcia zaczynające się w środku tematu (podsumowanie wyników teraz zaczyna od liczby przychodu jak prawdziwy lead depeszy), rusztowanie listowe zlane w prozę, rejestr zaostrzony, ale utrzymany w gatunku (memo zostaje formalne, mail zostaje profesjonalny).
A fakty się utrzymały. 129 ze 130 twierdzeń nietkniętych — 99,2%, zero zmienionych, zero dodanych, zero utraconych zastrzeżeń. Każda liczba, nazwisko, data, cena i jeden dosłowny cytat CEO przetrwały. Swobodna przebudowa nie zepsuła ładunku.
Uczciwa tabela 5-wariantowa
Każdy wariant, każda liczba, razem z wynikami negatywnymi:
| Metryka | Base | v1 | v2 | v3 | v4 (wysyłane) |
|---|---|---|---|---|---|
| Pozostałe mechaniczne telle (ze 103) | 4 | 4 | 13 | 12 | 2 |
| Podobieństwo do AI, mediana¹ (mniej = bardziej ludzkie) | 27 | 32,5 | 46,5 | 45 | 26 |
| Twierdzenia nietknięte (ze 130) | 127 (97,7%) | 127 (97,7%) | 130 (100%) | 130 (100%) | 129 (99,2%) |
| zmienione / porzucone / dodane fakty | 2 / 1 / 0 | 1 / 2 / 0 | 0 / 0 / 0 | 0 / 0 / 0 | 0 / 1 / 0 |
| Ślepa preferencja ludzkości (skill W-T-L vs base) | — | 4-0-8 | 0-0-12 | 0-0-12 | 8-0-4 |
¹ Ślepy sędzia LLM w kontekście (0–100), ta sama rodzina modeli co przepisujący — oznaczone uczciwie, nie detektor. Mediana base'u chwiała się między rundami 27–30; to wariancja sędziego, ujawniona, nie wygładzona.
Jedyne przeoczenie v4: wyjaśnienie OAuth porzuciło jeden glos akronimu — zachowało „rozszerzenie PKCE” i jego cel, ale nie rozwinięcie pełnej nazwy „Proof Key for Code Exchange”. Policzone ściśle jako jedno porzucone twierdzenie dla uczciwości. To glos wyjaśniający, nie liczba, nazwisko, data, cytat czy zastrzeżenie, i żadne twierdzenie nie zdryfowało. To dokładnie ten tryb awarii, jaki niesie swobodna przebudowa, pojawił się raz na 130 twierdzeń i jest teraz załatany w kroku ponownego czytania („zachowaj rozwinięcia akronimów”).
ZDOBĄDŹ SKILLA
text-humanizer jest darmowy i na licencji MIT. Repozytorium jest skillem — pełny benchmark, wszystkie pięć wariantów, logi porażek i każdy audyt per-twierdzenie są dostarczane w środku.
Pobierz text-humanizer na GitHubCzego nie twierdzimy
Zwycięstwo jest prawdziwe, ale to nie jest miażdżąca wygrana, a udawanie inaczej pokonałoby cel prowadzenia benchmarku. Kilka tekstów było niemal remisowych (25 vs 26, 26 vs 27, 26 vs 26). To ocena jednego sędziego w kontekście, z tej samej rodziny modeli co przepisujący — nie zewnętrzny detektor — a korpus został autorstwa tego samego projektu. Traktuj preferencję 8-4 i liczby podobieństwa do AI jako kierunkowe: „v4 przekracza poprzeczkę”, nie „v4 dominuje”. Liczba tellów i audyt twierdzeń to solidne metryki.
Nie obiecujemy wyników detektorów. Detektory różnią się w ocenie 15–25% tekstów i dają false positive na prawdziwym ludzkim pisaniu. Ten skill przebudowuje tekst w ludzki głos; nie sprzedaje gwarancji obejścia, a jeśli twój kontekst wymaga ujawnienia AI — praca akademicka, polityka wydawcy — ujawnij to. Humanizer to redaktor, nie przebranie. Runda z oceniającym-człowiekiem albo żywym detektorem to potwierdzenie, które rekomendujemy, zanim ktokolwiek nazwie 8-4 wynikiem ostatecznym.
Dlaczego to czyni SkillProof godnym zaufania
Mogliśmy uruchomić cztery wersje, zakopać trzy porażki i wypuścić stronę mówiącą „nasz humanizer bije baseline 8-4”. Praktycznie każdy konkurent w tej niszy tak robi — stwierdza liczbę, nie pokazuje żadnej pracy za nią.
Zamiast tego opublikowaliśmy trzy porażki. Nadgorliwą korektę v1, dwie chirurgiczne porażki przy 0-12, diagnozę, odwrócenie. Możesz przeczytać to wszystko, sam ponownie uruchomić skryptowe liczenie tellów i sprawdzić każdy audyt twierdzeń w repozytorium. To cała propozycja: na co dzień testujemy cudze skille, a nasze własne skille dostają to samo traktowanie — zmierzone, z załączonymi wynikami negatywnymi.
Dołącza do naszej serii dyscyplin: token-discipline tnie to, ile kosztują twoje prompty, research-discipline tnie to, w czym myli się twój research, a ten tnie to, co twoje pisanie zdradza.
DARMOWY PAKIET STARTOWY
Chcesz nasze najwyżej oceniane skille plus checklistę instalacyjną, której używamy przed każdym testem? Wyślemy ci mailem darmowy starter pack.
Odbierz darmowy starter packInstalacja
git clone https://github.com/Skillproofdev/text-humanizer ~/.claude/skills/text-humanizer
Zrestartuj Claude Code. Uruchamia się na „humanize this”, „this sounds like AI / like ChatGPT”, „make it sound natural” i obawy o wykrywanie AI — w dowolnym języku. Nie wtrąca się przy pisaniu nowej treści od zera, zadaniach tłumaczeniowych i zadaniach niezwiązanych z tekstem.
FAQ
Czemu w ogóle publikować trzy porażki? Bo są dowodem. Każdy może stwierdzić „8-4 nad baseline”. Trzy porażki pokazują, że zwycięstwo nie było szczęściem ani dostrojonym sędzią — wzięło się z konkretnego, sprawdzalnego wglądu (struktura bije słownictwo), który wypłynął dopiero po trzech uczciwych porażkach. Porażki są tym, co czyni tę liczbę wiarygodną.
Czy to bije detektory AI? Nie potrafimy powiedzieć i nie będziemy udawać, że potrafimy. API detektorów, których planowaliśmy użyć, były w momencie przebiegu zablokowane kluczem lub płatnością, więc nasza liczba „podobieństwa do AI” to ślepy sędzia LLM w kontekście, nie wynik detektora. Skill usuwa telle i przebudowuje tekst w ludzki głos; nie sprzedaje gwarancji obejścia detektora. Detektory różnią się w ocenie 15–25% tekstów i dają false positive na prawdziwym ludzkim pisaniu.
Czy przebudowa mojego tekstu zmieni to, co mówi? To całe ograniczenie projektowe. Zbiór twierdzeń — każda liczba, nazwisko, data, cytat i zastrzeżenie, plus kierunek i siła każdego twierdzenia — jest zamrożony, a obowiązkowy końcowy przebieg przechodzi oryginał twierdzenie po twierdzeniu względem przepisania, żeby przywrócić każdy dryf. W benchmarku swobodna przebudowa zachowała 129 ze 130 twierdzeń nietkniętych (0 zmienionych, 0 dodanych), a jedyne przeoczenie to nienośny glos akronimu, teraz załatany.
Czy margines 8-4 jest wystarczająco duży, żeby ufać? Przekracza naszą z góry ustaloną poprzeczkę — wygraj ślepą preferencję — na której trzy wcześniejsze wersje przegrały. Ale to wyraźne zwycięstwo, nie miażdżąca wygrana, od jednego sędziego w kontekście na korpusie autorstwa nas samych. Traktuj to jako kierunkowe i sam potwierdź nośne decyzje; liczba tellów i audyt twierdzeń to metryki, za którymi postawilibyśmy najmocniejsze twierdzenie.
★ 9.6/10 × 3
Darmowy pakiet startowy
3 skille z naszymi najwyższymi ocenami z testów plus checklista instalacji — zestaw, który sami wgralibyśmy na świeżą maszynę. Za darmo, na e-mail.