
Fallamos 3 veces antes de que este humanizador ganara
La mayoría de las herramientas humanizadoras son una lista de patrones sin medir. La más grande del mercado trae 33 patrones, 28.6k estrellas, y cero números — sin puntuaciones de detector, sin comprobación de significado, solo en inglés. El grupo de SaaS de pago publica números, pero son los equivocados: tasas de bypass del 99% afirmadas que los tests independientes miden en ~66%, logradas por parafraseadores que estropean tus hechos por el camino.
Construimos skills de Claude testeadas para ganarnos la vida, así que nos propusimos construir un humanizador que de verdad pudiéramos medir. Y medirlo casi lo mata. Publicamos tres versiones del SKILL.md que perdieron un test ciego de humanidad frente al texto de IA en bruto, sin procesar. La cuarta ganó. Este post es el arco completo — con las tres derrotas incluidas — porque las derrotas son la razón por la que deberías fiarte de la victoria.
El listón que fijamos antes de escribir una sola línea
La configuración se fijó de antemano. Doce textos generados por IA de distintos géneros, construidos para poner a prueba diferentes modos de fallo: introducciones de blog, copy de producto, emails a clientes, explicadores técnicos cargados de datos, un memo formal (estrés de registro), un resumen de resultados cargado de números, un texto no en inglés. Cada uno se reescribe dos veces — una por un agente Claude baseline al que simplemente se le dice "reescribe para que no suene generado por IA, conserva el significado," y otra por un agente idéntico que lee nuestro SKILL.md primero.
Tres métricas, todas preregistradas:
- Un conteo automatizado y reproducible de delatores mecánicos de IA (de 103 en el corpus).
- Una auditoría de significado afirmación por afirmación contra inventarios de ground truth escritos antes de cualquier reescritura (130 afirmaciones en total).
- Una preferencia ciega A/B de humanidad: ¿qué reescritura se lee más humana?
El listón para publicar era contundente: la skill tiene que ganar, o al menos empatar claramente, la preferencia ciega frente al baseline ingenuo. Un humanizador cuya versión sin procesar prefiere un lector ciego no tiene razón de existir.
Un matiz honesto por adelantado, porque gobierna todo lo que sigue. Las API de detectores que planeábamos usar (GPTZero, Sapling, ZeroGPT) estaban todas bloqueadas por clave o pago cuando ejecutamos — verificado con curl y registrado. Así que "similitud a IA" aquí es un juez LLM ciego en contexto, no una puntuación de detector, y lo etiquetamos así en todas partes. El conteo de delatores y la auditoría de afirmaciones son los números objetivos y reproducibles.
v1: sobrecorregida hacia el fango corporativo
La primera versión reescribía de forma agresiva. Cambiar los delatores por vocabulario más rico, reestructurar con mano libre. El resultado se leía peor.
Cambiar "apalancar" por un sinónimo más rimbombante no elimina un delator — reinfla el texto. v1 limó las palabras obvias y las reemplazó con el registro de un comunicado de prensa. Peor aún, la reescritura agresiva desvió el significado: se dejó dos afirmaciones preregistradas (una frase de encuadre de audiencia en el blog de trabajo remoto, una palabra de una tríada de liderazgo en el texto en ruso) y se puso rígida y corporativa donde la fuente era cercana.
Preferencia ciega: base 8, v1 4. El juez seguía eligiendo el baseline por conservar un encuadre humano ligero que v1 aplanaba. Primera versión, primera derrota.
v2 y v3: subcorregidas, con delatores en pie
El diagnóstico de v1 parecía obvio: reescribió de más. Así que giramos hacia el otro lado — ediciones quirúrgicas y mínimas que protegen la legibilidad y el significado. Eso arregló los hechos a la perfección y perdió aún más.
v2 clavó la preservación del significado: 130/130 afirmaciones intactas, cero alteradas, descartadas o añadidas. Pero la edición mínima subcorrige. Dejó en pie "piedra angular," "cambio de paradigma," "espero que este correo te encuentre bien," "centro de mando de salud personal." Trece delatores residuales frente a los cuatro del baseline. El juez ciego marcó exactamente esas frases y calificó a v2 como notablemente más maquinal.
Preferencia ciega: base 12, v2 0. En todos y cada uno de los textos.
v3 intentó dividir la diferencia — una tabla de reemplazo de delator a palabra sencilla más un filtro de re-escaneo de tolerancia cero: elimina cada delator, reemplaza con algo más sencillo, nunca más rimbombante. Redujo los delatores residuales de 13 a 12 y no cambió nada que importara.
Preferencia ciega: base 12, v3 0. De nuevo, en todos y cada uno de los textos.
La revelación tras tres derrotas: nunca fue cuestión de vocabulario
Tres versiones, cero victorias de preferencia ciega — acumulando 4-0-28 incluyendo v1, y 0-0-24 en los dos intentos quirúrgicos. Cuando pierdes con esa consistencia, el problema no es un ajuste mal puesto. Es el enfoque.
Esto es lo que los datos gritaban. El baseline gana porque reestructura hacia una voz humana: varía el ritmo, abre desde dentro del asunto, elimina el andamiaje promocional. Cada una de nuestras versiones de la skill se quedó soldada al esqueleto de IA de la fuente — la apertura con frase temática, la forma uniforme de párrafo, la lista de regla de tres, el encuadre promocional. Estábamos puliendo vocabulario sobre una estructura que anunciaba "máquina" antes de leer una sola palabra.
Esa es la tensión central, demostrada tres veces: nuestro argumento de venta único — congelar el significado — es exactamente lo que mantenía a la skill pegada al original tan de cerca que nunca podía sonar más humana que una reescritura libre. La seguridad de los hechos y la humanidad tiraban en direcciones opuestas, y la fidelidad estructural perdía al lector todas las veces.
El texto de IA se delata por su forma, no por su lista de palabras. Cambiar "profundizar" por "mirar" deja el esqueleto en pie, y el lector sigue sintiendo la máquina debajo.
v4: congela las afirmaciones, reconstruye la estructura
La solución fue una inversión de método, no otra pasada de ajuste. Dejar de proteger la estructura. Proteger solo el conjunto de afirmaciones — cada hecho, número, nombre, fecha, cita y matiz, más la dirección y fuerza de cada afirmación — y reconstruir todo lo demás con libertad. Resecuenciar. Fusionar frases. Escribir aperturas nuevas. Cortar el andamiaje. Hacer lo que hace una persona aguda: leer el pasaje, entender qué afirma, y decirlo de nuevo con tu propia estructura.
El riesgo obvio es que la reestructuración libre es la vía clásica para desviar los hechos — así que la auditoría de afirmaciones de v4 se ejecutó con rigor extra, y la pasada final obligatoria recorre el original afirmación por afirmación contra la reescritura, restaurando cualquier desviación aunque cueste una línea menos limpia.
Funcionó. v4 es la primera versión que supera al baseline: preferencia ciega 8-4. La similitud a IA prácticamente empatada (26 frente a 27), y el conteo de delatores más bajo de cualquier brazo — 2. Las razones del juez para las victorias fueron todas estructurales: aperturas en frío que arrancan desde dentro del asunto (el resumen de resultados ahora empieza con la cifra de ingresos como un cable de agencia real), andamiaje de listas fusionado en prosa, registro ajustado pero dentro del género (el memo se queda formal, el email se queda profesional).
Y los hechos aguantaron. 129 de 130 afirmaciones intactas — 99.2%, cero alteradas, cero añadidas, cero matices perdidos. Cada número, nombre, fecha, precio, y la única cita textual del CEO sobrevivió. La reestructuración libre no rompió la carga.
La tabla honesta a cinco bandas
Cada brazo, cada número, resultados negativos incluidos:
| Métrica | Base | v1 | v2 | v3 | v4 (la que se publica) |
|---|---|---|---|---|---|
| Delatores mecánicos restantes (de 103) | 4 | 4 | 13 | 12 | 2 |
| Similitud a IA, mediana¹ (menor = más humano) | 27 | 32.5 | 46.5 | 45 | 26 |
| Afirmaciones intactas (de 130) | 127 (97.7%) | 127 (97.7%) | 130 (100%) | 130 (100%) | 129 (99.2%) |
| hechos alterados / descartados / añadidos | 2 / 1 / 0 | 1 / 2 / 0 | 0 / 0 / 0 | 0 / 0 / 0 | 0 / 1 / 0 |
| Preferencia ciega de humanidad (skill V-E-D vs base) | — | 4-0-8 | 0-0-12 | 0-0-12 | 8-0-4 |
¹ Juez LLM ciego en contexto (0–100), de la misma familia de modelo que la reescritora — etiquetado honestamente, no un detector. La mediana del base osciló entre 27–30 según la ronda; eso es varianza del juez, revelada, no suavizada.
El único fallo de v4: el explicador de OAuth se dejó una glosa de acrónimo — mantuvo "la extensión PKCE" y su propósito pero no la expansión del nombre completo "Proof Key for Code Exchange." Contado estrictamente como una afirmación descartada por honestidad. Es una glosa explicativa, no un número, nombre, fecha, cita o matiz, y ninguna afirmación se desvió. Ese es exactamente el modo de fallo que arriesga la reestructuración libre, apareció una vez en 130 afirmaciones, y ahora está parcheado en el paso de relectura ("preservar las expansiones de acrónimos").
GET THE SKILL
text-humanizer es gratis y tiene licencia MIT. El repo es la skill — el benchmark completo, los cinco brazos, los registros de fallos, y cada auditoría por afirmación van incluidos.
Consigue text-humanizer en GitHubLo que no afirmamos
La victoria es real, pero no es un aplastamiento, y fingir lo contrario echaría por tierra el sentido de ejecutar el benchmark. Varios textos estuvieron casi en cara-o-cruz (25 frente a 26, 26 frente a 27, 26 frente a 26). Esta es una puntuación de un solo juez en contexto, de la misma familia de modelo que la reescritora — no un detector externo — y el corpus fue creado por el mismo proyecto. Trata la preferencia 8-4 y los números de similitud a IA como directional: "v4 supera el listón," no "v4 domina." El conteo de delatores y la auditoría de afirmaciones son las métricas sólidas.
No prometemos resultados de detector. Los detectores discrepan en 15–25% de los textos y dan falsos positivos con escritura humana real. Esta skill reconstruye el texto hacia una voz humana; no vende una garantía de bypass, y si tu contexto exige divulgar el uso de IA — trabajo académico, política editorial — divúlgalo. Un humanizador es una editora, no un disfraz. Una ronda con evaluadores humanos o un detector en vivo es la confirmación que recomendamos antes de que alguien dé el 8-4 por definitivo.
Por qué esto hace confiable a SkillProof
Podríamos haber ejecutado cuatro versiones, enterrado las tres derrotas, y publicado una página que dijera "nuestro humanizador supera al baseline 8-4." Prácticamente cada competidor de este nicho hace justo eso — afirma un número, no muestra nada del trabajo detrás.
En vez de eso, publicamos los tres fallos. La sobrecorrección de v1, las dos derrotas quirúrgicas en 0-12, el diagnóstico, la inversión. Puedes leerlo todo, volver a ejecutar tú misma el conteo automatizado de delatores, y comprobar cada auditoría de afirmaciones en el repo. Esa es toda la propuesta: testeamos las skills de otras personas para ganarnos la vida, y nuestras propias skills reciben el mismo trato — medidas, con resultados negativos adjuntos.
Se suma a nuestra serie de disciplina: token-discipline recorta lo que tus prompts cuestan, research-discipline recorta lo que tu investigación se equivoca, y esta recorta lo que tu escritura delata.
FREE STARTER PACK
¿Quieres nuestras skills mejor puntuadas más el checklist de instalación que usamos antes de cada test? Te enviamos por email el pack gratuito de inicio.
Consigue el pack gratuito de inicioInstalación
git clone https://github.com/Skillproofdev/text-humanizer ~/.claude/skills/text-humanizer
Reinicia Claude Code. Se activa con "humaniza esto," "esto suena a IA / a ChatGPT," "haz que suene natural," y preocupaciones de detección de IA — en cualquier idioma. Se mantiene al margen de escribir contenido nuevo desde cero, los trabajos de traducción, y las tareas que no son de texto.
Preguntas frecuentes
¿Por qué publicar los tres fallos siquiera? Porque son la evidencia. Cualquiera puede afirmar "8-4 sobre el baseline." Las tres derrotas muestran que la victoria no fue suerte ni un juez ajustado a medida — vino de una revelación concreta y comprobable (la estructura gana al vocabulario) que solo salió a la luz tras tres derrotas honestas. Los fallos son lo que hace creíble el número.
¿Esto vence a los detectores de IA? No podemos decirlo, y no vamos a fingir que sí. Las API de detectores que planeábamos usar estaban todas bloqueadas por clave o pago en el momento de la ejecución, así que nuestra cifra de "similitud a IA" es un juez LLM ciego en contexto, no una puntuación de detector. La skill elimina delatores y reconstruye el texto hacia una voz humana; no vende una garantía de bypass de detectores. Los detectores discrepan en 15–25% de los textos y dan falsos positivos con escritura humana genuina.
¿Reestructurar mi texto va a cambiar lo que dice? Esa es toda la restricción de diseño. El conjunto de afirmaciones — cada número, nombre, fecha, cita y matiz, más la dirección y fuerza de cada una — está congelado, y una pasada final obligatoria recorre el original afirmación por afirmación contra la reescritura para restaurar cualquier desviación. En el benchmark, la reestructuración libre mantuvo intactas 129 de 130 afirmaciones (0 alteradas, 0 añadidas), siendo el único fallo una glosa de acrónimo que no sostenía el texto, ya parcheada.
¿El margen de 8-4 es suficiente para fiarse? Supera el listón que fijamos de antemano — ganar la preferencia ciega — donde tres versiones anteriores perdieron. Pero es una victoria clara, no un aplastamiento, de un solo juez en contexto sobre un corpus autoescrito. Trátalo como directional y confirma tú misma las decisiones que sostienen algo importante; el conteo de delatores y la auditoría de afirmaciones son las métricas sobre las que apostaríamos con más fuerza.
★ 9.6/10 × 3
El pack de inicio gratis
Los 3 skills con nuestras mejores puntuaciones de test más la checklist de instalación: el setup que pondríamos en una máquina recién estrenada. Gratis, por email.