
Medimos las alucinaciones de la IA en Claude: -59%
Le haces una pregunta de investigación a Claude y obtienes algo peligroso: una respuesta segura y bien escrita. Que sea verdadera es una propiedad aparte, y no puedes saberlo solo con leerla. Dirigimos un directorio que pone a prueba skills de Claude para vivir de ello, y decidimos medir esto en serio: cuántas afirmaciones factuales en una respuesta de investigación típica son en realidad incorrectas — y cuántas sobreviven cuando obligas al modelo a seguir reglas de verificación.
El resultado es research-discipline, nuestra tercera skill, y la primera en su nicho en publicarse con un benchmark medido de antes/después: 13.0% de las afirmaciones de referencia eran incorrectas u obsoletas; con la skill, 5.4%. Un recorte del 59%. Es gratis y con licencia MIT: github.com/Skillproofdev/research-discipline.
La brecha: los pipelines no verifican, los verificadores no investigan
Antes de escribir una sola línea, revisamos 15 skills de investigación y verificación de hechos publicadas, además de nuestro propio índice de 16,682 skills descubiertas. El panorama se divide claramente en dos bandos que nunca se cruzan.
Los pipelines de investigación profunda — los populares, con hasta 1.6k estrellas — orquestan búsquedas paralelas y generan informes largos. Si lees sus reglas, encuentras ergonomía de flujo de trabajo, no epistemología: sin citas por afirmación, sin reglas de calidad de fuentes, sin exigencia de comprobar nada dos veces. Los auditores de verificación de hechos — sobre todo herramientas de periodismo y academia, dos órdenes de magnitud menos populares — sí exigen veredictos y citas, pero solo a posteriori, sobre un borrador terminado que alguien les entrega.
Nadie ofrece el término medio: una disciplina ligera que gobierna las afirmaciones del agente mientras investiga, sea la respuesta de tres párrafos o de treinta. Y, curiosamente, nadie en ninguno de los dos bandos publica mediciones. El competidor más ruidoso afirma "superar a OpenAI, Gemini y Claude Desktop" sin un solo número que lo respalde; otro declara "95%+ de precisión" como objetivo que nunca puso a prueba. El nicho funciona a base de intuición.
Ocho reglas, tres de ellas inéditas
La skill son ~1,500 tokens de reglas aplicables (SKILL.md completo). Lo conocido: cada afirmación factual lleva una cita en línea que remite a una lista de fuentes fechada; las afirmaciones sin respaldo reciben una etiqueta explícita [unverified] en vez de un tono seguro; las fuentes están clasificadas por niveles, y las granjas de contenido quedan rechazadas de plano. Lo que nadie más exige:
- La memoria es una hipótesis. Para cualquier cosa volátil — versiones, precios, cualquier "actual" — el recuerdo de los datos de entrenamiento es una pista que verificar, nunca una prueba. Primero obtén la fecha, busca, y solo entonces afirma.
- Dos fuentes independientes para los hechos que sostienen la afirmación. La independencia está definida: dos artículos que reescriben el mismo comunicado de prensa cuentan como una sola fuente. La única implementación previa de esta comprobación que encontramos en cualquier parte fue un gist con una estrella.
- Las cifras se citan, no se fabrican. Valor textual, unidad y fecha; cuando las fuentes no coinciden, se informa el rango con ambas citas — nunca un valor de compromiso silencioso.
Además, una pasada adversarial con una función forzosa tomada de lo mejor que encontramos en trabajos previos: buscar una vez lo contrario de tu conclusión, encontrar al menos dos debilidades en tu propio borrador, o volver a examinar tus afirmaciones más determinantes.
El benchmark: cada afirmación juzgada contra fuentes en vivo
Seis preguntas de investigación con respuestas objetivamente comprobables, elegidas antes de cualquier ejecución: una búsqueda de versión, una comparación de precios, un resumen de hechos, una consulta de repositorio de GitHub y dos trampas. Cada pregunta se ejecutó dos veces — un agente Claude Sonnet sin la skill, otro leyéndola primero, ambos con acceso completo a la web. Después, agentes verificadores independientes establecieron la verdad de referencia a partir de fuentes primarias en vivo y juzgaron una por una las 110 afirmaciones factuales de las 12 respuestas.
| Pregunta | Incorrecto/obsoleto en la base | Con la skill |
|---|---|---|
| Catálogo de modelos de Claude (trampa de obsolescencia) | 3 | 0 |
| Preparación de Bun para producción (trampa de evento real) | 1 | 1 |
| Tabla de datos de Deno | 1 | 0 |
| Datos del repositorio de GitHub | 1 | 0 |
| Historial de versiones de Astro | 1 | 1 |
| Comparación de precios de email | 0 | 1 |
| Total | 7 de 54 (13.0%) | 3 de 56 (5.4%) |
Las dos trampas son donde la skill se ganó el sueldo.
La trampa de la obsolescencia. Al pedírsele el catálogo actual de modelos de Claude, el agente base respondió desde una referencia en caché sin una sola comprobación en vivo — tres cifras de ventana de contexto salieron mal. La Regla 1 del agente con la skill obligó a consultar la página de documentación en vivo; el veredicto del verificador: "coincide con la documentación en vivo en cada una de las cifras." Mismo modelo, misma pregunta, mismas herramientas disponibles. La única diferencia fue una regla que dice que la memoria no cuenta como prueba.
La trampa del evento real. Al preguntársele si Bun está listo para producción en 2026, el agente base se topó con el hecho de que Anthropic adquirió Bun en diciembre de 2025 — y lo descartó como un rumor de SEO sin verificar. Sus fuentes eran blogs de terceros; nunca abrió bun.com ni anthropic.com, donde están ambos anuncios primarios. El agente con la skill citó ambos, y el verificador los confirmó en vivo. Léelo de nuevo: la única marca de incertidumbre del agente base en todo el benchmark apuntaba a un evento verdadero. El escepticismo sin verificación es solo otra forma de estar equivocado.
Dónde perdió la skill — publicado de todos modos
Nuestra metodología exige poner las derrotas junto a las victorias, y hubo dos.
En la pregunta de precios de email, la base en realidad superó a la skill: calculó el precio de los tres niveles de Postmark y encontró el más barato, mientras que el agente con la skill calculó el precio de un solo nivel, lo llamó "la opción más barata" y se equivocó por $2.50/mes. La disciplina de citas no hace tu aritmética por ti — una enumeración incompleta es un fallo de investigación que las reglas no detectan. Y en la pregunta de Bun, el agente con la skill repitió el número de versión incorrecto que daba un medio tecnológico para un lanzamiento real, en vez de contrastarlo con las notas de la versión del proveedor — una fuente de nivel 2 en la que confió un nivel de más.
También con honestidad: la disciplina cuesta alrededor de +10% tokens — las consultas en vivo y la pasada adversarial no son gratis. Y en las doce respuestas, las ~8 etiquetas proactivas [unverified]/[single-source] de la skill fueron todas juzgadas apropiadas, lo cual es en sí mismo un resultado: la skill no solo recorta afirmaciones incorrectas, también te dice cuáles de las que sobreviven conviene comprobar dos veces.
PACK SKILLPROOF
research-discipline es gratis. Si quieres la configuración completa de eficiencia que lo rodea — un CLAUDE.md recortado, una auditoría de MCP y cuatro skills probadas ya preconfiguradas — eso es el Optimizer Pack.
Consigue el Optimizer Pack — $10Instalación
git clone https://github.com/Skillproofdev/research-discipline ~/.claude/skills/research-discipline
Reinicia Claude Code. Se activa con preguntas de investigación, "qué hay de nuevo", comparaciones y solicitudes de verificación de hechos — y se mantiene al margen en programación, opiniones y trabajo creativo. Se suma a token-discipline en nuestra serie de disciplina: esa reduce lo que cuesta investigar, esta reduce lo que sale mal.
PACK INICIAL GRATIS
¿Quieres nuestras skills mejor puntuadas más la checklist de instalación que pasamos antes de cada test? Te enviamos por email el pack inicial gratis.
Consigue el pack inicial gratisPreguntas frecuentes
¿Esto reemplaza la investigación profunda integrada de Claude? No — la complementa. Las funciones de investigación integradas son generadoras de informes; esto es una capa de disciplina que se aplica a toda respuesta con forma de investigación, incluidas las cortas, y es inspeccionable: puedes leer las ocho reglas en una sola pantalla.
¿No se limitará Claude a negarse a responder cuando no pueda verificar algo? La skill lo prohíbe explícitamente: evidencia débil significa responder con etiquetas, no encogerse de hombros. Un "no pude confirmar esto" pegado a una afirmación concreta es más útil que la falsa confianza o que la negativa a responder.
¿Por qué solo seis preguntas? Porque cada afirmación se verificó a mano contra fuentes primarias en vivo — 110 afirmaciones en 12 respuestas, cada una con un veredicto comprobable. Preferimos un benchmark pequeño con una verdad de referencia real antes que uno grande puntuado por un juez sin verificar. El conjunto de preguntas y los veredictos por afirmación están en el README del repo.
¿Sigue siendo demasiado alto el 5.4%? Sí. La skill recorta las afirmaciones incorrectas a más de la mitad; no hace que Claude sea infalible, y los dos errores residuales de nuestro propio benchmark están documentados arriba. Si una decisión sale cara si te equivocas, verifica tú mismo los hechos determinantes — las citas de la skill hacen que eso tome minutos en vez de horas.
★ 9.6/10 × 3
El pack de inicio gratis
Los 3 skills con nuestras mejores puntuaciones de test más la checklist de instalación: el setup que pondríamos en una máquina recién estrenada. Gratis, por email.