
Resúmenes de Claude que no reescriben los hechos en silencio
Le pides a Claude que resuma un documento y obtienes un digest limpio y seguro de sí mismo. Lo que no puedes ver — porque no leíste la fuente — es todo lo que el resumen cambió en silencio por el camino: un "puede reducir el riesgo" que se convirtió en "reduce el riesgo", un $2.4M que pasó a ser $2.9M, dos fechas que se contradecían y quedaron colapsadas en una sola. Un resumen es compresión con pérdida de las afirmaciones de otra persona, y la única pérdida legítima es la omisión. Todo lo demás es distorsión que el lector no tiene forma de detectar.
Así que lo medimos. El resultado es summary-discipline, nuestra skill más reciente: nueve reglas exigibles de fidelidad, con benchmark de antes/después contra una hoja de ground truth congelada. Es gratis y tiene licencia MIT: github.com/Skillproofdev/summary-discipline.
La brecha del nicho: 174 resumidores, cero reglas de fidelidad
Antes de escribir una regla, buscamos en nuestro índice de 16.682 skills descubiertas. 460 mencionan resumir; 174 son resumidores genuinos. Cada una de ellas optimiza lo mismo: estructura y brevedad — secciones, número de viñetas, elementos de acción, tono. Cero enuncian una sola regla comprobable sobre la relación entre el resumen y su fuente: nada añadido, números textuales, matices intactos, atribución preservada.
Eso es lo raro, porque la academia lleva una década midiendo exactamente estos fallos. FactCC, FRANK, SummaC, AggreFact, FaithBench — toda una literatura de benchmarks de fidelidad en resumen con tipos de error nombrados. Ninguna skill publicada importa nada de eso. summary-discipline es esa transferencia que faltaba: categorías de error de benchmarks de alucinación convertidas en reglas de tiempo de generación que puedes auditar línea por línea.
Nueve reglas, cada una auditable contra la fuente
El SKILL.md completo son nueve reglas; las que sostienen todo:
- Ninguna afirmación sin una frase de origen. Si no puedes señalar el pasaje que respalda una frase, esa frase no entra. El contexto genuinamente necesario se marca como
[context, not in source]. - Los números se copian, nunca se recalculan. Valor, unidad y referente al pie de la letra — sin redondear, promediar ni hacer aritmética silenciosa. "$4.2M de ingresos en el T3, +12% interanual", nunca "más o menos $4M".
- Conserva el matiz. "Puede reducir el riesgo" nunca se convierte en "reduce el riesgo"; "confirmado" nunca se suaviza a "podría". La modalidad es lo último que te está permitido recortar.
- Conserva la atribución. "El CEO afirma que los márgenes mejoraron" ≠ "los márgenes mejoraron". Nunca fusiones a dos voces en un consenso que nadie expresó.
- Marca las contradicciones; nunca las resuelvas en silencio. Dos cifras que se contradicen siguen siendo dos cifras, en un bloque visible Flagged. El resumen no elige un ganador ni promedia.
A eso se suma un contrato de compresión declarado (~4.800 palabras → ~200 palabras · orden de importancia), reglas de omisión que protegen decisiones, plazos, riesgos y matices que invierten el sentido a cualquier extensión, anclas de cita en las afirmaciones que sostienen el texto, y una autoauditoría afirmación por afirmación antes de entregar.
El benchmark: cada afirmación auditada contra una hoja congelada
Este es el alcance honesto, dicho por adelantado. El corpus tiene 11 documentos, uno por categoría de estrés. Estos números vienen de un subconjunto preregistrado de 6 documentos — el ensayo de cardiotide D02, la revisión trimestral D04, el postmortem de incidente D05, la transcripción de lanzamiento D07, los resúmenes de investigación del sueño D09, el memo con contradicción plantada D11 — elegidos por la coordinadora antes de cualquier ejecución, uno por categoría. Los otros cinco todavía no se han ejecutado. Trata esto como una lectura directional, no como el resultado del corpus completo.
La preregistración importa aquí: antes de generar cualquier resumen, registramos para cada documento su lista de hechos clave, cada afirmación con matiz, cada afirmación atribuida, y cada número con su referente. Una "omisión crítica" se define contra esa hoja congelada — no se inventa después de ver la salida. Luego, dos brazos por documento: baseline ("resume esto" a secas) y skill (mismo prompt, con el SKILL.md cargado primero), mismo modelo, misma extensión objetivo, cada salida atomizada y auditada afirmación por afirmación.
| Métrica (totales de 6 docs) | Baseline | Skill |
|---|---|---|
| Afirmaciones añadidas | 0 | 0 |
| Números distorsionados | 0 | 0 |
| Pérdidas de matiz (subidas de certeza) | 1 | 0 |
| Pérdidas de atribución | 0 | 0 |
| Omisiones críticas | 10 | 2 |
| Contradicciones marcadas (de 3 plantadas) | 0 | 3 |
El caso estrella: un memo que se contradice a sí mismo
D11 es un memo de estado de proyecto con tres contradicciones plantadas entre su resumen ejecutivo y su cuerpo: un presupuesto de $2.4M frente a $2.9M, dos fechas de cutover distintas, y 6 frente a 8 ingenieros. Este es exactamente el modo de fallo para el que se construyó la skill.
El baseline resolvió las tres en silencio. Planteó un presupuesto, una fecha de cutover, una plantilla — cada una como hecho zanjado, sin señalar en ningún momento que el memo se contradecía a sí mismo. Quien lea ese resumen no tiene forma de saber que la fuente discrepa. (Dio la casualidad de que eligió las cifras internamente consistentes — $2.9M coincide con la cuenta del "58% gastado" — pero eso es suerte, no divulgación.)
La skill marcó las tres, con ambos valores presentados, ninguno promediado, en un bloque Flagged visible. Es el resultado más limpio de todo el benchmark, y el motivo importa: marcar contradicciones es un comportamiento, no una cuestión de presupuesto de palabras. Un resumen de 160 palabras podría haber marcado los tres conflictos en una línea cada uno. La skill también conservó ocho matices autolimitantes que el baseline eliminó mientras mantenía el titular — el "un resultado nulo no debe interpretarse como evidencia de seguridad" de un resumen de investigación, el equilibrio entre ruido y alertas de un postmortem — los casos de la Regla 6, "conserva el matiz que invierte el sentido".
Dónde empata, y el factor de confusión que no vamos a esconder
Nuestra metodología exige mostrar las derrotas junto a las victorias, y esta ejecución tiene derrotas reales.
En tres métricas, ambos brazos puntuaron cero. Afirmaciones añadidas, números distorsionados, pérdidas de atribución — empate en 0/0. A estas extensiones objetivo, el modelo baseline ya es disciplinado a la hora de no inventar hechos, estropear números o despojar a los hablantes de su voz. La skill no lo superó ahí porque no había nada que superar. La única pérdida de matiz del baseline ("moderadamente estable" → "estable") es un caso límite y podría razonablemente puntuarse como cero, lo que empataría también esa métrica. Y en D07 — el documento construido para poner a prueba la modalidad — el baseline conservó por su cuenta el matiz insignia de "objetivo, no un compromiso". La ventaja de titular de la skill no se materializó en el documento diseñado para probarla.
Y las ganancias en omisiones se apoyan en parte en una salida más larga. Este es el factor de confusión, y es estructural, no cosmético: las salidas de la skill fueron aproximadamente 1.7× más largas que las del baseline (compresión media 2.6× frente a 4.5×), y superó el objetivo de palabras en los seis documentos. La mayor parte del exceso es el aparato de Flagged + Omitted añadido después de un cuerpo de resumen casi en el objetivo — pero en D04 la skill también alargó el cuerpo en sí, citando explícitamente la fidelidad, y lo puntuamos como un fallo de extensión en vez de justificarlo a posteriori. La lectura honesta: una parte de las "8 omisiones menos" es la skill gastando más palabras. Donde gana en igualdad de condiciones es (a) la divulgación de contradicciones, independiente de la extensión, y (b) en D09, donde el baseline estaba dentro de la extensión y aun así se dejó tres matices que la skill conservó.
Hacen falta ejecuciones con los 11 documentos completos antes de generalizar. Este subconjunto es favorable a la skill pero no es un barrido limpio.
SKILLPROOF PACK
summary-discipline es gratis y MIT. Cada número de arriba, más las puntuaciones por documento y las hojas de ground truth congeladas, está en el repo público — resultados negativos incluidos.
Consigue summary-discipline en GitHubInstalación
git clone https://github.com/Skillproofdev/summary-discipline ~/.claude/skills/summary-discipline
Reinicia Claude Code. Se activa con "resume", "tl;dr", "puntos clave de", digests de reuniones, y compresión de documentos largos — y se mantiene al margen de la reescritura creativa, la traducción y los cambios de tono. Se suma a nuestra serie de disciplina: token-discipline recorta lo que cuesta una tarea, research-discipline recorta lo que la investigación se equivoca, y esta recorta lo que un resumen cambia en silencio.
FREE STARTER PACK
¿Quieres nuestras skills mejor puntuadas más el checklist de instalación que usamos antes de cada test? Te enviamos por email el pack gratuito de inicio.
Consigue el pack gratuito de inicioPreguntas frecuentes
¿Esto hace los resúmenes más largos? En este subconjunto, sí — alrededor de 1.7× más largos que el baseline, sobre todo por el bloque Flagged. Ese es el factor de confusión que señalamos arriba, no una funcionalidad. La única victoria independiente de la extensión es marcar contradicciones: la skill puede sacar a la luz un conflicto en una sola línea sin gastar un presupuesto de palabras mayor.
¿Cómo se define una "omisión crítica" para que no se puntúe a posteriori? Preregistración. Antes de que exista ningún resumen, congelamos la lista de hechos clave de cada documento — decisiones, cifras destacadas con sus referentes, matices que invierten el sentido. La auditoría se hace contra esa hoja, así que "te dejaste un hecho crítico" no se puede inventar para favorecer a ninguno de los dos brazos.
¿Sustituye a una persona leyendo la fuente? No. Reduce la distorsión silenciosa y saca a la luz contradicciones que el baseline enterraba, pero está benchmarkeada en 6 de 11 documentos y empata con el baseline en tres métricas. Si una decisión sale cara de equivocar, las anclas de cita de la skill hacen que verificar las afirmaciones que sostienen el texto lleve segundos — úsalas.
¿Por qué solo seis documentos? Porque cada afirmación de cada salida se auditó a mano contra una hoja de ground truth congelada. Preferimos un benchmark pequeño con un ground truth real antes que uno grande puntuado por un juez sin verificar. Los cinco documentos restantes, y las puntuaciones completas por documento, están publicados en el veredicto del repo.
★ 9.6/10 × 3
El pack de inicio gratis
Los 3 skills con nuestras mejores puntuaciones de test más la checklist de instalación: el setup que pondríamos en una máquina recién estrenada. Gratis, por email.