
Riassunti Claude che non riscrivono i fatti in silenzio
Chiedi a Claude di riassumere un documento e ottieni un digest pulito e sicuro di sé. Quello che non vedi — perché non hai letto la fonte — è tutto ciò che il riassunto ha cambiato in silenzio lungo il percorso: un "potrebbe ridurre il rischio" diventato "riduce il rischio", un $2,4M diventato $2,9M, due date in conflitto collassate in una sola. Un riassunto è compressione con perdita delle affermazioni di qualcun altro, e l'unica perdita legittima è l'omissione. Tutto il resto è distorsione che il lettore non ha modo di scoprire.
Quindi lo abbiamo misurato. Il risultato è summary-discipline, la nostra skill più recente: nove regole di fedeltà vincolanti, benchmarkate prima/dopo contro un foglio di ground truth congelato. È gratis e con licenza MIT: github.com/Skillproofdev/summary-discipline.
Il vuoto nella nicchia: 174 riassuntori, zero regole di fedeltà
Prima di scrivere una regola abbiamo cercato nel nostro indice di 16.682 skill scoperte. 460 menzionano il riassumere; 174 sono riassuntori genuini. Ognuno ottimizza la stessa cosa: struttura e brevità — sezioni, conteggio di bullet, action item, tono. Zero dichiarano anche una sola regola verificabile sul rapporto tra il riassunto e la sua fonte: niente aggiunto, numeri testuali, sfumature intatte, attribuzione preservata.
Questa è la parte strana, perché il mondo accademico misura esattamente questi fallimenti da un decennio. FactCC, FRANK, SummaC, AggreFact, FaithBench — un'intera letteratura di benchmark sulla fedeltà del riassunto con categorie di errore nominate. Nessuna skill pubblicata ne importa nulla. summary-discipline è quel trasferimento mancante: categorie di errore da benchmark accademici sulle allucinazioni trasformate in regole applicabili al momento della generazione, verificabili riga per riga.
Nove regole, ognuna verificabile contro la fonte
Il SKILL.md completo ha nove regole; quelle portanti:
- Nessuna affermazione senza una frase fonte. Se non riesci a indicare il passaggio che autorizza una frase, quella frase non entra. Il contesto genuinamente necessario viene marcato
[contesto, non nella fonte]. - I numeri si copiano, mai si ricalcolano. Valore, unità e referente testuali — niente arrotondamento, media o aritmetica silenziosa. "$4,2M di ricavi Q3, +12% su base annua", mai "circa $4M".
- Preserva la sfumatura. "Potrebbe ridurre il rischio" non diventa mai "riduce il rischio"; "confermato" non si ammorbidisce mai in "potrebbe". La modalità è l'ultima cosa che puoi tagliare.
- Preserva l'attribuzione. "Il CEO afferma che i margini sono migliorati" ≠ "i margini sono migliorati". Non fondere mai due voci in un consenso che nessuno ha pronunciato.
- Segnala le contraddizioni; non risolverle mai in silenzio. Due cifre in conflitto restano due cifre, in un blocco Flagged visibile. Il riassunto non sceglie un vincitore né fa la media.
Più un contratto di compressione dichiarato (~4.800 parole → ~200 parole · ordine di importanza), regole di omissione che proteggono decisioni, scadenze, rischi e riserve che ribaltano il senso a qualsiasi lunghezza, ancoraggi a citazione sulle affermazioni portanti, e un autoaudit affermazione per affermazione prima della consegna.
Il benchmark: ogni affermazione verificata contro un foglio congelato
Ecco lo scope onesto, dichiarato subito. Il corpus è di 11 documenti, uno per categoria di stress. Questi numeri vengono da un sottoinsieme pre-registrato di 6 documenti — D02 sperimentazione cardiotide, D04 revisione trimestrale, D05 postmortem incidente, D07 trascrizione di lancio, D09 abstract di ricerca sul sonno, D11 memo con contraddizioni piantate — scelti dal coordinatore prima di qualsiasi run, uno per categoria. Gli altri cinque non sono ancora stati girati. Considera questo un dato indicativo, non il risultato sull'intero corpus.
La pre-registrazione conta qui: prima che venga generato qualsiasi riassunto, registriamo per ogni documento la sua lista di fatti chiave, ogni affermazione sfumata, ogni affermazione attribuita, e ogni numero col suo referente. Una "omissione critica" è definita contro quel foglio congelato — non inventata dopo aver visto l'output. Poi due bracci per documento: baseline ("riassumi questo" semplice) e skill (stesso prompt, SKILL.md caricato prima), stesso modello, stessa lunghezza target, ogni output atomizzato e verificato affermazione per affermazione.
| Metrica (totali su 6 documenti) | Baseline | Skill |
|---|---|---|
| Affermazioni aggiunte | 0 | 0 |
| Numeri distorti | 0 | 0 |
| Sfumature perse (upgrade di certezza) | 1 | 0 |
| Perdite di attribuzione | 0 | 0 |
| Omissioni critiche | 10 | 2 |
| Contraddizioni segnalate (su 3 piantate) | 0 | 3 |
Il caso di punta: un memo che si contraddice da solo
D11 è un memo di stato progetto con tre contraddizioni piantate tra l'executive summary e il corpo: un budget di $2,4M contro $2,9M, due date di cutover diverse, e 6 contro 8 ingegneri. Questo è esattamente il tipo di fallimento per cui la skill è stata costruita.
Il baseline ha risolto tutte e tre in silenzio. Ha dichiarato un budget, una data di cutover, un numero di persone — ciascuno come fatto assodato, senza mai segnalare che il memo si contraddiceva. Un lettore di quel riassunto non ha modo di sapere che la fonte è in disaccordo con se stessa. (Per caso ha scelto le cifre internamente coerenti — $2,9M combacia con la matematica del "58% speso" — ma è fortuna, non trasparenza.)
La skill ha segnalato tutte e tre, entrambi i valori presentati, nessuno mediato, in un blocco Flagged visibile. È il risultato più pulito dell'intero benchmark, e la ragione è importante: segnalare una contraddizione è un comportamento, non un budget di parole. Un riassunto di 160 parole avrebbe potuto segnalare tutti e tre i conflitti in una riga ciascuno. La skill ha anche preservato otto avvertenze auto-limitanti che il baseline ha eliminato pur mantenendo il titolo — un abstract di ricerca con "il risultato nullo non va interpretato come prova di sicurezza", il compromesso rumore-di-allerta di un postmortem — i casi della Regola 6 "mantieni l'avvertenza che ribalta il senso".
Dove pareggia, e il confondimento che non nascondiamo
La nostra metodologia richiede di mettere le perdite accanto alle vittorie, e questo run ne ha di reali.
Su tre metriche, entrambi i bracci hanno segnato zero. Affermazioni aggiunte, numeri distorti, perdite di attribuzione — pareggio a 0/0. A queste lunghezze target il modello baseline è già disciplinato nel non inventare fatti, storpiare numeri o spogliare le voci. La skill non ha vinto lì perché non c'era nulla da battere. L'unica sfumatura persa dal baseline ("moderatamente stabile" → "stabile") è al limite e potrebbe ragionevolmente valere zero, il che pareggerebbe anche quella metrica. E su D07 — il documento costruito apposta per stressare la modalità — il baseline ha mantenuto da solo l'avvertenza di punta "obiettivo, non un impegno". Il vantaggio principale della skill non si è materializzato sul documento progettato per testarlo.
E i guadagni sulle omissioni corrono in parte sull'output più lungo. Questo è il confondimento, ed è strutturale, non cosmetico: gli output della skill erano circa 1,7 volte più lunghi di quelli del baseline (compressione media 2,6x contro 4,5x), e ha superato l'obiettivo di parole su tutti e sei i documenti. Gran parte dello sforamento è l'apparato Flagged + Omitted aggiunto dopo un corpo di riassunto vicino al target — ma su D04 anche il corpo stesso della skill è andato lungo, citando esplicitamente la fedeltà, e lo abbiamo valutato come una mancanza di lunghezza invece di giustificarlo a posteriori. La lettura onesta: una parte delle "8 omissioni in meno" è la skill che spende più parole. Dove vince a parità di condizioni è (a) la trasparenza sulle contraddizioni, indipendente dalla lunghezza, e (b) D09, dove il baseline era nella lunghezza giusta ma ha comunque perso tre avvertenze che la skill ha mantenuto.
Servono i run completi sugli 11 documenti prima di generalizzare. Questo sottoinsieme è favorevole alla skill ma non è un dominio netto.
PACK SKILLPROOF
summary-discipline è gratis e MIT. Ogni numero qui sopra, più i punteggi per documento e i fogli di ground truth congelati, sono nel repo pubblico — risultati negativi inclusi.
Scarica summary-discipline su GitHubInstallazione
git clone https://github.com/Skillproofdev/summary-discipline ~/.claude/skills/summary-discipline
Riavvia Claude Code. Si attiva su "riassumi", "tl;dr", "punti chiave di", digest di riunioni, e compressione di documenti lunghi — e resta fuori dai piedi per riscrittura creativa, traduzione, e cambi di tono. Fa parte della nostra serie discipline: token-discipline taglia quanto costa un task, research-discipline taglia quanto la ricerca sbaglia, e questa taglia quanto un riassunto cambia in silenzio.
STARTER PACK GRATUITO
Vuoi le nostre skill con il punteggio più alto più la checklist di installazione che usiamo prima di ogni test? Ti mandiamo lo starter pack gratuito via email.
Ottieni lo starter pack gratuitoFAQ
Questo rende i riassunti più lunghi? Su questo sottoinsieme, sì — circa 1,7 volte più lunghi del baseline, soprattutto per via del blocco Flagged. Questo è il confondimento che segnaliamo sopra, non una feature. L'unico vantaggio indipendente dalla lunghezza è la segnalazione delle contraddizioni: la skill può far emergere un conflitto in una sola riga senza spendere un budget di parole maggiore.
Come si definisce una "omissione critica" senza deciderlo a posteriori? Pre-registrazione. Prima che esista qualsiasi riassunto, congeliamo la lista di fatti chiave di ogni documento — decisioni, numeri di titolo con referenti, avvertenze che ribaltano il senso. La verifica avviene contro quel foglio, quindi "hai perso un fatto critico" non può essere inventato per favorire nessuno dei due bracci.
Sostituisce un umano che legge la fonte? No. Elimina la distorsione silenziosa e fa emergere le contraddizioni che il baseline seppelliva, ma è benchmarkata su 6 degli 11 documenti e pareggia il baseline su tre metriche. Se una decisione è costosa da sbagliare, gli ancoraggi a citazione della skill fanno sì che verificare le affermazioni portanti richieda secondi — usali.
Perché solo sei documenti? Perché ogni affermazione in ogni output è stata verificata a mano contro un foglio di ground truth congelato. Preferiamo un benchmark piccolo dove la ground truth è reale a uno grande valutato da un giudice non verificato. I restanti cinque documenti, e i punteggi completi per documento, sono pubblicati nel verdetto del repo.
★ 9.6/10 × 3
Lo starter pack gratuito
I 3 skill con i nostri punteggi di test più alti, più la checklist di installazione: il setup che metteremmo su una macchina appena formattata. Gratis, via email.