
Claude-sammanfattningar som inte skriver om fakta
Be Claude sammanfatta ett dokument och du får en ren, självsäker sammanfattning. Det du inte kan se — för att du inte läste källan — är allt sammanfattningen tyst ändrade på vägen ner: ett "kan minska risken" som blev "minskar risken," en summa på 2,4 miljoner som blev 2,9 miljoner, två motstridiga datum som slogs ihop till ett. En sammanfattning är förlustbehäftad komprimering av någon annans påståenden, och den enda legitima förlusten är utelämning. Allt annat är förvrängning läsaren inte har någon möjlighet att upptäcka.
Så vi mätte det. Resultatet är summary-discipline, vår nyaste skill: nio tvingande regler för trohet mot källan, benchmarkad före/efter mot ett fastställt facit. Den är gratis och MIT-licensierad: github.com/Skillproofdev/summary-discipline.
Luckan i nischen: 174 sammanfattare, noll troghetsregler
Innan vi skrev en regel sökte vi i vårt index på 16 682 upptäckta skills. 460 nämner sammanfattning; 174 är genuina sammanfattare. Var och en optimerar samma sak: struktur och korthet — sektioner, punktantal, åtgärdspunkter, tonläge. Noll anger en enda kontrollerbar regel om förhållandet mellan sammanfattningen och dess källa: inget tillagt, siffror ordagrant, reservationer intakta, källhänvisning bevarad.
Det är det underliga, för akademin har mätt exakt de här felen i ett decennium. FactCC, FRANK, SummaC, AggreFact, FaithBench — en hel litteratur av troghetsbenchmark för sammanfattning med namngivna feltyper. Ingen publicerad skill importerar något av det. summary-discipline är den saknade överföringen: feltyper från hallucinationsbenchmark omvandlade till regler som gäller vid genereringstillfället, som går att revidera rad för rad.
Nio regler, var och en kan revideras mot källan
Hela SKILL.md har nio regler; de bärande:
- Inget påstående utan en källmening. Om du inte kan peka på passagen som ger en mening dess rätt att finnas med går den inte med. Genuint nödvändig kontext märks
[kontext, ej i källan]. - Siffror kopieras, härleds aldrig om. Värde, enhet och referent ordagrant — ingen avrundning, medelvärdesberäkning eller tyst aritmetik. "42 miljoner kr i Q3-intäkt, upp 12% mot föregående år," aldrig "ungefär 40 miljoner."
- Bevara reservationen. "Kan minska risken" blir aldrig "minskar risken"; "bekräftat" mjukas aldrig till "kanske." Modaliteten är det sista ordet du får skära bort.
- Bevara källhänvisningen. "VD:n hävdar att marginalerna förbättrades" ≠ "marginalerna förbättrades." Slå aldrig ihop två talare till en konsensus ingen faktiskt uttryckte.
- Flagga motsägelser; lös dem aldrig i tysthet. Två motstridiga siffror förblir två siffror, i ett synligt Flaggat-block. Sammanfattningen väljer inte vinnare och gör inget medelvärde.
Plus ett angivet komprimeringskontrakt (~4 800 ord → ~200 ord · viktighetsordning), utelämningsregler som skyddar beslut, deadlines, risker och omkastande reservationer oavsett längd, citatankare på bärande påståenden, och en egengranskning påstående för påstående innan leverans.
Benchmarket: varje påstående granskat mot ett fastställt facit
Här är det ärliga omfånget, sagt rakt ut. Korpusen är 11 dokument, ett per stresskategori. De här siffrorna kommer från en förregistrerad delmängd på 6 dokument — D02 kardiotid-studien, D04 kvartalsgenomgången, D05 incidentrapporten, D07 lanseringstranskriptet, D09 sömnforskningsabstrakten, D11 memot med planterade motsägelser — valda av koordinatorn innan någon körning, en per kategori. De andra fem är inte körda än. Behandla det här som en riktningsgivande läsning, inte hela korpusens resultat.
Förregistrering spelar roll här: innan någon sammanfattning genereras noterar vi för varje dokument dess lista över nyckelfakta, varje reserverat påstående, varje källhänvisat påstående och varje siffra med sin referent. En "kritisk utelämning" definieras mot det fastställda facit — inte hittas på i efterhand. Sedan två grenar per dokument: baslinje (enkelt "sammanfatta det här") och skill (samma prompt, SKILL.md inläst först), samma modell, samma målängd, varje utdata atomiserad och granskad påstående för påstående.
| Mått (totalt för 6 dokument) | Baslinje | Skill |
|---|---|---|
| Tillagda påståenden | 0 | 0 |
| Förvrängda siffror | 0 | 0 |
| Tappade reservationer (uppgraderad säkerhet) | 1 | 0 |
| Tappade källhänvisningar | 0 | 0 |
| Kritiska utelämningar | 10 | 2 |
| Flaggade motsägelser (av 3 planterade) | 0 | 3 |
Huvudfallet: ett memo som motsäger sig själv
D11 är ett projektstatusmemo med tre motsägelser planterade mellan sin sammanfattning och sin brödtext: en budget på 2,4 mot 2,9 miljoner, två olika omställningsdatum, och 6 mot 8 ingenjörer. Det är exakt den typ av fel skillen byggdes för.
Baslinjen löste alla tre i tysthet. Den angav en budget, ett omställningsdatum, en bemanningssiffra — var och en som avgjord fakta, utan att en enda gång signalera att memot motsade sig själv. En läsare av den sammanfattningen har ingen möjlighet att veta att källan är oense med sig själv. (Den råkade välja de internt konsekventa siffrorna — 2,9 miljoner matchar matematiken med "58% förbrukat" — men det är tur, inte transparens.)
Skillen flaggade alla tre, båda värdena presenterade, inget medelvärde, i ett synligt Flaggat-block. Det är det renaste resultatet i hela benchmarket, och anledningen är viktig: motsägelseflaggning är ett beteende, inte en ordbudget. En sammanfattning på 160 ord hade kunnat flagga alla tre konflikter i en rad vardera. Skillen bevarade också åtta självbegränsande reservationer baslinjen tappade samtidigt som den behöll huvudpoängen — ett forskningsabstrakts "nollresultatet ska inte tolkas som bevis på säkerhet," en incidentrapports avvägning kring larmbrus — Regel 6-fallen med "behåll den omkastande reservationen."
Där det är oavgjort, och den brist vi inte döljer
Vår metodik kräver att förlusterna redovisas bredvid vinsterna, och den här körningen har riktiga sådana.
På tre mått fick båda grenarna noll. Tillagda påståenden, förvrängda siffror, tappade källhänvisningar — oavgjort på 0/0. Vid de här mållängderna är basmodellen redan disciplinerad om att inte hitta på fakta, förvanska siffror eller strippa talare. Skillen slog den inte där för att det inte fanns något att slå. Det ensamma baslinjefelet ("måttligt stabil" → "stabil") är gränsfall och kunde rimligen poängsatts som noll, vilket skulle göra även det måttet oavgjort. Och på D07 — dokumentet byggt för att stressa modalitet — behöll baslinjen på egen hand flaggreservationen "mål, inte ett åtagande." Skillens huvudfördel visade sig inte på dokumentet designat för att testa den.
Och utelämningsvinsterna vilar delvis på längre utdata. Det här är förbehållet, och det är strukturellt, inte kosmetiskt: skillens utdata var omkring 1,7 gånger längre än baslinjens (medelkomprimering 2,6× mot 4,5×), och den överskred ordmålet på alla sex dokumenten. Det mesta av överskottet är apparaturen kring Flaggat + Utelämnat, tillagd efter en nästan målenlig sammanfattningskropp — men på D04 blev även själva brödtexten lång, uttryckligen med hänvisning till trohet, och vi poängsatte det som en längdmiss istället för att bortförklara det i efterhand. Den ärliga läsningen: en del av "8 färre utelämningar" är skillen som spenderar fler ord. Där den vinner på lika villkor är (a) motsägelseavslöjande, oberoende av längd, och (b) D09, där baslinjen höll längden men ändå tappade tre reservationer skillen behöll.
Fullständiga körningar på alla 11 dokument behövs innan man generaliserar. Den här delmängden gynnar skillen men är ingen ren svepseger.
SKILLPROOF-PAKETET
summary-discipline är gratis och MIT. Varje siffra ovan, plus poäng per dokument och de fastställda facit-arken, finns i det publika repot — negativa resultat inkluderade.
Hämta summary-discipline på GitHubInstallation
git clone https://github.com/Skillproofdev/summary-discipline ~/.claude/skills/summary-discipline
Starta om Claude Code. Den triggas av "sammanfatta," "tl;dr," "huvudpunkterna i," mötessammandrag och komprimering av långa dokument — och håller sig undan från kreativ omskrivning, översättning och tonändringar. Den ansluter till vår disciplinserie: token-discipline minskar vad en uppgift kostar, research-discipline minskar vad research har fel om, och den här minskar vad en sammanfattning tyst ändrar.
GRATIS STARTPAKET
Vill du ha våra bäst testade skills plus installationschecklistan vi kör inför varje test? Vi mejlar dig det gratis startpaketet.
Hämta det gratis startpaketetFAQ
Blir sammanfattningarna längre av det här? På den här delmängden, ja — omkring 1,7 gånger längre än baslinjen, mestadels Flaggat-blocket. Det är förbehållet vi lyfter ovan, ingen funktion. Den enda längdoberoende vinsten är motsägelseflaggning: skillen kan visa en konflikt i en enda rad utan att spendera en större ordbudget.
Hur definieras en "kritisk utelämning" så den inte hittas på i efterhand? Förregistrering. Innan någon sammanfattning finns fastställer vi varje dokuments lista över nyckelfakta — beslut, huvudsiffror med referenter, omkastande reservationer. Granskning sker mot det arket, så "du tappade en kritisk fakta" kan inte hittas på för att gynna endera grenen.
Ersätter det att en människa läser källan? Nej. Det tar bort tyst förvrängning och avslöjar motsägelser baslinjen begravde, men det är benchmarkat på 6 av 11 dokument och delar baslinjen på tre mått. Om ett beslut är dyrt att få fel gör skillens citatankare det snabbt att verifiera de bärande påståendena — använd dem.
Varför bara sex dokument? För att varje påstående i varje utdata granskades för hand mot ett fastställt facit-ark. Vi föredrar ett litet benchmark där facit är riktigt framför ett stort bedömt av en overifierad domare. De återstående fem dokumenten, och alla poäng per dokument, är publicerade i repots bedömning.
★ 9.6/10 × 3
Gratis startpaket
De 3 skills som fått våra högsta testbetyg plus installationschecklistan — setupen vi själva skulle lägga på en ny maskin. Gratis, via e-post.