
Claude-resuméer der ikke stille omskriver fakta
Bed Claude om at resumere et dokument, og du får et rent, selvsikkert udtog. Det, du ikke kan se — fordi du ikke læste kilden — er alt, hvad resuméet stille ændrede på vejen ned: et "may reduce risk," der blev til "reduces risk," en $2.4M, der blev til $2.9M, to modstridende datoer smeltet sammen til én. Et resumé er tabsgivende komprimering af en andens påstande, og det eneste legitime tab er udeladelse. Alt andet er forvrængning, læseren ikke har nogen måde at opdage.
Så vi målte det. Resultatet er summary-discipline, vores nyeste skill: ni håndhævelige troværdighedsregler, benchmarket før/efter mod et fastfrosset grundsandhedsark. Den er gratis og MIT-licenseret: github.com/Skillproofdev/summary-discipline.
Nichehullet: 174 opsummerere, nul troværdighedsregler
Før vi skrev en regel, gennemsøgte vi vores indeks på 16,682 opdagede skills. 460 nævner opsummering; 174 er ægte opsummerere. Hver eneste optimerer det samme: struktur og korthed — afsnit, punkttal, handlingspunkter, tone. Nul angiver en eneste kontrollerbar regel om forholdet mellem resuméet og dets kilde: intet tilføjet, tal ordret, forbehold intakte, kildeangivelse bevaret.
Det er det underlige, for akademia har målt præcis de her fejl i et årti. FactCC, FRANK, SummaC, AggreFact, FaithBench — en hel litteratur af opsummerings-troværdighedsbenchmarks med navngivne fejltyper. Ingen udgivet skill importerer noget af det. summary-discipline er det manglende overførsel: fejlkategorier fra hallucinationsbenchmarks omsat til genereringstidsregler, du kan revidere linje for linje.
Ni regler, hver revisibel mod kilden
Den fulde SKILL.md er ni regler; de bærende:
- Ingen påstand uden en kildesætning. Kan du ikke pege på passagen, der berettiger en sætning, kommer den ikke med. Reelt nødvendig kontekst mærkes
[context, not in source]. - Tal kopieres, aldrig genudledes. Værdi, enhed og referent ordret — ingen afrunding, gennemsnit eller stille aritmetik. "$4.2M Q3 revenue, up 12% YoY," aldrig "roughly $4M".
- Bevar forbeholdet. "May reduce risk" bliver aldrig til "reduces risk"; "confirmed" blødgøres aldrig til "might". Modaliteten er det sidste ord, du må skære.
- Bevar kildeangivelsen. "The CEO claims margins improved" ≠ "margins improved". Slå aldrig to talere sammen til én konsensus, ingen udtalte.
- Flag modsigelser; løs dem aldrig stille. To modstridende tal forbliver to tal, i en synlig Flagged-blok. Resuméet vælger ikke en vinder eller laver et gennemsnit.
Plus en erklæret komprimeringskontrakt (~4,800 words → ~200 words · importance order), udeladelsesregler, der beskytter beslutninger, deadlines, risici og reverserende forbehold uanset længde, citatankre på bærende påstande, og en påstand-for-påstand-selvrevision før levering.
Benchmarken: hver påstand revideret mod et fastfrosset ark
Her er det ærlige omfang, sagt ligeud. Korpuset er 11 dokumenter, ét per stress-kategori. Disse tal er fra et forhåndsregistreret 6-dokuments delsæt — D02 cardiotide-forsøg, D04 kvartalsgennemgang, D05 hændelses-postmortem, D07 lanceringsudskrift, D09 søvnforskningsabstrakter, D11 plantet-modsigelses-memo — udvalgt af koordinatoren før nogen kørsler, én per kategori. De øvrige fem er ikke kørt endnu. Betragt det her som en retningsgivende læsning, ikke det fulde korpus-resultat.
Forhåndsregistrering betyder noget her: før noget resumé genereres, registrerer vi for hvert dokument dets liste over nøglefakta, hvert forbeholdt udsagn, hver kildeangivet påstand og hvert tal med dets referent. En "kritisk udeladelse" defineres mod det fastfrosne ark — ikke opfundet efter at have set outputtet. Så to arme per dokument: baseline (rent "summarize this") og skill (samme prompt, SKILL.md indlæst først), samme model, samme mållængde, hvert output atomiseret og revideret påstand for påstand.
| Metrik (6-dok totaler) | Baseline | Skill |
|---|---|---|
| Tilføjede påstande | 0 | 0 |
| Forvrængede tal | 0 | 0 |
| Forbehold-drop (sikkerheds-opgraderinger) | 1 | 0 |
| Kildeangivelsestab | 0 | 0 |
| Kritiske udeladelser | 10 | 2 |
| Modsigelser flaget (af 3 plantede) | 0 | 3 |
Stjernesagen: et memo der modsiger sig selv
D11 er et projektstatus-memo med tre modsigelser plantet mellem sit resumé og sin brødtekst: et budget på $2.4M vs $2.9M, to forskellige overgangsdatoer og 6 vs 8 ingeniører. Det er præcis den fejlmåde, skillen blev bygget til.
Baseline løste stille alle tre. Den angav ét budget, én overgangsdato, ét antal ansatte — hver som afgjort fakta, aldrig én gang med signal om, at memoet modsagde sig selv. En læser af det resumé har ingen måde at vide, at kilden er uenig med sig selv. (Den kom til at vælge de internt konsistente tal — $2.9M matcher "58% brugt"-regnestykket — men det er held, ikke gennemsigtighed.)
Skillen flagede alle tre, begge værdier præsenteret, ingen gennemsnit, i en synlig Flagged-blok. Det er det reneste resultat i hele benchmarken, og grunden er vigtig: modsigelsesflagning er en adfærd, ikke et ordbudget. Et resumé på 160 ord kunne have flaget alle tre konflikter i én linje hver. Skillen bevarede også otte selvbegrænsende forbehold, baseline droppede, mens den beholdt overskriften — et forskningsabstrakts "null result should not be interpreted as evidence of safety", en postmortems afvejning af alarmstøj — Regel 6's "behold det reverserende forbehold"-sager.
Hvor det er uafgjort, og forveklingen vi ikke skjuler
Vores metode kræver, at tabene står ved siden af sejrene, og denne kørsel har reelle.
På tre metrikker scorede begge arme nul. Tilføjede påstande, forvrængede tal, kildeangivelsestab — uafgjort på 0/0. Ved de her mållængder er baseline-modellen allerede disciplineret om ikke at opfinde fakta, ødelægge tal eller strippe talere. Skillen slog den ikke der, fordi der ikke var noget at slå. Det ene baseline-forbeholds-drop ("moderately stable" → "stable") er grænsetilfælde og kunne rimeligt scores nul, hvilket ville gøre den metrik uafgjort også. Og på D07 — dokumentet bygget til at stresse modalitet — beholdt baseline selv flagskibsforbeholdet "target, not a commitment". Skillens overskriftsfordel materialiserede sig ikke på det dokument, der var designet til at teste den.
Og udeladelsesgevinsterne rider delvist på længere output. Det er forveklingen, og den er strukturel, ikke kosmetisk: skillens output kørte omkring 1.7× længere end baselinens (gennemsnitlig komprimering 2.6× mod 4.5×), og den overskred ordmålet på alle seks dokumenter. Det meste af overskridelsen er Flagged + Omitted-apparatet tilføjet efter en næsten-mål-lang resumé-brødtekst — men på D04 kørte skillen også selve brødteksten lang, eksplicit med henvisning til troværdighed, og vi scorede det som et længde-miss frem for at bortforklare det bagefter. Den ærlige læsning: en del af "8 færre udeladelser" er skillen, der bruger flere ord. Hvor den vinder på lige vilkår, er (a) modsigelsesoplysning uafhængig af længde, og (b) D09, hvor baseline var på-længde, men alligevel droppede tre forbehold, skillen beholdt.
Fulde 11-dokument-kørsler er nødvendige, før man generaliserer. Dette delsæt er gunstigt for skillen, men ikke en ren sejr.
SKILLPROOF PAKKE
summary-discipline er gratis og MIT. Hvert tal ovenfor, plus scorer per dokument og de fastfrosne grundsandhedsark, er i det offentlige repo — negative resultater inkluderet.
Hent summary-discipline på GitHubInstallation
git clone https://github.com/Skillproofdev/summary-discipline ~/.claude/skills/summary-discipline
Genstart Claude Code. Den udløses af "summarize", "tl;dr", "key points of", mødereferater og komprimering af lange dokumenter — og holder sig væk fra kreativ omskrivning, oversættelse og toneændringer. Den slutter sig til vores disciplin-serie: token-discipline skærer i, hvad en opgave koster, research-discipline skærer i, hvad research tager fejl om, og den her skærer i, hvad et resumé stille ændrer.
GRATIS STARTERPAKKE
Vil du have vores højest scorede skills plus den installationstjekliste, vi kører før hver eneste test? Vi sender dig den gratis starterpakke på mail.
Få den gratis starterpakkeFAQ
Gør det her resuméer længere? På det her delsæt, ja — omkring 1.7× længere end baseline, mest Flagged-blokken. Det er forveklingen, vi flager ovenfor, ikke en funktion. Den ene længde-uafhængige sejr er modsigelsesflagning: skillen kan afsløre en konflikt i én linje uden at bruge et større ordbudget.
Hvordan defineres en "kritisk udeladelse", så den ikke scores i bagklogskab? Forhåndsregistrering. Før noget resumé eksisterer, fastfryser vi hvert dokuments nøglefakta-liste — beslutninger, hovedtal med referenter, reverserende forbehold. Revision sker mod det ark, så "you dropped a critical fact" ikke kan opfindes for at favorisere nogen af armene.
Erstatter det en person, der læser kilden? Nej. Den skærer stille forvrængning og afslører modsigelser, baseline begravede, men den er benchmarket på 6 af 11 dokumenter og uafgjort med baseline på tre metrikker. Hvis en beslutning er dyr at tage fejl på, gør skillens citatankre det at verificere de bærende påstande et spørgsmål om sekunder — brug dem.
Hvorfor kun seks dokumenter? Fordi hver påstand i hvert output blev håndrevideret mod et fastfrosset grundsandhedsark. Vi foretrækker en lille benchmark, hvor grundsandheden er reel, frem for en stor, scoret af en uverificeret dommer. De resterende fem dokumenter, og de fulde scorer per dokument, er udgivet i repo-bedømmelsen.
★ 9.6/10 × 3
Den gratis startpakke
De 3 skills med vores højeste testscorer plus installations-tjeklisten — det setup, vi selv ville lægge på en frisk maskine. Gratis, på mail.