Claude-samenvattingen die feiten niet herschrijven

Claude-samenvattingen die feiten niet herschrijven

Vraag Claude om een document samen te vatten en je krijgt een strakke, zelfverzekerde weergave. Wat je niet ziet — omdat je de bron niet las — is alles wat de samenvatting onderweg stilletjes veranderde: een "kan het risico verlagen" dat "verlaagt het risico" werd, een €2,4 miljoen dat €2,9 miljoen werd, twee tegenstrijdige data samengevoegd tot één. Een samenvatting is verlieslijdende compressie van andermans claims, en het enige legitieme verlies is weglating. Al het andere is vervorming die de lezer niet kan opmerken.

Dus hebben we het gemeten. Het resultaat is summary-discipline, onze nieuwste skill: negen afdwingbare regels rond getrouwheid, benchmarked voor/na tegen een bevroren ground-truth-sheet. Gratis en MIT-licensed: github.com/Skillproofdev/summary-discipline.

Het niche-gat: 174 samenvatters, nul getrouwheidsregels

Voordat we een regel schreven, doorzochten we onze index van 16.682 ontdekte skills. 460 noemen samenvatten; 174 zijn echte samenvatters. Elk daarvan optimaliseert hetzelfde: structuur en beknoptheid — secties, bullet-aantallen, actiepunten, toon. Nul stellen ook maar één controleerbare regel over de relatie tussen de samenvatting en zijn bron: niets toegevoegd, cijfers letterlijk, nuances intact, attributie behouden.

Dat is het vreemde, want de academische wereld meet deze faalpatronen al een decennium. FactCC, FRANK, SummaC, AggreFact, FaithBench — een hele literatuur van benchmarks voor samenvattingsgetrouwheid met genoemde foutcategorieën. Geen enkele gepubliceerde skill importeert die. summary-discipline is die ontbrekende overdracht: foutcategorieën uit hallucinatie-benchmarks omgezet in regels die je tijdens het genereren toepast en regel voor regel kunt controleren.

Negen regels, elk controleerbaar tegen de bron

De volledige SKILL.md telt negen regels; de dragende ervan:

  1. Geen claim zonder brongegeven. Kun je niet naar de passage wijzen die een zin rechtvaardigt, dan gaat hij er niet in. Écht nodige context krijgt het label [context, niet in bron].
  2. Cijfers worden gekopieerd, nooit opnieuw afgeleid. Waarde, eenheid en referent letterlijk — geen afronding, middeling of stille rekenkunde. "€4,2M omzet Q3, +12% j-o-j," nooit "ruwweg €4M".
  3. Bewaar de nuance. "Kan het risico verlagen" wordt nooit "verlaagt het risico"; "bevestigd" wordt nooit afgezwakt tot "mogelijk". De modaliteit is het laatste woord dat je mag schrappen.
  4. Bewaar de attributie. "De CEO stelt dat marges verbeterden" ≠ "marges verbeterden". Voeg nooit twee sprekers samen tot een consensus die niemand uitsprak.
  5. Markeer tegenstrijdigheden; los ze nooit stilletjes op. Twee tegenstrijdige cijfers blijven twee cijfers, in een zichtbaar Gemarkeerd-blok. De samenvatting kiest geen winnaar en middelt niet.

Plus een verklaard compressiecontract (~4.800 woorden → ~200 woorden · op volgorde van belang), weglaatregels die beslissingen, deadlines, risico's en omslagpunten in de nuance beschermen op elke lengte, citaatankers bij dragende claims, en een claim-voor-claim zelfcontrole voor oplevering.

De benchmark: elke claim getoetst aan een bevroren sheet

Hier is de eerlijke scope, meteen gezegd. Het corpus telt 11 documenten, één per stresscategorie. Deze cijfers komen uit een vooraf vastgelegde subset van 6 documenten — D02 cardiotide-trial, D04 kwartaalrapportage, D05 incident-postmortem, D07 lanceringstranscript, D09 slaaponderzoek-abstracts, D11 memo met ingebouwde tegenstrijdigheid — gekozen door de coördinator vóór elke run, één per categorie. De overige vijf zijn nog niet gedraaid. Zie dit als een richtinggevende lezing, niet het volledige-corpusresultaat.

Vooraf vastleggen is hier cruciaal: voordat er een samenvatting bestaat, leggen we per document de kernfeitenlijst vast, elke genuanceerde claim, elke toegeschreven claim en elk cijfer met zijn referent. Een "kritieke weglating" wordt gedefinieerd tegen dat bevroren sheet — niet verzonnen na het zien van de output. Dan twee armen per document: baseline (gewoon "vat dit samen") en skill (dezelfde prompt, SKILL.md eerst geladen), zelfde model, zelfde doellengte, elke output atomair uitgesplitst en claim voor claim getoetst.

Metriek (totalen over 6 documenten) Baseline Skill
Toegevoegde claims 0 0
Vervormde cijfers 0 0
Nuance-verlies (zekerheidsverhoging) 1 0
Attributieverlies 0 0
Kritieke weglatingen 10 2
Tegenstrijdigheden gemarkeerd (van 3 ingebouwd) 0 3

De sterspecase: een memo die zichzelf tegenspreekt

D11 is een projectstatusmemo met drie tegenstrijdigheden ingebouwd tussen zijn samenvatting en zijn hoofdtekst: een budget van €2,4M vs €2,9M, twee verschillende overgangsdata, en 6 vs 8 engineers. Dit is precies het faalpatroon waarvoor de skill gebouwd is.

De baseline loste alle drie stilletjes op. Hij noemde één budget, één overgangsdatum, één personeelsaantal — elk als vaststaand feit, zonder ooit te signaleren dat de memo zichzelf tegensprak. Een lezer van die samenvatting heeft geen manier om te weten dat de bron het oneens is met zichzelf. (Toevallig koos hij de intern consistente cijfers — €2,9M klopt met de "58% besteed"-rekensom — maar dat is geluk, geen transparantie.)

De skill markeerde alle drie, beide waarden gepresenteerd, niets gemiddeld, in een zichtbaar Gemarkeerd-blok. Dit is het duidelijkste resultaat van de hele benchmark, en de reden is belangrijk: tegenstrijdigheden markeren is gedrag, geen woordbudget. Een samenvatting van 160 woorden had alle drie conflicten in één regel elk kunnen markeren. De skill bewaarde ook acht zelfbeperkende nuances die de baseline liet vallen terwijl hij de kop wel behield — een onderzoeksabstract's "nulresultaat mag niet worden geïnterpreteerd als bewijs van veiligheid," een postmortem's afweging over alarmruis — de Regel-6-gevallen "bewaar de omslagnuance".

Waar het gelijk uitkomt, en het confounding-effect dat we niet verbergen

Onze methodologie eist dat de verliezen naast de winsten staan, en deze run heeft echte gelijke standen.

Op drie metrieken scoorden beide armen nul. Toegevoegde claims, vervormde cijfers, attributieverlies — gelijk op 0/0. Bij deze doellengtes is het baseline-model al gedisciplineerd genoeg om geen feiten te verzinnen, cijfers te verhaspelen of sprekers weg te strippen. De skill won daar niet, omdat er niets te winnen viel. Het enige baseline-nuanceverlies ("redelijk stabiel" → "stabiel") is grensgeval en zou redelijkerwijs op nul gescoord kunnen worden, wat ook die metriek gelijk zou trekken. En bij D09 — het document gebouwd om modaliteit te stresstesten — behield de baseline zelf de vlaggenschip-nuance "doel, geen belofte." Het uithangbord-voordeel van de skill kwam niet tot uiting op het document dat er specifiek voor gebouwd was.

En de winst op weglatingen leunt deels op langere output. Dit is het confounding-effect, en het is structureel, niet cosmetisch: de outputs van de skill waren zo'n 1,7× langer dan die van de baseline (gemiddelde compressie 2,6× vs 4,5×), en hij overschreed de woorddoelstelling bij alle zes documenten. Het grootste deel van de overschrijding is het Gemarkeerd + Weggelaten-apparaat dat na een bijna-doel-lange samenvatting wordt toegevoegd — maar bij D04 liep ook de hoofdtekst van de skill lang, expliciet met een beroep op getrouwheid, en dat scoorden we als een lengtemisser in plaats van het achteraf goed te praten. De eerlijke lezing: een deel van de "8 minder weglatingen" is de skill die meer woorden gebruikt. Waar hij op gelijke voet wint is (a) het markeren van tegenstrijdigheden, los van lengte, en (b) D09, waar de baseline op lengte bleef maar toch drie nuances liet vallen die de skill behield.

Volledige runs over 11 documenten zijn nodig voordat we kunnen generaliseren. Deze subset is gunstig voor de skill, maar geen schone sweep.

SKILLPROOF PACK

summary-discipline is gratis en MIT. Elk cijfer hierboven, plus scores per document en de bevroren ground-truth-sheets, staat in de publieke repo — negatieve resultaten inbegrepen.

Haal summary-discipline op GitHub

Installatie

git clone https://github.com/Skillproofdev/summary-discipline ~/.claude/skills/summary-discipline

Herstart Claude Code. Hij triggert op "vat samen", "tl;dr", "kernpunten van", vergaderverslagen en compressie van lange documenten — en blijft weg bij creatief herschrijven, vertalen en toonwijzigingen. Hij hoort bij onze discipline-reeks: token-discipline verlaagt wat een taak kost, research-discipline verlaagt wat research fout heeft, en deze verlaagt wat een samenvatting stilletjes verandert.

GRATIS STARTERPACK

Wil je onze best scorende skills plus de installchecklist die we voor elke test draaien? We mailen je de gratis starterpack.

Haal de gratis starterpack

FAQ

Maakt dit samenvattingen langer? Op deze subset, ja — ongeveer 1,7× langer dan de baseline, grotendeels het Gemarkeerd-blok. Dat is het confounding-effect dat we hierboven noemen, geen feature. De ene lengte-onafhankelijke winst is het markeren van tegenstrijdigheden: de skill kan een conflict in één regel tonen zonder een groter woordbudget nodig te hebben.

Hoe wordt een "kritieke weglating" gedefinieerd zonder dat het achteraf verzonnen is? Vooraf vastleggen. Voordat er een samenvatting bestaat, bevriezen we de kernfeitenlijst van elk document — beslissingen, kopcijfers met referent, omslagnuances. Toetsing gebeurt tegen dat sheet, dus "je liet een kritiek feit vallen" kan niet achteraf verzonnen worden om een van beide armen te bevoordelen.

Vervangt dit een mens die de bron leest? Nee. Het voorkomt stille vervorming en legt tegenstrijdigheden bloot die de baseline verborg, maar het is benchmarked op 6 van de 11 documenten en staat gelijk met de baseline op drie metrieken. Als een beslissing duur is om fout te doen, maken de citaatankers van de skill het verifiëren van dragende claims een kwestie van seconden — gebruik ze.

Waarom maar zes documenten? Omdat elke claim in elke output handmatig getoetst is aan een bevroren ground-truth-sheet. We geven de voorkeur aan een kleine benchmark met echte ground truth boven een grote die door een ongeverifieerde rechter wordt beoordeeld. De overige vijf documenten, en de volledige scores per document, staan gepubliceerd in het repo-verdict.

★ 9.6/10 × 3

Het gratis starterspakket

De 3 skills met onze hoogste testscores plus de installatiechecklist — de setup die wij op een verse machine zouden zetten. Gratis, per e-mail.

Eén e-mail met het pakket + een korte wekelijkse digest met nieuwe testresultaten. Uitschrijven kan altijd.