Claude-sammendrag som ikke stille omskriver fakta

Claude-sammendrag som ikke stille omskriver fakta

Be Claude oppsummere et dokument, og du får et rent, selvsikkert sammendrag. Det du ikke kan se — fordi du ikke leste kilden — er alt sammendraget stille endret på veien ned: en «kan redusere risiko» som ble til «reduserer risiko», en $2,4 mill. som ble til $2,9 mill., to motstridende datoer slått sammen til én. Et sammendrag er tapsbringende komprimering av andres påstander, og det eneste legitime tapet er utelatelse. Alt annet er forvrengning leseren ikke har noen måte å oppdage.

Så vi målte det. Resultatet er summary-discipline, vår nyeste skill: ni håndhevbare troskapsregler, benchmarket før/etter mot et fastlåst fasit-ark. Den er gratis og MIT-lisensiert: github.com/Skillproofdev/summary-discipline.

Nisje-gapet: 174 oppsummerere, null troskapsregler

Før vi skrev en eneste regel søkte vi i vår indeks av 16 682 oppdagede skills. 460 nevner oppsummering; 174 er ekte oppsummerere. Hver eneste én optimerer det samme: struktur og korthet — seksjoner, antall kulepunkter, handlingspunkter, tone. Null stiller opp en eneste sjekkbar regel om forholdet mellom sammendraget og kilden dets: ingenting lagt til, tall ordrett, forbehold intakte, kildehenvisning bevart.

Det er det rare, for akademia har målt nøyaktig disse feilene i et tiår. FactCC, FRANK, SummaC, AggreFact, FaithBench — en hel litteratur av troskaps-benchmarker for oppsummering med navngitte feiltyper. Ingen publisert skill importerer noe av det. summary-discipline er den manglende overføringen: hallusinasjons-benchmarkens feilkategorier gjort om til genereringstids-regler du kan revidere linje for linje.

Ni regler, hver revidérbar mot kilden

Hele SKILL.md er ni regler; de bærende:

  1. Ingen påstand uten en kildesetning. Kan du ikke peke på passasjen som lisensierer en setning, går den ikke inn. Kontekst som er genuint nødvendig, merkes [context, not in source].
  2. Tall kopieres, aldri utledes på nytt. Verdi, enhet og referent ordrett — ingen avrunding, gjennomsnitt eller stille aritmetikk. «$4,2 mill. Q3-inntekt, opp 12 % fra i fjor», aldri «rundt $4 mill.».
  3. Bevar forbeholdet. «Kan redusere risiko» blir aldri til «reduserer risiko»; «bekreftet» mykes aldri til «kanskje». Modaliteten er det siste du får lov til å kutte.
  4. Bevar kildehenvisningen. «Toppsjefen hevder marginene bedret seg» ≠ «marginene bedret seg». Slå aldri sammen to talere til én konsensus ingen faktisk uttrykte.
  5. Flagg motsigelser; løs dem aldri stille. To motstridende tall forblir to tall, i en synlig Flagget-blokk. Sammendraget velger ikke en vinner eller lager et gjennomsnitt.

Pluss en deklarert komprimeringskontrakt (~4 800 ord → ~200 ord · viktighetsrekkefølge), utelatelsesregler som beskytter beslutninger, frister, risikoer og reverserende forbehold uansett lengde, sitatanker på bærende påstander, og en påstand-for-påstand-egenrevisjon før levering.

Benchmarken: hver påstand revidert mot et fastlåst ark

Her er det ærlige omfanget, sagt rett ut med en gang. Korpuset er 11 dokumenter, ett per stresskategori. Disse tallene er fra et forhåndsregistrert 6-dokuments-utvalg — D02 cardiotide-studien, D04 kvartalsgjennomgangen, D05 hendelses-etterrapporten, D07 lanseringsutskriften, D09 søvnforskning-sammendragene, D11 memoet med plantet motsigelse — valgt av koordinatoren før noen kjøring, ett per kategori. De andre fem er ikke kjørt ennå. Behandle dette som en retningsgivende lesning, ikke det fullstendige korpus-resultatet.

Forhåndsregistrering betyr noe her: før noe sammendrag genereres, registrerer vi for hvert dokument nøkkelfakta-listen, hver forbeholdte påstand, hver kildehenvist påstand, og hvert tall med referenten sin. En «kritisk utelatelse» er definert mot det fastlåste arket — ikke oppfunnet etter at resultatet er sett. Deretter to armer per dokument: baseline (rent «oppsummer dette») og skill (samme prompt, SKILL.md lastet først), samme modell, samme mållengde, hvert resultat atomisert og revidert påstand for påstand.

Metrikk (6-dokument-totaler) Baseline Skill
Tilføyde påstander 0 0
Forvrengte tall 0 0
Forbehold-fjerninger (sikkerhetsoppgraderinger) 1 0
Kildehenvisningstap 0 0
Kritiske utelatelser 10 2
Motsigelser flagget (av 3 plantede) 0 3

Stjerne-caset: et memo som motsier seg selv

D11 er et prosjektstatus-memo med tre motsigelser plantet mellom sammendraget og brødteksten: et budsjett på $2,4 mill. mot $2,9 mill., to forskjellige overgangsdatoer, og 6 mot 8 ingeniører. Dette er nøyaktig den feilmåten skillen ble bygget for.

Baseline løste alle tre stille. Den oppga ett budsjett, én overgangsdato, én bemanning — hver som fastslått fakta, uten et eneste signal om at memoet motsa seg selv. En leser av det sammendraget har ingen måte å vite at kilden er uenig med seg selv. (Den tilfeldigvis valgte de internt konsistente tallene — $2,9 mill. matcher «58 % brukt»-regnestykket — men det er flaks, ikke transparens.)

Skillen flagget alle tre, begge verdiene presentert, ingen gjennomsnitt tatt, i en synlig Flagget-blokk. Dette er det reneste resultatet i hele benchmarken, og grunnen betyr noe: å flagge motsigelser er en oppførsel, ikke et ordbudsjett. Et sammendrag på 160 ord kunne ha flagget alle tre konfliktene i én linje hver. Skillen bevarte også åtte selvbegrensende forbehold baseline droppet mens den beholdt overskriften — et forskningssammendrags «et nullresultat bør ikke tolkes som bevis på sikkerhet», en etterrapports avveining om varslingsstøy — Regel 6s «behold det reverserende forbeholdet»-tilfellene.

Der det er uavgjort, og forstyrrelsen vi ikke skjuler

Vår metodikk krever at tapene vises ved siden av seirene, og denne kjøringen har ekte tap.

På tre metrikker scoret begge armer null. Tilføyde påstander, forvrengte tall, kildehenvisningstap — uavgjort på 0/0. Ved disse mållengdene er baseline-modellen allerede disiplinert nok til ikke å finne opp fakta, mishandle tall eller fjerne talere. Skillen slo den ikke der, fordi det ikke var noe å slå. Den ene baseline-forbehold-fjerningen («moderat stabil» → «stabil») er på vippen og kunne rimelig vært scoret som null, noe som ville gitt uavgjort på den metrikken også. Og på D07 — dokumentet bygget for å stresse modalitet — beholdt baseline selv den flaggskip-aktige «mål, ikke et løfte»-forbeholdet. Skillens hovedfortrinn viste seg ikke på dokumentet designet for å teste det.

Og utelatelsesgevinstene rir delvis på lengre resultat. Dette er forstyrrelsen, og den er strukturell, ikke kosmetisk: skillens resultater var omtrent 1,7× lengre enn baselinens (snitt-komprimering 2,6× mot 4,5×), og den overskred ordmålet på alle seks dokumenter. Mesteparten av overskridelsen er Flagget + Utelatt-apparatet lagt til etter en nær-mål-sammendrag-kropp — men på D04 kjørte skillen også selve kroppen lang, eksplisitt med henvisning til troskap, og vi scoret det som en lengdebom heller enn å bortforklare det i ettertid. Den ærlige lesningen: en del av de «8 færre utelatelsene» er skillen som bruker flere ord. Der den vinner på likt grunnlag er (a) motsigelses-avsløring, uavhengig av lengde, og (b) D09, der baseline var innenfor lengden men fortsatt droppet tre forbehold skillen beholdt.

Fullstendige 11-dokument-kjøringer trengs før man generaliserer. Dette utvalget er gunstig for skillen, men ikke en ren seier over hele linjen.

SKILLPROOF-PAKKE

summary-discipline er gratis og MIT. Hvert tall over, pluss scorer per dokument og de fastlåste fasit-arkene, er i det offentlige repoet — negative resultater inkludert.

Hent summary-discipline på GitHub

Installasjon

git clone https://github.com/Skillproofdev/summary-discipline ~/.claude/skills/summary-discipline

Start Claude Code på nytt. Den trigger på «oppsummer», «tl;dr», «hovedpunkter i», møtereferater, og komprimering av lange dokumenter — og holder seg unna kreativ omskriving, oversettelse og tone-endringer. Den inngår i vår disiplin-serie: token-discipline kutter hva en oppgave koster, research-discipline kutter hva research bommer på, og denne kutter hva et sammendrag stille endrer.

GRATIS STARTPAKKE

Vil du ha våre høyest scorede skills pluss installasjonssjekklisten vi kjører før hver test? Vi sender deg den gratis startpakken på e-post.

Få den gratis startpakken

Ofte stilte spørsmål

Gjør dette sammendragene lengre? På dette utvalget, ja — omtrent 1,7× lengre enn baseline, mest på grunn av Flagget-blokken. Det er forstyrrelsen vi flagger over, ikke en funksjon. Den ene lengdeuavhengige seieren er motsigelses-flagging: skillen kan avsløre en konflikt i én linje uten å bruke et større ordbudsjett.

Hvordan defineres en «kritisk utelatelse» så den ikke oppfinnes i ettertid? Forhåndsregistrering. Før noe sammendrag finnes, fryser vi hvert dokuments nøkkelfakta-liste — beslutninger, overskriftstall med referenter, reverserende forbehold. Revisjonen skjer mot det arket, så «du droppet et kritisk faktum» kan ikke oppfinnes til fordel for noen av armene.

Erstatter den at et menneske leser kilden? Nei. Den kutter stille forvrengning og avslører motsigelser baseline begravde, men den er benchmarket på 6 av 11 dokumenter og uavgjort med baseline på tre metrikker. Hvis en beslutning er kostbar å ta feil, gjør skillens sitatanker det å verifisere de bærende påstandene et spørsmål om sekunder — bruk dem.

Hvorfor bare seks dokumenter? Fordi hver påstand i hvert resultat ble håndrevidert mot et fastlåst fasit-ark. Vi foretrekker en liten benchmark der fasiten er ekte, fremfor en stor scoret av en uverifisert dommer. De resterende fem dokumentene, og de fullstendige scorene per dokument, er publisert i repo-vurderingen.

★ 9.6/10 × 3

Den gratis startpakken

De 3 skillsene med våre høyeste testscorer pluss installasjonssjekklisten — oppsettet vi selv ville lagt på en fersk maskin. Gratis, på e-post.

Én e-post med pakken + en kort ukentlig oppsummering av nye testresultater. Meld deg av når du vil.