Souhrny od Clauda, které fakta potichu nepřepisují

Souhrny od Clauda, které fakta potichu nepřepisují

Požádejte Clauda o souhrn dokumentu a dostanete čistý, sebejistý výtah. Co nevidíte — protože jste nečetli zdroj — je všechno, co souhrn cestou potichu změnil: „může snížit riziko" se stalo „snižuje riziko", 2,4 milionu dolarů se stalo 2,9 milionu, dvě protichůdná data se sloučila do jednoho. Souhrn je ztrátová komprese cizích tvrzení a jediná legitimní ztráta je vynechání. Všechno ostatní je zkreslení, které čtenář nemá jak odhalit.

Tak jsme to změřili. Výsledkem je summary-discipline, náš nejnovější skill: devět vymahatelných pravidel věrnosti, benchmarkovaných před/po proti zamčenému listu ground truth. Je zdarma pod licencí MIT: github.com/Skillproofdev/summary-discipline.

Mezera v nice: 174 sumarizátorů, nula pravidel věrnosti

Než jsme napsali jediné pravidlo, prošli jsme náš index 16 682 objevených skillů. 460 zmiňuje sumarizaci; 174 jsou skuteční sumarizátoři. Úplně každý optimalizuje totéž: strukturu a stručnost — sekce, počet odrážek, akční body, tón. Nula z nich uvádí jediné ověřitelné pravidlo o vztahu mezi souhrnem a jeho zdrojem: nic přidaného, čísla doslovná, zachovaná zaváhání, zachovaná atribuce.

To je zvláštní část, protože akademie tahle selhání měří už dekádu. FactCC, FRANK, SummaC, AggreFact, FaithBench — celá literatura benchmarků věrnosti sumarizace s pojmenovanými typy chyb. Žádný publikovaný skill z toho nic nepřebírá. summary-discipline je přesně ten chybějící přenos: kategorie chyb z halucinačních benchmarků převedené na pravidla platná při generování, která můžete auditovat řádek po řádku.

Devět pravidel, každé auditovatelné proti zdroji

Celý SKILL.md má devět pravidel; nosná z nich:

  1. Žádné tvrzení bez zdrojové věty. Pokud nemůžete ukázat na pasáž, která větu opravňuje, nejde do souhrnu. Skutečně potřebný kontext se označí [context, not in source].
  2. Čísla se kopírují, nikdy znovu neodvozují. Hodnota, jednotka a referent doslovně — žádné zaokrouhlování, průměrování ani tichá aritmetika. „4,2 mil. $ příjem za Q3, +12 % meziročně", nikdy „zhruba 4 mil. $".
  3. Zachovat zaváhání. „Může snížit riziko" se nikdy nestane „snižuje riziko"; „potvrzeno" nikdy nezměkne na „možná". Modalita je poslední slovo, které smíte škrtnout.
  4. Zachovat atribuci. „CEO tvrdí, že marže se zlepšily" ≠ „marže se zlepšily". Nikdy neslučovat dva mluvčí do jednoho konsenzu, který nikdo nevyslovil.
  5. Označit rozpory; nikdy je potichu neřešit. Dvě protichůdná čísla zůstávají dvě čísla, ve viditelném bloku Označeno. Souhrn si nevybírá vítěze ani je nezprůměruje.

Plus deklarovaná komprese (~4 800 slov → ~200 slov · v pořadí důležitosti), pravidla vynechávání, která chrání rozhodnutí, termíny, rizika a obracející výhrady na jakékoli délce, kotvy citací u nosných tvrzení a vlastní audit tvrzení po tvrzení před dodáním.

Benchmark: každé tvrzení ověřené proti zamčenému listu

Poctivý rozsah, rovnou na začátek. Korpus má 11 dokumentů, jeden na každou stresovou kategorii. Tahle čísla jsou z předem zapsané podmnožiny 6 dokumentů — D02 studie kardiotidu, D04 čtvrtletní přehled, D05 postmortem incidentu, D07 přepis launche, D09 abstrakty výzkumu spánku, D11 nastražené memo s rozpory — vybraných koordinátorem před jakýmkoli během, jeden na kategorii. Zbylých pět zatím neběželo. Berte to jako orientační čtení, ne výsledek na celém korpusu.

Předregistrace tu hraje roli: než vznikne jakýkoli souhrn, zapíšeme pro každý dokument seznam klíčových faktů, každé tvrzení se zaváháním, každé přiřazené tvrzení a každé číslo s jeho referentem. „Kritické vynechání" je definované proti tomuhle zamčenému listu — ne vymyšlené po tom, co uvidíme výstup. Pak dvě větve na dokument: baseline (obyčejné „shrň to") a skill (stejný promt, nejdřív načtený SKILL.md), stejný model, stejná cílová délka, každý výstup rozebraný a auditovaný tvrzení po tvrzení.

Metrika (součty za 6 dokumentů) Baseline Skill
Přidaná tvrzení 0 0
Zkreslená čísla 0 0
Ztráta zaváhání (posílení jistoty) 1 0
Ztráta atribuce 0 0
Kritická vynechání 10 2
Označené rozpory (ze 3 nastražených) 0 3

Hvězdný případ: memo, které si samo odporuje

D11 je memo o stavu projektu se třemi rozpory nastraženými mezi shrnutím a jeho tělem: rozpočet 2,4 mil. $ vs. 2,9 mil. $, dvě různá data přechodu a 6 vs. 8 inženýrů. Tohle je přesně selhání, kvůli kterému skill vznikl.

Baseline potichu vyřešila všechny tři. Uvedla jeden rozpočet, jedno datum přechodu, jeden počet lidí — každé jako ustálený fakt, aniž by jednou naznačila, že si zdroj sám odporuje. Čtenář takového souhrnu nemá šanci poznat, že se zdroj neshoduje sám se sebou. (Náhodou vybrala vnitřně konzistentní čísla — 2,9 mil. $ sedí s matematikou „utraceno 58 %" —, ale to je štěstí, ne transparentnost.)

Skill označil všechny tři, obě hodnoty uvedené, žádná zprůměrovaná, ve viditelném bloku Označeno. Tohle je nejčistší výsledek celého benchmarku, a důvod je důležitý: označování rozporů je chování, ne rozpočet slov. 160slovný souhrn mohl označit všechny tři konflikty v jednom řádku každý. Skill navíc zachoval osm sebeomezujících výhrad, které baseline zahodila, a přitom si udržel titulek — výhradu výzkumného abstraktu „nulový výsledek by neměl být interpretován jako důkaz bezpečnosti", kompromis mezi šumem upozornění v postmortemu — případy pravidla 6 „zachovat obracející výhradu".

Kde remizuje a jaký confound nebudeme skrývat

Naše metodika vyžaduje ztráty vedle výher, a tenhle běh má reálné.

U tří metrik skórovaly obě větve nulu. Přidaná tvrzení, zkreslená čísla, ztráty atribuce — remíza 0/0. Při těchhle cílových délkách je baseline model už disciplinovaný v tom, že si nevymýšlí fakta, nekomolí čísla a nestrhává mluvčí. Skill tam nevyhrál, protože nebylo co porazit. Osamocená ztráta zaváhání u baseline („mírně stabilní" → „stabilní") je hraniční a dala by se rozumně skórovat jako nula, což by remízu udělalo i z téhle metriky. A na D09 — dokumentu postaveném na stres modality — baseline sama zachovala vlajkové zaváhání „cíl, ne závazek". Hlavní výhoda skillu se na dokumentu navrženém k jejímu otestování neprojevila.

A výhoda ve vynechávkách se částečně veze na delším výstupu. Tohle je confound a je strukturální, ne kosmetický: výstupy skillu byly zhruba 1,7× delší než baseline (průměrná komprese 2,6× vs. 4,5×) a překročil cílový počet slov na všech šesti dokumentech. Většina přesahu je aparát Označeno + Vynecháno připojený za souhrn na cílové délce — ale u D04 skill nechal běžet dlouhé i samotné tělo, výslovně kvůli věrnosti, a to jsme skórovali jako minutí délky, ne omluvili zpětně. Poctivé čtení: kus těch „8 méně vynechání" je skill utrácející víc slov. Kde vyhrává za rovných podmínek, je (a) zveřejnění rozporu nezávislé na délce a (b) D09, kde byla baseline v limitu délky, a přesto vypustila tři výhrady, které skill zachoval.

Než to zobecníme, potřebujeme celý běh na všech 11 dokumentech. Tahle podmnožina je pro skill příznivá, ale není to čisté vítězství.

SKILLPROOF PACK

summary-discipline je zdarma a MIT. Každé číslo výše, plus skóre po dokumentech a zamčené listy ground truth, je ve veřejném repozitáři — včetně negativních výsledků.

Získat summary-discipline na GitHubu

Instalace

git clone https://github.com/Skillproofdev/summary-discipline ~/.claude/skills/summary-discipline

Restartujte Claude Code. Spouští se na „shrň", „tl;dr", „klíčové body z", zápisy z porad a kompresi dlouhých dokumentů — a nezasahuje do kreativního přepisování, překladu a změn tónu. Patří do naší disciplinární série: token-discipline snižuje, co úkol stojí, research-discipline snižuje, co si výzkum splete, a tenhle snižuje, co souhrn potichu změní.

FREE STARTER PACK

Chcete naše nejlépe hodnocené skilly plus instalační checklist, který používáme před každým testem? Pošleme vám ho e-mailem zdarma.

Získat free starter pack

FAQ

Dělá to souhrny delší? Na téhle podmnožině ano — zhruba 1,7× delší než baseline, hlavně kvůli bloku Označeno. To je confound, který přiznáváme výše, ne funkce. Jedna výhoda nezávislá na délce je označování rozporů: skill dokáže odhalit konflikt v jednom řádku, aniž by utratil větší rozpočet slov.

Jak je definované „kritické vynechání", aby se nedalo vymyslet dodatečně? Předregistrací. Než souhrn vznikne, zamkneme seznam klíčových faktů dokumentu — rozhodnutí, hlavní čísla s referenty, obracející výhrady. Audit probíhá proti tomuhle listu, takže „vynechal jsi kritický fakt" nejde vymyslet ve prospěch žádné z větví.

Nahrazuje to člověka, který čte zdroj? Ne. Odstraňuje tiché zkreslení a odhaluje rozpory, které baseline zahodila, ale je benchmarkovaný na 6 z 11 dokumentů a u tří metrik remizuje s baseline. Pokud je rozhodnutí drahé na chybu, kotvy citací u skillu udělají z ověření nosných tvrzení otázku vteřin — použijte je.

Proč jen šest dokumentů? Protože každé tvrzení v každém výstupu bylo ručně ověřené proti zamčenému listu ground truth. Dáváme přednost malému benchmarku se skutečným ground truth před velkým, hodnoceným neověřeným soudcem. Zbývajících pět dokumentů a plné skóre po dokumentech je zveřejněné ve verdiktu repozitáře.

★ 9.6/10 × 3

Startovací balíček zdarma

3 skills s nejvyšším skóre z našich testů plus instalační checklist — sestava, kterou bychom nasadili na čistý stroj. Zdarma, e-mailem.

Jeden e-mail s balíčkem + krátký týdenní přehled nových výsledků testů. Odhlásit se můžete kdykoli.