
Podsumowania Claude, które po cichu nie przerabiają faktów
Poproś Claude o podsumowanie dokumentu, a dostaniesz czysty, pewny siebie skrót. Czego nie widać — bo nie czytałeś źródła — to wszystko, co podsumowanie po cichu zmieniło po drodze: „może zmniejszyć ryzyko”, które stało się „zmniejsza ryzyko”, 2,4 mln $, które stało się 2,9 mln $, dwie sprzeczne daty zlane w jedną. Podsumowanie to stratna kompresja cudzych twierdzeń, a jedyną legalną stratą jest pominięcie. Wszystko inne to zniekształcenie, którego czytelnik nie ma jak wychwycić.
Więc to zmierzyliśmy. Efektem jest summary-discipline, nasz najnowszy skill: dziewięć egzekwowalnych reguł wierności, zbenchmarkowanych przed/po względem zamrożonego arkusza stanu faktycznego. Jest darmowy, na licencji MIT: github.com/Skillproofdev/summary-discipline.
Luka w niszy: 174 summaryzatory, zero reguł wierności
Zanim napisaliśmy pierwszą regułę, przeszukaliśmy nasz indeks 16 682 wykrytych skilli. 460 wspomina o streszczaniu; 174 to prawdziwe summaryzatory. Każdy pojedynczy optymalizuje to samo: strukturę i zwięzłość — sekcje, liczbę punktów, action itemy, ton. Zero podaje choć jedną sprawdzalną regułę o relacji między podsumowaniem a jego źródłem: nic dodanego, liczby dosłowne, zastrzeżenia nietknięte, atrybucja zachowana.
To dziwna część, bo akademia mierzy dokładnie te porażki od dekady. FactCC, FRANK, SummaC, AggreFact, FaithBench — cała literatura benchmarków wierności streszczeń z nazwanymi typami błędów. Żaden opublikowany skill niczego z tego nie importuje. summary-discipline to ten brakujący transfer: kategorie błędów z benchmarków halucynacji zamienione na reguły obowiązujące w momencie generowania, które można audytować linijka po linijce.
Dziewięć reguł, każda możliwa do zaudytowania względem źródła
Pełny SKILL.md to dziewięć reguł; te, na których wszystko się trzyma:
- Żadne twierdzenie bez zdania źródłowego. Jeśli nie potrafisz wskazać fragmentu, który uprawnia dane zdanie, nie trafia ono do podsumowania. Naprawdę potrzebny kontekst zostaje oznaczony jako
[context, not in source]. - Liczby są kopiowane, nigdy wyprowadzane na nowo. Wartość, jednostka i odniesienie dosłownie — bez zaokrąglania, uśredniania czy cichej arytmetyki. „4,2 mln $ przychodu w Q3, wzrost 12% r/r”, nigdy „mniej więcej 4 mln $”.
- Zachowaj zastrzeżenie. „Może zmniejszyć ryzyko” nigdy nie staje się „zmniejsza ryzyko”; „potwierdzone” nigdy nie miękczy się do „może”. Modalność to ostatnie słowo, które wolno ci wyciąć.
- Zachowaj atrybucję. „CEO twierdzi, że marże się poprawiły” ≠ „marże się poprawiły”. Nigdy nie zlewaj dwóch mówców w jeden konsensus, którego nikt nie wyraził.
- Flaguj sprzeczności; nigdy nie rozwiązuj ich po cichu. Dwie sprzeczne liczby zostają dwiema liczbami, w widocznym bloku Flagged. Podsumowanie nie wybiera zwycięzcy ani nie uśrednia.
Do tego zadeklarowana umowa kompresji (~4800 słów → ~200 słów · kolejność ważności), reguły pominięć chroniące decyzje, terminy, ryzyka i zastrzeżenia odwracające sens przy dowolnej długości, kotwice cytatów przy nośnych twierdzeniach i samoaudyt twierdzenie po twierdzeniu przed dostarczeniem.
Benchmark: każde twierdzenie zaudytowane względem zamrożonego arkusza
Oto uczciwy zakres, podany od razu. Korpus to 11 dokumentów, po jednym na kategorię stresową. Te liczby pochodzą z z góry zarejestrowanego podzbioru 6 dokumentów — badanie kliniczne D02 cardiotide, przegląd kwartalny D04, postmortem incydentu D05, transkrypt launchu D07, abstrakty badań nad snem D09, memo z podrzuconą sprzecznością D11 — wybranych przez koordynatora przed jakimkolwiek przebiegiem, po jednym na kategorię. Pozostałe pięć jeszcze nie zostało uruchomionych. Traktuj to jako odczyt kierunkowy, nie wynik dla całego korpusu.
Rejestracja z góry ma tu znaczenie: przed wygenerowaniem jakiegokolwiek podsumowania zapisujemy dla każdego dokumentu listę kluczowych faktów, każde zastrzeżone twierdzenie, każde twierdzenie z atrybucją i każdą liczbę z jej odniesieniem. „Krytyczne pominięcie” jest zdefiniowane względem tego zamrożonego arkusza — nie wymyślane po zobaczeniu wyniku. Potem dwa warianty na dokument: baseline (zwykłe „streść to”) i skill (ten sam prompt, najpierw wczytany SKILL.md), ten sam model, ta sama docelowa długość, każdy wynik podzielony na atomy i zaudytowany twierdzenie po twierdzeniu.
| Metryka (suma dla 6 dokumentów) | Baseline | Skill |
|---|---|---|
| Dodane twierdzenia | 0 | 0 |
| Zniekształcone liczby | 0 | 0 |
| Utracone zastrzeżenia (podwyższenia pewności) | 1 | 0 |
| Utracone atrybucje | 0 | 0 |
| Krytyczne pominięcia | 10 | 2 |
| Oflagowane sprzeczności (z 3 podrzuconych) | 0 | 3 |
Gwiazda benchmarku: memo, które nie zgadza się samo ze sobą
D11 to memo o statusie projektu z trzema sprzecznościami podrzuconymi między jego streszczeniem dla zarządu a treścią: budżet 2,4 mln $ vs 2,9 mln $, dwie różne daty przełączenia i 6 vs 8 inżynierów. To dokładnie ten tryb awarii, do którego zbudowano ten skill.
Baseline rozwiązał wszystkie trzy po cichu. Podał jeden budżet, jedną datę przełączenia, jedną liczbę osób — każde jako ustalony fakt, ani razu nie sygnalizując, że memo samo sobie przeczy. Czytelnik tego podsumowania nie ma jak dowiedzieć się, że źródło jest niespójne. (Akurat wybrał liczby wewnętrznie spójne — 2,9 mln $ pasuje do matematyki „wydano 58%” — ale to szczęście, nie ujawnienie.)
Skill oflagował wszystkie trzy, obie wartości przedstawione, żadna nie uśredniona, w widocznym bloku Flagged. To najczystszy wynik w całym benchmarku, a powód jest ważny: flagowanie sprzeczności to zachowanie, nie kwestia limitu słów. 160-słowowe podsumowanie mogło oflagować wszystkie trzy konflikty po jednej linijce każdy. Skill zachował też osiem samoograniczających zastrzeżeń, które baseline porzucił, zachowując nagłówek — „wynik zerowy nie powinien być interpretowany jako dowód bezpieczeństwa” z abstraktu badawczego, kompromis szum-a-alerty z postmortemu — przypadki Reguły 6 „zachowaj zastrzeżenie odwracające sens”.
Gdzie remisuje i czynnik zakłócający, którego nie ukryjemy
Nasza metodologia wymaga pokazywania porażek obok zwycięstw, a ten przebieg ma prawdziwe porażki.
Na trzech metrykach oba warianty uzyskały zero. Dodane twierdzenia, zniekształcone liczby, utracone atrybucje — remis 0/0. Przy tych docelowych długościach model bazowy jest już zdyscyplinowany, jeśli chodzi o niewymyślanie faktów, niepsucie liczb czy nieusuwanie mówców. Skill nie pobił go tam, bo nie było czego bić. Jedyne utracone zastrzeżenie u baseline'u („umiarkowanie stabilny” → „stabilny”) jest na granicy i można by je rozsądnie ocenić na zero, co zremisowałoby też tę metrykę. A przy D07 — dokumencie zbudowanym, żeby stresować modalność — baseline sam z siebie zachował flagowe zastrzeżenie „cel, nie zobowiązanie”. Nagłówkowa przewaga skilla nie zmaterializowała się na dokumencie zaprojektowanym, by ją testować.
A zyski w pominięciach częściowo jadą na dłuższym wyniku. To jest czynnik zakłócający, i jest strukturalny, nie kosmetyczny: wyniki skilla były o około 1,7× dłuższe niż baseline'u (średnia kompresja 2,6× vs 4,5×), i przekroczył docelową liczbę słów we wszystkich sześciu dokumentach. Większość nadwyżki to aparat Flagged + Omitted doklejony po treści podsumowania bliskiej celowi — ale przy D04 skill rozciągnął też samą treść, wyraźnie powołując się na wierność, i policzyliśmy to jako przekroczenie długości, zamiast usprawiedliwiać z perspektywy czasu. Uczciwe odczytanie: kawałek „8 mniej pominięć” to skill wydający więcej słów. Tam, gdzie wygrywa na równych zasadach, to (a) ujawnianie sprzeczności, niezależne od długości, i (b) D09, gdzie baseline zmieścił się w długości, a i tak porzucił trzy zastrzeżenia, które skill zachował.
Pełne przebiegi na 11 dokumentach są potrzebne, zanim będzie można generalizować. Ten podzbiór jest korzystny dla skilla, ale to nie czyste zwycięstwo na całej linii.
PAKIET SKILLPROOF
summary-discipline jest darmowy i na licencji MIT. Każda liczba powyżej, plus wyniki dla każdego dokumentu i zamrożone arkusze stanu faktycznego, jest w publicznym repozytorium — razem z wynikami negatywnymi.
Pobierz summary-discipline na GitHubInstalacja
git clone https://github.com/Skillproofdev/summary-discipline ~/.claude/skills/summary-discipline
Zrestartuj Claude Code. Uruchamia się na „summarize”, „tl;dr”, „key points of”, skróty ze spotkań i kompresję długich dokumentów — i nie wtrąca się przy kreatywnym przepisywaniu, tłumaczeniu i zmianach tonu. Dołącza do naszej serii dyscyplin: token-discipline tnie to, ile zadanie kosztuje, research-discipline tnie to, w czym myli się research, a ten tnie to, co podsumowanie po cichu zmienia.
DARMOWY PAKIET STARTOWY
Chcesz nasze najwyżej oceniane skille plus checklistę instalacyjną, której używamy przed każdym testem? Wyślemy ci mailem darmowy starter pack.
Odbierz darmowy starter packFAQ
Czy to wydłuża podsumowania? Na tym podzbiorze tak — o około 1,7× dłużej niż baseline, głównie przez blok Flagged. To czynnik zakłócający, który oflagowaliśmy powyżej, nie cecha. Jedyne zwycięstwo niezależne od długości to flagowanie sprzeczności: skill potrafi ujawnić konflikt w jednej linijce bez wydawania większego limitu słów.
Jak zdefiniowane jest „krytyczne pominięcie”, żeby nie było oceniane po fakcie? Rejestracja z góry. Zanim powstanie jakiekolwiek podsumowanie, zamrażamy listę kluczowych faktów każdego dokumentu — decyzje, liczby nagłówkowe z odniesieniami, zastrzeżenia odwracające sens. Audyt odbywa się względem tego arkusza, więc „pominąłeś krytyczny fakt” nie da się wymyślić na korzyść żadnego z wariantów.
Czy zastępuje czytanie źródła przez człowieka? Nie. Tnie ciche zniekształcenia i ujawnia sprzeczności, które baseline zakopał, ale jest zbenchmarkowany na 6 z 11 dokumentów i remisuje z baseline'em na trzech metrykach. Jeśli pomyłka przy decyzji dużo kosztuje, kotwice cytatów w skillu sprawiają, że weryfikacja nośnych twierdzeń zajmuje sekundy — użyj ich.
Czemu tylko sześć dokumentów? Bo każde twierdzenie w każdym wyniku było ręcznie zaudytowane względem zamrożonego arkusza stanu faktycznego. Wolimy mały benchmark z prawdziwym stanem faktycznym niż duży, oceniany przez niezweryfikowanego sędziego. Pozostałe pięć dokumentów i pełne wyniki dla każdego dokumentu są opublikowane w werdykcie repozytorium.
★ 9.6/10 × 3
Darmowy pakiet startowy
3 skille z naszymi najwyższymi ocenami z testów plus checklista instalacji — zestaw, który sami wgralibyśmy na świeżą maszynę. Za darmo, na e-mail.