Halucynacje AI Claude: zmierzyliśmy je i ścięliśmy o 59%

Halucynacje AI Claude: zmierzyliśmy je i ścięliśmy o 59%

Zadaj Claude pytanie badawcze, a dostaniesz coś niebezpiecznego: pewną siebie, dobrze napisaną odpowiedź. Czy jest prawdziwa, to zupełnie inna sprawa i nie da się tego ocenić samym czytaniem. Na co dzień prowadzimy katalog, w którym testujemy skille Claude, więc postanowiliśmy zmierzyć to porządnie: ile twierdzeń faktograficznych w typowej odpowiedzi researchowej jest po prostu błędnych — i ile z nich przetrwa, gdy zmusimy model do przestrzegania reguł weryfikacji?

Efektem jest research-discipline, nasz trzeci skill i pierwszy w tej niszy, który wychodzi ze zmierzonym benchmarkiem przed/po: 13,0% twierdzeń w baseline było błędnych lub nieaktualnych; ze skillem — 5,4%. Cięcie o 59%. Jest darmowy, na licencji MIT: github.com/Skillproofdev/research-discipline.

Luka: pipeline'y nie weryfikują, weryfikatorzy nie robią researchu

Zanim napisaliśmy pierwszą linijkę, przejrzeliśmy 15 opublikowanych skilli do researchu i fact-checkingu, plus nasz własny indeks 16 682 wykrytych skilli. Krajobraz dzieli się wyraźnie na dwa obozy, które nigdy się nie przecinają.

Pipeline'y deep-research — te popularne, nawet do 1,6 tys. gwiazdek — orkiestrują równoległe wyszukiwania i generują długie raporty. Czytasz ich zestawy reguł i widzisz ergonomię workflow, nie epistemologię: brak cytowań przy każdym twierdzeniu, brak reguł jakości źródeł, brak wymogu sprawdzenia czegokolwiek dwa razy. Audytorzy fact-checkingu — głównie narzędzia z dziennikarstwa i akademii, o dwa rzędy wielkości mniej popularne — faktycznie egzekwują werdykty i cytowania, ale tylko post factum, na gotowym szkicu, który ktoś im podaje.

Nikt nie oferuje tego środka: lekkiej dyscypliny, która pilnuje twierdzeń agenta w trakcie researchu, niezależnie od tego, czy odpowiedź ma trzy akapity, czy trzydzieści. I co znamienne, nikt w żadnym z obozów nie publikuje pomiarów. Najgłośniejszy konkurent twierdzi, że „przewyższa OpenAI, Gemini i Claude Desktop" bez ani jednej liczby na poparcie; inny podaje „95%+ trafności" jako cel, którego nigdy nie zmierzył. Ta nisza żyje na czuja.

Osiem reguł, trzy z nich nowatorskie

Skill to ~1500 tokenów egzekwowalnych reguł (pełny SKILL.md). Znajome elementy: każde twierdzenie faktograficzne ma przypis prowadzący do datowanej listy źródeł; twierdzenia bez pokrycia dostają wyraźną flagę [unverified] zamiast pewnego siebie sformułowania; źródła są podzielone na warstwy, a content farmy są odrzucane z automatu. Elementy, których nikt inny nie egzekwuje:

  1. Pamięć to hipoteza. Przy wszystkim, co zmienne — wersje, ceny, cokolwiek „aktualnego" — przywołanie z danych treningowych to trop do zweryfikowania, nigdy dowód. Najpierw ustal datę, poszukaj, dopiero potem twierdź.
  2. Dwa niezależne źródła dla faktów kluczowych dla wniosku. Niezależność ma tu definicję: dwa artykuły przepisujące ten sam komunikat prasowy liczą się jako jedno źródło. Jedyną wcześniejszą implementację tej kontroli, jaką znaleźliśmy, był gist z jedną gwiazdką.
  3. Liczby są cytowane, nie wymyślane. Dosłowna wartość, jednostka i data; gdy źródła się różnią, podajemy zakres z obydwoma cytowaniami — nigdy po cichu uśrednionej wartości.

Do tego dochodzi przebieg adwersarialny z mechanizmem wymuszającym, zapożyczonym z najlepszego wcześniejszego rozwiązania, jakie znaleźliśmy: jedno wyszukanie przeciwieństwa własnego wniosku, znalezienie co najmniej dwóch słabości we własnym szkicu albo ponowne sprawdzenie najbardziej kluczowych twierdzeń.

Benchmark: każde twierdzenie ocenione względem żywych źródeł

Sześć pytań badawczych z obiektywnie sprawdzalnymi odpowiedziami, wybranych przed jakimkolwiek przebiegiem: sprawdzenie wersji, porównanie cen, zestawienie faktów, zapytanie o repozytorium GitHub i dwie pułapki. Każde pytanie uruchomiono dwa razy — raz na gołym agencie Claude Sonnet, raz na agencie, który najpierw przeczytał skill, oba z pełnym dostępem do sieci. Następnie niezależni agenci-weryfikatorzy ustalili stan faktyczny na podstawie żywych źródeł pierwotnych i ocenili wszystkie 110 twierdzeń faktograficznych w 12 odpowiedziach, jedno po drugim.

Pytanie Błędne/nieaktualne w baseline Ze skillem
Katalog modeli Claude (pułapka nieaktualności) 3 0
Gotowość produkcyjna Bun (pułapka realnego wydarzenia) 1 1
Tabela faktów o Deno 1 0
Fakty o repozytorium GitHub 1 0
Historia wydań Astro 1 1
Porównanie cen e-maili 0 1
Razem 7 z 54 (13,0%) 3 z 56 (5,4%)

To właśnie te dwie pułapki pokazały, po co ten skill istnieje.

Pułapka nieaktualności. Poproszony o aktualny katalog modeli Claude, agent bazowy odpowiedział na podstawie zapamiętanego odniesienia, bez ani jednego sprawdzenia na żywo — trzy liczby dotyczące okna kontekstu wyszły błędne. Reguła 1 u agenta ze skillem wymusiła pobranie aktualnej strony dokumentacji; werdykt weryfikatora: „zgadza się z żywą dokumentacją co do każdej pojedynczej liczby". Ten sam model, to samo pytanie, te same dostępne narzędzia. Jedyną różnicą była reguła mówiąca, że pamięć nie liczy się jako dowód.

Pułapka realnego wydarzenia. Zapytany, czy Bun jest gotowy produkcyjnie w 2026 roku, agent bazowy natknął się na fakt, że Anthropic przejął Bun w grudniu 2025 roku — i odrzucił to jako niepotwierdzoną plotkę SEO. Jego źródłami były blogi zewnętrzne; nigdy nie otworzył bun.com ani anthropic.com, gdzie znajdują się oba pierwotne ogłoszenia. Agent ze skillem zacytował oba, a weryfikator potwierdził je na żywo. Przeczytaj to jeszcze raz: jedyna flaga niepewności agenta bazowego w całym benchmarku trafiła w prawdziwe wydarzenie. Sceptycyzm bez weryfikacji to po prostu inny sposób na bycie w błędzie.

Gdzie skill przegrał — i tak to publikujemy

Nasza metodologia wymaga pokazywania porażek obok zwycięstw, a były dwie.

Przy pytaniu o ceny e-maili baseline faktycznie pokonał skill: wycenił wszystkie trzy plany Postmark i znalazł najtańszy, podczas gdy agent ze skillem wycenił jeden plan, nazwał go „najtańszą ścieżką" i pomylił się o 2,50 $ miesięcznie. Dyscyplina cytowań nie robi za ciebie arytmetyki — niepełne wyliczenie to porażka researchu, której reguły nie wyłapują. A przy pytaniu o Bun agent ze skillem powtórzył błędny numer wersji prawdziwego wydania podany przez serwis technologiczny, zamiast zweryfikować go w release notes producenta — źródło warstwy 2. obdarzone zaufaniem o oczko za dużym.

Uczciwie mówiąc: dyscyplina kosztuje ok. +10% tokenów — pobrania na żywo i przebieg adwersarialny nie są za darmo. A wśród wszystkich dwunastu odpowiedzi ~8 proaktywnych flag [unverified]/[single-source] skillu zostało ocenionych jako zasadne, co samo w sobie jest wynikiem: skill nie tylko tnie błędne twierdzenia, ale też mówi, które z tych, które przetrwały, warto sprawdzić jeszcze raz.

PAKIET SKILLPROOF

research-discipline jest darmowy. Jeśli chcesz pełne ustawienie efektywności wokół niego — okrojony CLAUDE.md, audyt MCP i cztery przetestowane skille skonfigurowane z góry — to jest Optimizer Pack.

Odbierz Optimizer Pack — 10 $

Instalacja

git clone https://github.com/Skillproofdev/research-discipline ~/.claude/skills/research-discipline

Zrestartuj Claude Code. Skill uruchamia się na pytania badawcze, „what's the latest", porównania i prośby o fact-checking — i nie wtrąca się przy kodowaniu, opiniach i pracy kreatywnej. Dołącza do token-discipline w naszej serii dyscyplin: tamten tnie to, ile research kosztuje, ten tnie to, w czym się myli.

DARMOWY PAKIET STARTOWY

Chcesz nasze najwyżej oceniane skille plus checklistę instalacyjną, której używamy przed każdym testem? Wyślemy ci mailem darmowy starter pack.

Odbierz darmowy starter pack

FAQ

Czy to zastępuje wbudowany deep research Claude? Nie — uzupełnia go. Wbudowane funkcje researchu to generatory raportów; to jest warstwa dyscypliny, która działa przy każdej odpowiedzi o charakterze badawczym, także krótkich, i da się ją zweryfikować: wszystkie osiem reguł mieści się na jednym ekranie.

Czy Claude po prostu nie odmówi odpowiedzi, gdy nie może czegoś zweryfikować? Skill wyraźnie tego zabrania: skąpe dowody oznaczają odpowiedź z flagami, a nie wzruszenie ramion. „Nie udało mi się tego potwierdzić" przy konkretnym twierdzeniu jest bardziej użyteczne niż fałszywa pewność albo odmowa.

Czemu tylko sześć pytań? Bo każde twierdzenie zweryfikowaliśmy ręcznie względem żywych źródeł pierwotnych — 110 twierdzeń w 12 odpowiedziach, każde z możliwym do sprawdzenia werdyktem. Wolimy mały benchmark z prawdziwym stanem faktycznym niż duży, oceniany przez niezweryfikowanego sędziego. Zestaw pytań i werdykty dla każdego twierdzenia są w README repozytorium.

Czy 5,4% to wciąż za dużo? Tak. Skill tnie liczbę błędnych twierdzeń o ponad połowę, ale nie czyni Claude nieomylnym, a dwa pozostałe błędy z naszego własnego benchmarku są udokumentowane powyżej. Jeśli pomyłka przy jakiejś decyzji dużo kosztuje, zweryfikuj kluczowe fakty samodzielnie — cytowania skillu sprawiają, że zajmuje to minuty, nie godziny.

★ 9.6/10 × 3

Darmowy pakiet startowy

3 skille z naszymi najwyższymi ocenami z testów plus checklista instalacji — zestaw, który sami wgralibyśmy na świeżą maszynę. Za darmo, na e-mail.

Jeden e-mail z pakietem + krótki cotygodniowy przegląd nowych wyników testów. Wypiszesz się, kiedy chcesz.