
Vi benchmarket Claudes AI-hallusinasjoner — kuttet 59 %
Still Claude et research-spørsmål, og du får noe farlig: et selvsikkert, velskrevet svar. Om det er sant, er en helt annen sak — og det ser du ikke bare ved å lese det. Vi driver et register som bench-tester Claude-skills til daglig, og vi bestemte oss for å måle dette skikkelig: hvor mange faktapåstander i et typisk research-svar er faktisk feil — og hvor mange overlever når du tvinger modellen til å følge verifikasjonsregler?
Resultatet er research-discipline, vår tredje skill — og den første i sin nisje som lanseres med en målt før/etter-benchmark: 13,0 % av baseline-påstandene var feil eller utdaterte; med skillen, 5,4 %. Et kutt på 59 %. Den er gratis og MIT-lisensiert: github.com/Skillproofdev/research-discipline.
Gapet: pipelines verifiserer ikke, faktasjekkere researcher ikke
Før vi skrev en eneste linje, kartla vi 15 publiserte research- og faktasjekk-skills, pluss vårt eget register over 16 682 oppdagede skills. Feltet deler seg tydelig i to leire som aldri overlapper.
Deep-research-pipelines — de populære, med opptil 1,6k stjerner — orkestrerer parallelle søk og genererer lange rapporter. Les regelsettene deres, og du finner arbeidsflyt-ergonomi, ikke epistemikk: ingen sitering per påstand, ingen regler for kildekvalitet, ingen krav om å dobbeltsjekke noe. Faktasjekk-auditorer — stort sett verktøy for journalistikk og akademia, to størrelsesordener mindre populære — håndhever faktisk dommer og sitering, men bare i etterkant, på et ferdig utkast noen gir dem.
Ingen leverer mellomtingen: en lettvekts-disiplin som styrer agentens påstander mens den researcher, enten svaret er på tre avsnitt eller tretti. Og påfallende nok publiserer ingen av leirene målinger. Den høyest ropende konkurrenten hevder å «outperforme OpenAI, Gemini og Claude Desktop» uten et eneste tall å vise til; en annen oppgir «95 %+ nøyaktighet» som et mål den aldri har testet. Nisjen lever på magefølelse.
Åtte regler, tre av dem nye
Skillen er på rundt 1 500 tokens med håndfaste regler (hele SKILL.md). Det kjente: hver faktapåstand har en sitering i teksten som peker til en datert kildeliste; ustøttede påstander får et eksplisitt [unverified]-flagg i stedet for selvsikker formulering; kilder er inndelt i nivåer, og content farms avvises på stedet. Det ingen andre håndhever:
- Hukommelse er en hypotese. For alt som er flyktig — versjoner, priser, alt som er «gjeldende» — er gjenkalling fra treningsdata et spor å verifisere, aldri bevis. Hent datoen, søk, og påstå så.
- To uavhengige kilder for bærende fakta. Uavhengighet er definert: to artikler som skriver om samme pressemelding, teller som én kilde. Den eneste tidligere implementeringen av denne sjekken vi fant noe sted, var en gist med én stjerne.
- Tall siteres, de diktes ikke opp. Ordrett verdi, enhet og dato; når kildene er uenige, oppgi hele spennet med begge siteringer — aldri en stille kompromissverdi.
Pluss en adversarial gjennomgang med en tvingende mekanisme hentet fra det beste vi fant fra før: søk én gang etter det motsatte av konklusjonen din, finn minst to svakheter i eget utkast, eller gå på nytt gjennom de mest bærende påstandene dine.
Benchmarken: hver påstand vurdert mot levende kilder
Seks research-spørsmål med objektivt sjekkbare svar, valgt før noen kjøring: et versjonsoppslag, en prissammenligning, en faktasamling, et GitHub-repo-spørsmål og to feller. Hvert spørsmål kjørte to ganger — én Claude Sonnet-agent uten skill, én som leste skillen først, begge med full webtilgang. Deretter fastslo uavhengige verifikator-agenter grunnsannheten fra levende primærkilder og vurderte alle 110 faktapåstandene på tvers av de 12 svarene, én for én.
| Spørsmål | Feil/utdatert i baseline | Med skill |
|---|---|---|
| Claude modellkatalog (foreldelsesfelle) | 3 | 0 |
| Bun produksjonsklarhet (ekte-hendelse-felle) | 1 | 1 |
| Deno faktatabell | 1 | 0 |
| GitHub-repo-fakta | 1 | 0 |
| Astro utgivelseshistorikk | 1 | 1 |
| E-post-prissammenligning | 0 | 1 |
| Totalt | 7 av 54 (13,0 %) | 3 av 56 (5,4 %) |
De to fellene er der skillen virkelig beviste sin verdi.
Foreldelsesfellen. Bedt om den gjeldende Claude-modellkatalogen svarte baseline-agenten fra en bufret referanse uten en eneste live-sjekk — tre tall for kontekstvindu ble feil. Skill-agentens regel 1 tvang frem en henting av den live dokumentasjonssiden; verifikatorens dom: «stemmer med den live dokumentasjonen på absolutt hvert eneste tall.» Samme modell, samme spørsmål, samme verktøy tilgjengelig. Den eneste forskjellen var en regel som sier at hukommelse ikke teller som bevis.
Ekte-hendelse-fellen. Spurt om Bun er produksjonsklar i 2026, støtte baseline-agenten på det faktum at Anthropic kjøpte opp Bun i desember 2025 — og avfeide det som et uverifisert SEO-rykte. Kildene dens var tredjeparts-blogger; den åpnet aldri bun.com eller anthropic.com, der begge primærkunngjøringene ligger. Skill-agenten siterte begge, og verifikatoren bekreftet dem live. Les det en gang til: baselinens eneste usikkerhetsflagg i hele benchmarken var rettet mot en sann hendelse. Skepsis uten verifisering er bare en annen måte å ta feil på.
Der skillen tapte — publisert likevel
Vår metodikk krever at tapene vises ved siden av seirene, og det var to av dem.
På e-post-prisspørsmålet slo baseline faktisk skillen: den priset alle de tre Postmark-nivåene og fant det billigste, mens skill-agenten priset ett nivå, kalte det «billigste vei», og tok feil med $2,50/måned. Siteringsdisiplin gjør ikke regnestykket for deg — ufullstendig gjennomgang er en research-svikt reglene ikke fanger opp. Og på Bun-spørsmålet gjentok skill-agenten et feilaktig versjonsnummer fra et teknologimedie for en reell utgivelse i stedet for å dobbeltsjekke mot leverandørens release notes — en nivå-2-kilde som ble stolt på ett hakk for mye.
Også ærlig: disiplinen koster rundt +10 % tokens — live-hentingene og den adversariale gjennomgangen er ikke gratis. Og på tvers av alle tolv svarene ble skillens rundt 8 proaktive [unverified]/[single-source]-flagg alle vurdert som treffende, noe som er et resultat i seg selv: skillen kutter ikke bare feilaktige påstander, den forteller deg hvilke av de gjenværende du bør dobbeltsjekke.
SKILLPROOF-PAKKEN
research-discipline er gratis. Vil du ha hele effektivitetsoppsettet rundt den — trimmet CLAUDE.md, MCP-revisjon og fire testede skills ferdigkonfigurert — er det Optimizer Pack.
Få Optimizer Pack — $10Installasjon
git clone https://github.com/Skillproofdev/research-discipline ~/.claude/skills/research-discipline
Start Claude Code på nytt. Den utløses av research-spørsmål, «hva er det nyeste», sammenligninger og faktasjekk-forespørsler — og holder seg unna koding, meninger og kreativt arbeid. Den slutter seg til token-discipline i disiplin-serien vår: den ene kutter hva research koster, denne kutter hva den bommer på.
GRATIS STARTPAKKE
Vil du ha våre høyest rangerte skills pluss installasjonssjekklisten vi kjører før hver test? Vi sender deg startpakken gratis på e-post.
Få den gratis startpakkenOfte stilte spørsmål
Erstatter dette Claudes innebygde deep research? Nei — den utfyller den. Innebygde research-funksjoner er rapportgeneratorer; dette er et disiplinlag som gjelder for ethvert research-formet svar, også korte, og det er inspiserbart: du kan lese alle de åtte reglene på én skjerm.
Vil ikke Claude bare nekte å svare når den ikke kan verifisere? Skillen forbyr det eksplisitt: tynt belegg betyr å svare med flagg, ikke å trekke på skuldrene. «Dette kunne jeg ikke bekrefte» knyttet til en konkret påstand er mer nyttig enn både falsk selvsikkerhet og avslag.
Hvorfor bare seks spørsmål? Fordi hver påstand ble verifisert for hånd mot levende primærkilder — 110 påstander på tvers av 12 svar, hver med en sjekkbar dom. Vi foretrekker en liten benchmark der grunnsannheten er ekte, fremfor en stor en vurdert av en uverifisert dommer. Spørsmålssettet og dommene per påstand finnes i repoets README.
Er 5,4 % fortsatt for høyt? Ja. Skillen kutter feilaktige påstander med mer enn halvparten; den gjør ikke Claude ufeilbarlig, og de to gjenværende feilene i vår egen benchmark er dokumentert over. Hvis det er dyrt å ta feil i en beslutning, bør du verifisere de bærende faktaene selv — skillens siteringer gjør at det tar minutter i stedet for timer.
★ 9.6/10 × 3
Den gratis startpakken
De 3 skillsene med våre høyeste testscorer pluss installasjonssjekklisten — oppsettet vi selv ville lagt på en fersk maskin. Gratis, på e-post.