
Vi mätte Claudes AI-hallucinationer – minus 59%
Ställ en researchfråga till Claude och du får något farligt tillbaka: ett självsäkert, välskrivet svar. Om det är sant är en helt separat fråga, och det går inte att avgöra bara genom att läsa svaret. Att testa Claude-skills är vårt jobb, och vi bestämde oss för att mäta det här ordentligt: hur många sakpåståenden i ett typiskt researchsvar är faktiskt fel — och hur många av dem överlever när man tvingar modellen att följa verifieringsregler?
Resultatet är research-discipline, vår tredje skill, och den första skillen i sin nisch som levereras med en uppmätt före/efter-benchmark: 13.0% av baseline-påståendena var fel eller föråldrade; med skillen 5.4%. En minskning med 59%. Den är gratis och MIT-licensierad: github.com/Skillproofdev/research-discipline.
Glappet: pipelines verifierar inte, verifierare researchar inte
Innan vi skrev en enda rad gick vi igenom 15 publicerade research- och faktagranskningsskills, plus vårt eget index på 16 682 upptäckta skills. Fältet delar sig tydligt i två läger som aldrig överlappar.
Deep-research-pipelines — de populära, upp till 1.6k stjärnor — orkestrerar parallella sökningar och genererar långa rapporter. Läs deras regelverk och du hittar arbetsflödesergonomik, inte epistemik: inga per-påstående-citeringar, inga regler för källkvalitet, inget krav på att kontrollera något två gånger. Faktagranskningsverktyg — mestadels journalistik- och forskningsverktyg, två storleksordningar mindre populära — kräver visserligen verdikter och citeringar, men bara i efterhand, på ett färdigt utkast någon lämnar över till dem.
Ingen bygger mellantinget: en lättviktig disciplin som styr agentens påståenden medan den researchar, oavsett om svaret är tre stycken eller trettio. Och märkligt nog publicerar ingen i något av lägren några mätningar. Den mest högljudda konkurrenten påstår sig "överträffa OpenAI, Gemini och Claude Desktop" utan en enda siffra bifogad; en annan anger "95%+ träffsäkerhet" som ett mål den aldrig testat. Nischen drivs på magkänsla.
Åtta regler, tre av dem nya
Skillen är ~1 500 tokens strikta regler (hela SKILL.md). De välbekanta delarna: varje sakpåstående bär en infogad citering som pekar till en daterad källista; ostödda påståenden får en explicit [unverified]-flagga i stället för självsäker formulering; källor delas in i nivåer, och innehållsfarmer avvisas helt. Delarna ingen annan tillämpar:
- Minnet är en hypotes. För allt flyktigt — versioner, priser, allt som är "aktuellt" — är träningsdatans minne ett spår att verifiera, aldrig ett bevis. Hämta datumet, sök, bekräfta sedan.
- Två oberoende källor för bärande fakta. Oberoende definieras: två artiklar som skriver om samma pressmeddelande räknas som en källa. Den enda tidigare implementering av den här kontrollen vi hittade någonstans var en gist med en stjärna.
- Siffror citeras, inte tillverkas. Ordagrant värde, enhet och datum; när källor är oense redovisas intervallet med båda citeringarna — aldrig ett tyst kompromissvärde.
Plus ett adversariellt genomgångssteg med en tvingande mekanism lånad från det bästa vi hittade i befintlig praxis: sök en gång efter motsatsen till din slutsats, hitta minst två svagheter i ditt eget utkast, eller granska dina mest bärande påståenden på nytt.
Benchmarken: varje påstående bedömt mot levande källor
Sex researchfrågor med objektivt kontrollerbara svar, valda innan någon körning: en versionsuppslagning, en prisjämförelse, en faktasammanställning, en GitHub-repofråga och två fallgropar. Varje fråga kördes två gånger — en Claude Sonnet-agent utan hjälpmedel, en som läste skillen först, båda med full webbåtkomst. Sedan fastställde oberoende verifieringsagenter grundsanningen från levande primärkällor och bedömde alla 110 sakpåståenden i de 12 svaren, ett efter ett.
| Fråga | Baseline fel/föråldrat | Med skill |
|---|---|---|
| Claudes modellkatalog (föråldringsfälla) | 3 | 0 |
| Buns produktionsmognad (verklig-händelse-fälla) | 1 | 1 |
| Deno-faktatabell | 1 | 0 |
| GitHub-repofakta | 1 | 0 |
| Astros versionshistorik | 1 | 1 |
| Prisjämförelse för e-post | 0 | 1 |
| Totalt | 7 av 54 (13.0%) | 3 av 56 (5.4%) |
De två fallgroparna är där skillen bevisade sitt värde.
Föråldringsfällan. Ombedd att uppge Claudes aktuella modellkatalog svarade baseline-agenten utifrån en cachad referens utan en enda liveuppslagning — tre siffror om kontextfönster blev fel. Skillagentens regel 1 tvingade fram en hämtning av den levande dokumentationssidan; verifierarens dom: "matchar den levande dokumentationen på varje enskild siffra." Samma modell, samma fråga, samma verktyg tillgängliga. Den enda skillnaden var en regel som säger att minnet inte räknas som bevis.
Verklig-händelse-fällan. Ombedd att avgöra om Bun är produktionsmoget 2026 stötte baseline-agenten på faktumet att Anthropic förvärvade Bun i december 2025 — och avfärdade det som ett overifierat SEO-rykte. Dess källor var tredjepartsbloggar; den öppnade aldrig bun.com eller anthropic.com, där båda de primära tillkännagivandena finns. Skillagenten citerade båda, och verifieraren bekräftade dem live. Läs det igen: baseline-agentens enda osäkerhetsflagga i hela benchmarken riktades mot en sann händelse. Skepsis utan verifiering är bara ett annat sätt att ha fel.
Där skillen förlorade — publicerat ändå
Vår metodik kräver att förlusterna redovisas bredvid vinsterna, och det fanns två.
På frågan om e-postpriser slog baseline-agenten faktiskt skillen: den prissatte alla tre Postmark-nivåerna och hittade den billigaste, medan skillagenten prissatte en enda nivå, kallade den "billigaste vägen" och hade fel med $2.50/månad. Citeringsdisciplin gör inte din matematik åt dig — ofullständig genomgång är ett researchmisslyckande reglerna inte fångar. Och på Bun-frågan upprepade skillagenten ett teknikmedias felaktiga versionsnummer för en verklig release i stället för att korskontrollera leverantörens release notes — en nivå 2-källa som litades på ett steg för långt.
Också ärligt: disciplinen kostar ungefär +10% tokens — liveuppslagningarna och det adversariella steget är inte gratis. Och över alla tolv svar bedömdes skillens ~8 proaktiva [unverified]/[single-source]-flaggor som samtliga korrekta, vilket är ett resultat i sig: skillen skär inte bara ner felaktiga påståenden, den talar också om vilka av de kvarvarande du bör dubbelkolla.
SKILLPROOF PACK
research-discipline är gratis. Vill du ha hela effektivitetsuppsättningen runt den — en beskuren CLAUDE.md, en MCP-granskning och fyra testade skills förkonfigurerade — är det Optimizer Pack.
Skaffa Optimizer Pack — $10Installation
git clone https://github.com/Skillproofdev/research-discipline ~/.claude/skills/research-discipline
Starta om Claude Code. Den triggas på researchfrågor, "vad är senaste", jämförelser och faktagranskningsförfrågningar — och håller sig undan vid kodning, åsikter och kreativt arbete. Den ansluter till token-discipline i vår disciplinserie: den skillen skär ner vad research kostar, den här skär ner vad den får fel.
FREE STARTER PACK
Vill du ha våra topprankade skills plus installationschecklistan vi kör innan varje test? Vi mejlar dig det gratis startpaketet.
Skaffa det gratis startpaketetVanliga frågor
Ersätter det här Claudes inbyggda deep research? Nej — det kompletterar den. Inbyggda researchfunktioner är rapportgeneratorer; det här är ett disciplinlager som gäller varje researchpräglat svar, även korta, och det är inspekterbart: du kan läsa alla åtta regler på en enda skärm.
Vägrar inte Claude bara att svara när den inte kan verifiera? Skillen förbjuder det uttryckligen: tunt underlag betyder att svara med flaggor, inte att rycka på axlarna. "Jag kunde inte bekräfta det här" kopplat till ett specifikt påstående är mer användbart än både falsk säkerhet och vägran.
Varför bara sex frågor? Eftersom varje påstående verifierades för hand mot levande primärkällor — 110 påståenden i 12 svar, vart och ett med en kontrollerbar dom. Vi föredrar en liten benchmark där grundsanningen är verklig framför en stor som bedöms av en overifierad domare. Frågeurvalet och bedömningarna per påstående finns i repots README.
Är 5.4% fortfarande för högt? Ja. Skillen skär ner felaktiga påståenden med mer än hälften; den gör inte Claude ofelbar, och de två kvarvarande felen i vår egen benchmark är dokumenterade ovan. Om ett beslut är dyrt att få fel, verifiera de bärande fakta själv — skillens citeringar gör att det tar minuter i stället för timmar.
★ 9.6/10 × 3
Gratis startpaket
De 3 skills som fått våra högsta testbetyg plus installationschecklistan — setupen vi själva skulle lägga på en ny maskin. Gratis, via e-post.