
Claudes AI-hallucinationer skåret 59% med én skill
Stiller du Claude et research-spørgsmål, får du noget farligt: et selvsikkert, velskrevet svar. Om det er sandt, er en helt anden sag, og det kan du ikke se ved at læse det. Vi driver et katalog, der benchmark-tester Claude skills til daglig, og vi besluttede at måle det her ordentligt: hvor mange faktuelle påstande i et typisk researchet svar er faktisk forkerte — og hvor mange af dem overlever, når man tvinger modellen til at følge verifikationsregler?
Resultatet er research-discipline, vores tredje skill, og den første skill i sin niche, der udgives med en målt før/efter-benchmark: 13.0% af baseline-påstandene var forkerte eller forældede; med skillen 5.4%. Et fald på 59%. Den er gratis og MIT-licenseret: github.com/Skillproofdev/research-discipline.
Hullet: pipelines verificerer ikke, verifikatorer researcher ikke
Før vi skrev en eneste linje, gennemgik vi 15 udgivne research- og faktatjek-skills samt vores eget indeks over 16,682 opdagede skills. Landskabet deler sig helt skarpt i to lejre, der aldrig overlapper.
Deep-research-pipelines — de populære, med op til 1.6k stjerner — orkestrerer parallelle søgninger og genererer lange rapporter. Læser man deres regelsæt, finder man workflow-ergonomi, ikke epistemik: ingen kildehenvisning pr. påstand, ingen regler for kildekvalitet, intet krav om at tjekke noget to gange. Faktatjek-auditører — mest journalistik- og forskningsværktøjer, to størrelsesordener mindre populære — håndhæver faktisk verdikter og kildehenvisninger, men kun post-hoc, på et færdigt udkast, nogen rækker dem.
Ingen udgiver det midterste: en let disciplin, der styrer agentens påstande, mens den researcher — uanset om svaret er på tre eller tredive afsnit. Og bemærkelsesværdigt nok: ingen af de to lejre offentliggør målinger. Den mest højrøstede konkurrent hævder at "outperforme OpenAI, Gemini og Claude Desktop" uden et eneste tal at vise for det; en anden angiver "95%+ nøjagtighed" som et mål, den aldrig har testet. Nichen kører på mavefornemmelser.
Otte regler, tre af dem nye
Skillen er ~1,500 tokens håndhævelige regler (hele SKILL.md). Det velkendte: hver faktuel påstand bærer en inline-kildehenvisning, der peger på en dateret kildeliste; ubegrundede påstande får et eksplicit [unverified]-flag i stedet for selvsikker formulering; kilder er inddelt i niveauer, og content farms afvises kategorisk. Det, som ingen andre håndhæver:
- Hukommelse er en hypotese. For alt flygtigt — versioner, priser, alt, der er "aktuelt" — er genkald fra træningsdata et spor, der skal verificeres, aldrig et bevis. Hent datoen, søg, og påstå så.
- To uafhængige kilder for bærende fakta. Uafhængighed er defineret: to artikler, der omskriver den samme pressemeddelelse, tæller som én kilde. Den eneste tidligere implementering af det tjek, vi kunne finde nogen steder, var en gist med én stjerne.
- Tal citeres, de fabrikeres ikke. Ordret værdi, enhed og dato; når kilder er uenige, rapporteres intervallet med begge kildehenvisninger — aldrig en tavs kompromisværdi.
Plus en modstridende gennemgang med en tvangsfunktion lånt fra det bedste forudgående arbejde, vi fandt: søg én gang efter det modsatte af din konklusion, find mindst to svagheder i dit eget udkast, eller genundersøg dine mest bærende påstande.
Benchmarken: hver påstand vurderet mod live kilder
Seks research-spørgsmål med objektivt kontrollerbare svar, valgt før nogen kørsel: et versionsopslag, en prissammenligning, en faktaoversigt, en GitHub-repo-forespørgsel og to fælder. Hvert spørgsmål blev kørt to gange — én Claude Sonnet-agent uden hjælp, én der læste skillen først, begge med fuld webadgang. Derefter etablerede uafhængige verifikator-agenter grundsandheden ud fra live primærkilder og vurderede alle 110 faktuelle påstande på tværs af de 12 svar, én for én.
| Spørgsmål | Forkert/forældet i baseline | Med skill |
|---|---|---|
| Claude-modelkatalog (forældelsesfælde) | 3 | 0 |
| Bun produktionsklarhed (fælde med reel begivenhed) | 1 | 1 |
| Deno-faktatabel | 1 | 0 |
| GitHub-repo-fakta | 1 | 0 |
| Astro-udgivelseshistorik | 1 | 1 |
| E-mail-prissammenligning | 0 | 1 |
| I alt | 7 af 54 (13.0%) | 3 af 56 (5.4%) |
De to fælder er, hvor skillen for alvor beviste sit værd.
Forældelsesfælden. Bedt om det aktuelle Claude-modelkatalog svarede baseline-agenten ud fra en cachet reference uden et eneste live-tjek — tre kontekstvindue-tal kom ud forkerte. Skill-agentens Regel 1 tvang et opslag på den live dokumentationsside frem; verifikatorens dom: "matcher den live dokumentation på hvert eneste tal." Samme model, samme spørgsmål, samme værktøjer til rådighed. Den eneste forskel var en regel, der siger, at hukommelse ikke tæller som bevis.
Fælden med den reelle begivenhed. Bedt om, hvorvidt Bun er produktionsklar i 2026, stødte baseline-agenten på det faktum, at Anthropic opkøbte Bun i december 2025 — og afviste det som et uverificeret SEO-rygte. Dens kilder var tredjeparts-blogs; den åbnede aldrig bun.com eller anthropic.com, hvor begge primære annonceringer ligger. Skill-agenten citerede begge, og verifikatoren bekræftede dem live. Læs det igen: baseline-agentens eneste usikkerhedsflag i hele benchmarken var rettet mod en sand begivenhed. Skepsis uden verifikation er bare en anden måde at tage fejl på.
Hvor skillen tabte — udgivet alligevel
Vores metode kræver, at tabene står ved siden af sejrene, og der var to.
På e-mail-prisspørgsmålet slog baseline faktisk skillen: den prissatte alle tre Postmark-niveauer og fandt det billigste, mens skill-agenten prissatte ét niveau, kaldte det den "billigste vej" og tog fejl med $2.50/måned. Kildedisciplin løser ikke din regning — ufuldstændig gennemgang er en research-fejl, reglerne ikke fanger. Og på Bun-spørgsmålet gentog skill-agenten et techmedies forkerte versionsnummer for en reel udgivelse i stedet for at krydstjekke leverandørens release notes — en tier-2-kilde, der blev betroet ét niveau for meget.
Også ærligt: disciplinen koster omkring +10% tokens — de live-opslag og den modstridende gennemgang er ikke gratis. Og på tværs af alle tolv svar blev skillens ~8 proaktive [unverified]/[single-source]-flag alle vurderet som passende, hvilket er sit eget slags resultat: skillen skærer ikke bare forkerte påstande væk, den fortæller dig, hvilke af de overlevende du bør dobbelttjekke.
SKILLPROOF PACK
research-discipline er gratis. Hvis du vil have hele effektivitetsopsætningen omkring den — en beskåret CLAUDE.md, en MCP-audit og fire testede skills forudkonfigureret — er det Optimizer Pack.
Få Optimizer Pack — $10Installation
git clone https://github.com/Skillproofdev/research-discipline ~/.claude/skills/research-discipline
Genstart Claude Code. Den udløses af research-spørgsmål, "what's the latest", sammenligninger og faktatjek-forespørgsler — og holder sig væk fra kodning, meninger og kreativt arbejde. Den slutter sig til token-discipline i vores disciplin-serie: den ene skærer i, hvad research koster, den her skærer i, hvad den tager fejl om.
GRATIS STARTERPAKKE
Vil du have vores højest scorede skills plus den installationstjekliste, vi kører før hver eneste test? Vi sender dig den gratis starterpakke på mail.
Få den gratis starterpakkeFAQ
Erstatter det her Claudes indbyggede deep research? Nej — det supplerer det. De indbyggede research-funktioner er rapportgeneratorer; det her er et disciplinlag, der gælder for ethvert research-formet svar, også de korte, og det er gennemsigtigt: du kan læse alle otte regler på én skærm.
Vil Claude ikke bare nægte at svare, når den ikke kan verificere? Skillen forbyder det eksplicit: tyndt belæg betyder at svare med flag, ikke at trække på skuldrene. "Jeg kunne ikke bekræfte dette" hæftet på en konkret påstand er mere nyttigt end enten falsk selvsikkerhed eller afvisning.
Hvorfor kun seks spørgsmål? Fordi hver påstand blev verificeret manuelt mod live primærkilder — 110 påstande på tværs af 12 svar, hver med en kontrollerbar dom. Vi foretrækker en lille benchmark, hvor grundsandheden er reel, frem for en stor, der scores af en uverificeret dommer. Spørgsmålssættet og dommene pr. påstand ligger i repo-README'en.
Er 5.4% stadig for højt? Ja. Skillen skærer forkerte påstande ned med mere end det halve; den gør ikke Claude ufejlbarlig, og de to resterende fejl i vores egen benchmark er dokumenteret ovenfor. Hvis en beslutning er dyr at tage fejl på, så verificer de bærende fakta selv — skillens kildehenvisninger gør, at det tager minutter i stedet for timer.
★ 9.6/10 × 3
Den gratis startpakke
De 3 skills med vores højeste testscorer plus installations-tjeklisten — det setup, vi selv ville lægge på en frisk maskine. Gratis, på mail.