We sneden Claude's AI-hallucinaties met 59%

We sneden Claude's AI-hallucinaties met 59%

Stel Claude een researchvraag en je krijgt iets gevaarlijks: een zelfverzekerd, goedgeschreven antwoord. Of het ook waar is, is een aparte eigenschap — en dat zie je niet aan de tekst zelf. Wij runnen een directory die Claude-skills voor de kost bench-test, en we besloten dit eens grondig te meten: hoeveel feitelijke claims in een doorsnee researchantwoord kloppen gewoon niet — en hoeveel daarvan overleven als je het model dwingt verificatieregels te volgen?

Het resultaat is research-discipline, onze derde skill, en de eerste skill in deze niche die met een gemeten voor/na-benchmark komt: 13,0% van de baseline-claims was fout of verouderd; met de skill 5,4%. Een reductie van 59%. Gratis en MIT-licensed: github.com/Skillproofdev/research-discipline.

De kloof: pipelines verifiëren niet, verifiers doen geen research

Voordat we een regel schreven, namen we 15 gepubliceerde research- en fact-checking-skills door, plus onze eigen index van 16.682 ontdekte skills. Het veld valt netjes uiteen in twee kampen die elkaar nooit overlappen.

Deep-research-pipelines — de populaire, tot 1,6k sterren — orkestreren parallelle zoekopdrachten en genereren lange rapporten. Lees hun regelsets en je vindt workflow-ergonomie, geen epistemologie: geen citaten per claim, geen regels voor bronkwaliteit, geen verplichting om iets twee keer te checken. Fact-check-auditors — vooral tools uit journalistiek en academia, twee ordes van grootte minder populair — handhaven wél oordelen en citaten, maar alleen achteraf, op een afgerond concept dat iemand ze aanreikt.

Niemand levert het middending: een lichtgewicht discipline die de claims van de agent bestuurt terwijl hij research doet, of het antwoord nou drie alinea's telt of dertig. En opvallend: niemand in beide kampen publiceert metingen. De luidruchtigste concurrent claimt "outperform OpenAI, Gemini and Claude Desktop" zonder één cijfer erbij; een ander noemt "95%+ accuracy" als doel dat nooit getest is. De niche draait op vibes.

Acht regels, drie ervan nieuw

De skill bestaat uit zo'n 1.500 tokens aan afdwingbare regels (volledige SKILL.md). Het bekende deel: elke feitelijke claim krijgt een inline citaat dat teruggaat naar een gedateerde bronnenlijst; niet-onderbouwde claims krijgen een expliciete [unverified]-vlag in plaats van zelfverzekerde formuleringen; bronnen zijn ingedeeld in tiers, met contentfarms die zonder pardon worden afgewezen. Het deel dat verder niemand afdwingt:

  1. Geheugen is een hypothese. Voor alles wat vluchtig is — versies, prijzen, alles met "actueel" — is trainingsdata-herinnering een aanwijzing om te verifiëren, nooit bewijs. Haal de datum op, zoek, en beweer dan pas.
  2. Twee onafhankelijke bronnen voor dragende feiten. Onafhankelijkheid is gedefinieerd: twee artikelen die hetzelfde persbericht herschrijven, tellen als één bron. De enige eerdere implementatie van deze check die we konden vinden, was een gist met één ster.
  3. Cijfers worden geciteerd, niet verzonnen. Letterlijke waarde, eenheid en datum; als bronnen elkaar tegenspreken, rapporteer je de bandbreedte met beide citaten — nooit een stilzwijgend compromiscijfer.

Plus een adversarial pass met een forcing function, geleend van het beste voorbeeld dat we konden vinden: zoek één keer naar het tegenovergestelde van je conclusie, vind minstens twee zwaktes in je eigen concept, of herbekijk je meest dragende claims.

De benchmark: elke claim getoetst aan live bronnen

Zes researchvragen met objectief controleerbare antwoorden, gekozen vóórdat er ook maar één run draaide: een versie-opzoeking, een prijsvergelijking, een feitenoverzicht, een GitHub-repovraag, en twee valstrikken. Elke vraag draaide twee keer — één Claude Sonnet-agent kaal, één die eerst de skill las, beide met volledige webtoegang. Onafhankelijke verifier-agents stelden vervolgens de ground truth vast op basis van live primaire bronnen en beoordeelden alle 110 feitelijke claims in de 12 antwoorden, één voor één.

Vraag Baseline fout/verouderd Met skill
Claude-modelcatalogus (staleness trap) 3 0
Bun production-readiness (real-event trap) 1 1
Deno-feitentabel 1 0
GitHub-repofeiten 1 0
Astro-releasegeschiedenis 1 1
Prijsvergelijking e-mail 0 1
Totaal 7 van 54 (13,0%) 3 van 56 (5,4%)

De twee valstrikken zijn waar de skill zijn geld waard bleek.

De staleness trap. Gevraagd naar de actuele Claude-modelcatalogus antwoordde de baseline-agent vanuit een gecachete referentie, zonder ook maar één live check — drie cijfers over contextvensters kwamen fout uit. Regel 1 van de skill-agent dwong een fetch van de live docs-pagina af; het oordeel van de verifier: "matches the live documentation on every single figure." Zelfde model, zelfde vraag, dezelfde tools beschikbaar. Het enige verschil was een regel die zegt dat geheugen niet telt als bewijs.

De real-event trap. Gevraagd of Bun in 2026 production-ready is, liep de baseline-agent tegen het feit aan dat Anthropic Bun in december 2025 overnam — en deed het af als een ongeverifieerd SEO-gerucht. De bronnen ervan waren blogs van derden; het opende nooit bun.com of anthropic.com, waar beide primaire aankondigingen staan. De skill-agent citeerde beide, en de verifier bevestigde ze live. Lees dat nog eens: de enige onzekerheidsvlag van de baseline in de hele benchmark was gericht op een gebeurtenis die wél waar was. Scepsis zonder verificatie is gewoon een andere manier om ongelijk te hebben.

Waar de skill verloor — toch gepubliceerd

Onze methodologie vereist dat de verliezen naast de winsten staan, en die waren er twee.

Bij de e-mailprijsvraag versloeg de baseline de skill zelfs: die prijsde alle drie de Postmark-tiers en vond de goedkoopste, terwijl de skill-agent één tier prijsde, dat de "goedkoopste route" noemde, en er $2,50/maand naast zat. Citatiediscipline doet je rekenwerk niet voor je — onvolledige enumeratie is een researchfout die de regels niet opvangen. En bij de Bun-vraag herhaalde de skill-agent het onjuiste versienummer van een techmedium voor een echte release, in plaats van de release notes van de leverancier te cross-checken — een tier-2-bron één niveau te veel vertrouwd.

Ook eerlijk: de discipline kost ongeveer +10% tokens — de live fetches en de adversarial pass zijn niet gratis. En over alle twaalf antwoorden heen werden de zo'n 8 proactieve [unverified]/[single-source]-vlaggen van de skill stuk voor stuk terecht bevonden — een resultaat op zich: de skill snijdt niet alleen foute claims weg, hij vertelt je ook welke van de overgebleven claims je nog even moet dubbelchecken.

SKILLPROOF PACK

research-discipline is gratis. Wil je de volledige efficiency-setup eromheen — een uitgekleed CLAUDE.md, een MCP-audit, en vier vooraf geconfigureerde geteste skills — dat is het Optimizer Pack.

Haal het Optimizer Pack — $10

Installeren

git clone https://github.com/Skillproofdev/research-discipline ~/.claude/skills/research-discipline

Herstart Claude Code. Hij triggert op researchvragen, "wat is de laatste stand van zaken", vergelijkingen en fact-check-verzoeken — en blijft uit de weg bij coderen, meningen en creatief werk. Hij voegt zich bij token-discipline in onze discipline-reeks: die skill snijdt wat research kost, deze snijdt wat het fout doet.

FREE STARTER PACK

Wil je onze best scorende skills plus de installatiechecklist die we voor elke test doorlopen? We mailen je het gratis starterpakket.

Vraag het gratis starterpakket aan

FAQ

Vervangt dit Claude's ingebouwde deep research? Nee — hij vult het aan. Ingebouwde researchfuncties zijn rapportgenerators; dit is een disciplinelaag die van toepassing is op elk researchachtig antwoord, ook korte, en hij is inspecteerbaar: je leest alle acht regels in één scherm.

Weigert Claude dan niet gewoon te antwoorden als hij niets kan verifiëren? De skill verbiedt dat expliciet: dun bewijs betekent antwoorden met vlaggen, geen schouderophalen. "Ik kon dit niet bevestigen" gekoppeld aan een specifieke claim is nuttiger dan valse zekerheid óf een weigering.

Waarom maar zes vragen? Omdat elke claim met de hand geverifieerd werd tegen live primaire bronnen — 110 claims over 12 antwoorden, elk met een controleerbaar oordeel. We geven de voorkeur aan een kleine benchmark met echte ground truth boven een grote die beoordeeld wordt door een ongeverifieerde rechter. De vragenset en de oordelen per claim staan in de repo README.

Is 5,4% nog steeds te hoog? Ja. De skill snijdt foute claims met meer dan de helft, maar maakt Claude niet onfeilbaar, en de twee resterende fouten in onze eigen benchmark staan hierboven gedocumenteerd. Als een verkeerde beslissing duur uitpakt, verifieer de dragende feiten dan zelf — dankzij de citaten van de skill kost dat minuten in plaats van uren.

★ 9.6/10 × 3

Het gratis starterspakket

De 3 skills met onze hoogste testscores plus de installatiechecklist — de setup die wij op een verse machine zouden zetten. Gratis, per e-mail.

Eén e-mail met het pakket + een korte wekelijkse digest met nieuwe testresultaten. Uitschrijven kan altijd.