Zelfde vraag, zelfde model, één skill: AI-onderzoek live

Zelfde vraag, zelfde model, één skill: AI-onderzoek live

Een uur nadat we research-discipline publiceerden, deden we het experiment dat je eigenlijk wilt zien: geen samengestelde benchmark, maar één live vraag, twee keer gesteld, met de antwoorden publiekelijk gecontroleerd. Dit artikel is het volledige protocol — wat we vroegen, wat elke run deed, en elke verificatiestap — zodat je het zelf kunt overdoen.

De opzet

De vraag. "Wat zijn op dit moment de populairste Claude Code-skills? Noem de top 5 skill-repositories op GitHub op basis van sterren, met actuele aantallen. Hoe verhoudt Anthropics officiële repo zich tot die van de community?" — een vraag met een objectief controleerbaar antwoord dat wekelijks verandert, precies waar AI-onderzoek in stilte verrot.

De twee runs. Identieke Claude Sonnet-agents, identieke prompt, identieke tools (web search, web fetch, shell). Eén verschil: de tweede agent las eerst SKILL.md van een kopie van research-discipline, geïnstalleerd zoals elke gebruiker dat zou doen —

git clone https://github.com/Skillproofdev/research-discipline ~/.claude/skills/research-discipline

Dat is de hele interventie: ~1,500 tokens aan regels die het model leest voordat het aan de slag gaat.

De scheidsrechter. Nadat beide antwoorden binnen waren, haalden we het aantal sterren op van elke repository die in een van beide antwoorden werd genoemd — plus de kandidaten die geen van beide noemde — rechtstreeks uit de GitHub API, de enige autoriteit over haar eigen cijfers. Voor deze keer geen LLM als beoordelaar; gewoon gh api repos/<owner>/<repo>.

Wat er uitkwam

De echte top-5 skill-repo's op sterren, en welke daarvan het baseline-onderzoek miste

Het baseline-antwoord ziet er geweldig uit. Vijf repositories, aannemelijke beschrijvingen, sterrenaantallen tot op het cijfer nauwkeurig, een zelfverzekerde synthese aan het eind. Als we het niet hadden gecontroleerd, hadden we het zo gepubliceerd.

Het is fout op de manier die ertoe doet. De echte top-5, geverifieerd tegen de live API, bevat drie repositories die de baseline nooit naar boven haalde — met 228k, 190k en 164k sterren. Dat zijn geen obscure projecten: elk is groter dan drie van de vijf repo's die de baseline wél noemde. De afsluitende bewering, "Anthropics officiële repo staat op de tweede plaats, alleen achter Superpowers," klopt niet — de officiële repo staat op de vijfde plaats. Niets van wat de baseline schreef was verzonnen; elk genoemd getal klopte. Hij beantwoordde alleen een andere vraag: "over welke repo's schrijven blogposts?" — want zijn zes tool calls waren websearches, en zoekresultaten zijn een populariteitswedstrijd voor aandacht, niet voor sterren.

De skill-run beantwoordde de vraag die werd gesteld. De eerste regel — bewijs is live; geheugen en zoekresultaten van de eerste pagina zijn aanwijzingen, geen bewijs — dreef hem van googelen naar inventariseren: hij bevroeg de GitHub API rechtstreeks en doorzocht drie GitHub-topiclijsten (agent-skills, claude-skills, claude-code-skills) om zeker te weten dat er niets groots verstopt zat buiten de blogosfeer. Al zijn vijf aantallen kwamen overeen met de live API toen we opnieuw controleerden. Hij deed ook twee dingen die niemand vroeg, maar die een zorgvuldige onderzoeker wel zou doen: hij scheidde echte skill-repositories van samengestelde linklijsten (de baseline gooide ze op één hoop), en voegde twee onzekerheidsvlaggen toe — één die opmerkte dat verschillende toprepo's pas maanden oud zijn met ongewoon snelle stergroei ([unverified] of dat organisch is), en één die toegaf dat een claim over een marketplace herleid werd tot één blog ([single-source]). Beide vlaggen hielden stand bij nadere controle.

De methode, uitgelegd

Baseline vs. skill-run: tool calls, gedrag en tokenkosten

Waarom verandert een tekstbestand het gedrag zo sterk? Omdat het probleem dat het aanpakt geen onwetendheid is — het baseline-model weet dat GitHub een API heeft — maar de standaardgewoonte om te antwoorden met wat er als eerste bovendrijft. De skill maakt van goede praktijk niet langer "iets wat het model zou kunnen doen," maar "iets wat het model moet doen voordat het iets mag beweren":

  1. Regel 1 (live bewijs) dwong de datumstempel en de API-calls af, in plaats van te vertrouwen op zoeksnippets.
  2. Regel 3 (onafhankelijke bronnen) is de reden dat de topic-sweeps plaatsvonden — één zoekpad is niet genoeg voor een zwaarwegende "top 5"-bewering.
  3. Regel 5 (ongeverifieerd betekent ongeverifieerd zeggen) leverde de twee vlaggen op, in plaats van stilzwijgend vertrouwen.
  4. Regel 7 (val je eigen conclusie aan) is de reden dat hij ging zoeken naar repo's die zijn eigen ranking zouden ondermijnen — en ze vond.

De eerlijke kosten, zoals ook onze gecontroleerde benchmark liet zien: de gedisciplineerde run gebruikte 11 tool calls tegenover 6, en 64,445 tokens tegenover 49,988 — +29% op deze taak. Verificatie is niet gratis. Het is alleen veel goedkoper dan zelfverzekerd fout zitten in een document waar iemand naar handelt.

Wat dit niet bewijst

Eén vraag is een anekdote, geen benchmark — de gecontroleerde versie met zes vragen en verificatie op claimniveau (13.0% → 5.4% foutieve claims) is het bewijs; dit is de demonstratie. De skill is ook geen orakel voor volledigheid: in de gecontroleerde run prijsde hij ooit één leverancierstier en miste hij een goedkopere. En de sterrenaantallen hierboven klopten op 10 juli 2026 en zullen verschuiven — precies het soort voorbehoud dat de skill je dwingt op te schrijven.

PROBEER HET ZELF

Het hele experiment is in tien minuten te herhalen: installeer de skill, kies een willekeurige vraag met controleerbare cijfers, voer hem twee keer uit, verifieer met de primaire bron. De skill is gratis, MIT-licensed, ~1,500 tokens.

Haal research-discipline op GitHub

FAQ

Heb je de vraag zorgvuldig uitgekozen om het resultaat te sturen? Het was de eerste vraag die we stelden na het publiceren van de skill, gekozen omdat onze eigen catalogusdata hem kon dubbelchecken. De gecontroleerde benchmark met zes vooraf vastgelegde vragen is de systematische versie, en die bevestigt hetzelfde.

Zou een slimmer model de skill overbodig maken? De baseline hier was al een actueel model met volledige webtoegang. Het verschil zat niet in capaciteit — het zat in standaardgedrag. Regels veranderen standaardgedrag.

Waarom klopten bij beide runs de sterrenaantallen, maar had slechts één de ranking goed? Omdat nauwkeurigheid en volledigheid onafhankelijk van elkaar kunnen falen. Elk getal dat de baseline noemde was echt; de fout zat in wat hij nooit had opgezocht. Dat is de gevaarlijkste faalmodus in AI-onderzoek: niets in het antwoord ziet er fout uit.

En die +29% aan tokens dan? Combineer het met token-discipline, dat sessieverspilling bij meerstaps-taken met ongeveer 20% terugbrengt. Discipline over wat je leest, discipline over wat je beweert — de twee zijn ontworpen om samen te werken.

★ 9.6/10 × 3

Het gratis starterspakket

De 3 skills met onze hoogste testscores plus de installatiechecklist — de setup die wij op een verse machine zouden zetten. Gratis, per e-mail.

Eén e-mail met het pakket + een korte wekelijkse digest met nieuwe testresultaten. Uitschrijven kan altijd.