Samme spørsmål, samme modell: AI-research før/etter

Samme spørsmål, samme modell: AI-research før/etter

En time etter vi publiserte research-discipline, kjørte vi eksperimentet du egentlig vil se: ikke en kuratert benchmark, men ett enkelt spørsmål, stilt to ganger, med svarene sjekket i full åpenhet. Denne artikkelen er hele protokollen — hva vi spurte om, hva hver kjøring gjorde, og hvert verifiseringssteg — så du kan kjøre den selv.

Oppsettet

Spørsmålet. «Hvilke Claude Code-skills er mest populære akkurat nå? Nevn de fem mest stjernemerkede skill-repoene på GitHub, med gjeldende antall. Hvordan står Anthropics offisielle repo seg mot fellesskapets egne?» — et spørsmål med et objektivt sjekkbart svar som endrer seg ukentlig, altså akkurat der AI-research stille og rolig råtner.

De to kjøringene. Identiske Claude Sonnet-agenter, identisk prompt, identiske verktøy (websøk, web fetch, shell). Én forskjell: den andre agenten leste først SKILL.md fra en kopi av research-discipline installert slik enhver bruker ville installert den —

git clone https://github.com/Skillproofdev/research-discipline ~/.claude/skills/research-discipline

Det er hele inngripenen: rundt 1500 tokens med regler modellen leser før den går i gang.

Dommeren. Da begge svarene var inne, hentet vi stjernetallet for hvert repo som ble nevnt i noen av svarene — pluss kandidatene ingen av dem nevnte — rett fra GitHub-APIet, den eneste autoriteten på sine egne tall. Ingen LLM som dommer her, bare gh api repos/<owner>/<repo>.

Det som kom tilbake

Det reelle topp-5 av skill-repoer etter stjerner, og hvilke av dem baseline-researchen bommet på

Baseline-svaret ser flott ut. Fem repoer, troverdige beskrivelser, stjernetall stemmende på siffernivå, en selvsikker oppsummering til slutt. Hadde vi ikke sjekket, hadde vi sendt det rett ut.

Det er feil på den måten som teller. Det reelle topp-5, verifisert mot det levende APIet, inneholder tre repoer baseline aldri fant fram til — med 228k, 190k og 164k stjerner. De er ikke obskure: hvert av dem er større enn tre av de fem repoene baseline faktisk nevnte. Sluttpåstanden dens, «Anthropics offisielle repo er kun forbigått av Superpowers», er usann — det offisielle repoet ligger på femteplass. Ingenting baseline skrev var oppdiktet; hvert tall den ga var reelt. Den svarte bare på et annet spørsmål: «hvilke repoer snakker blogginnlegg om?» — fordi de seks verktøykallene dens var websøk, og søkeresultater er en popularitetskonkurranse for dekning, ikke for stjerner.

Skill-kjøringen svarte på spørsmålet som faktisk ble stilt. Den første regelen dens — bevis er levende; hukommelse og førstesides søkeresultater er spor, ikke bevis — dyttet den fra å google til å kartlegge fullstendig: den spurte GitHub-APIet direkte og feide gjennom tre GitHub-emnelister (agent-skills, claude-skills, claude-code-skills) for å sikre at ingenting stort gjemte seg utenfor bloggosfæren. Alle fem tallene dens stemte med det levende APIet da vi sjekket på nytt. Den gjorde også to ting ingen ba om, men som en grundig researcher ville gjort: den skilte faktiske skill-repoer fra kuraterte lenkelister (baseline blandet dem), og den festet to usikkerhetsflagg — ett som påpekte at flere topp-repoer bare er noen måneder gamle med uvanlig rask stjernevekst ([unverified] om det er organisk), ett som innrømmet at en påstand om markedsplass sporet tilbake til én enkelt blogg ([single-source]). Begge flaggene tålte gransking.

Metoden, i klartekst

Baseline mot skill-kjøring: verktøykall, oppførsel og tokenkostnad

Hvorfor endrer en tekstfil oppførsel så mye? Fordi feilen den retter opp i ikke er uvitenhet — baseline-modellen vet at GitHub har et API — det er standardvanen med å svare ut fra det som dukker opp først. Skillen gjør god praksis om fra «noe modellen kanskje gjør» til «noe modellen må gjøre før den får lov til å påstå noe»:

  1. Regel 1 (levende bevis) tvang fram datostempelet og API-kallene i stedet for å stole på søkeutdrag.
  2. Regel 3 (uavhengige kilder) er grunnen til at emnefeiingene skjedde — én søkevei er ikke nok for en bærende «topp 5»-påstand.
  3. Regel 5 (uverifisert betyr å si uverifisert) ga de to flaggene i stedet for stillferdig selvsikkerhet.
  4. Regel 7 (angrip din egen konklusjon) er grunnen til at den lette etter repoer som ville velte egen rangering — og fant dem.

De ærlige kostnadene, samme som vår kontrollerte benchmark fant: den disiplinerte kjøringen brukte 11 verktøykall mot 6, og 64 445 tokens mot 49 988 — +29 % på denne oppgaven. Verifisering er ikke gratis. Den er bare mye billigere enn å ta selvsikkert feil i et dokument noen handler ut fra.

Det dette ikke beviser

Ett spørsmål er en anekdote, ikke en benchmark — den kontrollerte versjonen med seks spørsmål og påstandsnivå-verifisering (13,0 % → 5,4 % feilaktige påstander) er beviset; dette er demonstrasjonen. Skillen er heller ikke et fullstendighetsorakel: i den kontrollerte kjøringen prissatte den én leverandørs nivå men gikk glipp av et billigere. Og stjernetallene over var sanne 10. juli 2026 og vil endre seg — som, passende nok, er akkurat den typen forbehold skillen tvinger deg til å skrive.

PRØV DET SELV

Hele eksperimentet er reproduserbart på ti minutter: installer skillen, velg et hvilket som helst spørsmål med sjekkbare tall, kjør det to ganger, verifiser mot primærkilden. Skillen er gratis, MIT-lisensiert, rundt 1500 tokens.

Hent research-discipline på GitHub

Ofte stilte spørsmål

Plukket dere spørsmålet med omhu? Det var det første spørsmålet vi kjørte etter å ha publisert skillen, valgt fordi vår egen katalogdata kunne dobbeltsjekke det. Den kontrollerte benchmarken med seks forhåndsregistrerte spørsmål er den systematiske versjonen, og den er enig.

Ville en smartere modell gjort skillen unødvendig? Baseline her var en moderne modell med full webtilgang. Gapet var ikke evne — det var standardinnstillinger. Regler endrer standardinnstillinger.

Hvorfor fikk begge kjøringene riktige stjernetall, men bare den ene riktig rangering? Fordi nøyaktighet og fullstendighet svikter uavhengig av hverandre. Hvert tall baseline oppga var reelt; feilen lå i det den aldri lette etter. Det er den farligste feilmodusen i AI-research: ingenting i svaret ser feil ut.

Hva med de +29 % tokens? Kombiner det med token-discipline, som kutter sesjonssløsing med rundt 20 % på flerstegsarbeid. Disiplin på hva du leser, disiplin på hva du påstår — de to er laget for å kjøre sammen.

★ 9.6/10 × 3

Den gratis startpakken

De 3 skillsene med våre høyeste testscorer pluss installasjonssjekklisten — oppsettet vi selv ville lagt på en fersk maskin. Gratis, på e-post.

Én e-post med pakken + en kort ukentlig oppsummering av nye testresultater. Meld deg av når du vil.