Samme spørgsmål, samme model, én skill: research før/efter

Samme spørgsmål, samme model, én skill: research før/efter

En time efter vi udgav research-discipline, kørte vi det eksperiment, du faktisk ville have set: ikke et kurateret benchmark, men ét enkelt live-spørgsmål, stillet to gange, med svarene tjekket i fuld offentlighed. Denne artikel er hele protokollen — hvad vi spurgte om, hvad hver kørsel gjorde, og hvert verifikationstrin — så du kan gentage den selv.

Opsætningen

Spørgsmålet. "Hvad er de mest populære Claude Code-skills lige nu? Nævn de fem mest stjernede skill-repositories på GitHub, med aktuelle tal. Hvordan klarer Anthropics officielle repo sig sammenlignet med community-repos?" — et spørgsmål med et objektivt kontrollerbart svar, der ændrer sig hver uge, hvilket er præcis der, hvor AI-research rådner stille og roligt.

De to kørsler. Identiske Claude Sonnet-agenter, identisk prompt, identiske værktøjer (websøgning, web fetch, shell). Én forskel: den anden agent læste først SKILL.md fra en kopi af research-discipline, installeret på den måde enhver bruger ville installere den —

git clone https://github.com/Skillproofdev/research-discipline ~/.claude/skills/research-discipline

Det er hele interventionen: ~1,500 tokens med regler, som modellen læser, før den går i gang.

Dommeren. Da begge svar var kommet retur, hentede vi stjernetallet for hvert repository, som et af svarene nævnte — plus kandidaterne, ingen af dem nævnte — direkte fra GitHub API'et, den eneste autoritet på sine egne tal. Ingen LLM-bedømmelse i loopet denne gang; kun gh api repos/<owner>/<repo>.

Det, der kom retur

De reelle top-5 skill-repos efter stjerner, og hvilke af dem baseline-researchen overså

Baseline-svaret ser fantastisk ud. Fem repositories, troværdige beskrivelser, stjernetal præcise til sidste ciffer, selvsikker syntese til sidst. Havde vi ikke tjekket, havde vi sendt det ud som det var.

Det er forkert på den måde, der betyder noget. Den reelle top-5, verificeret mod det live API, indeholder tre repositories, som baseline aldrig fandt frem til — med 228k, 190k og 164k stjerner. De er ikke obskure: hver af dem er større end tre af de fem repos, baseline rent faktisk nævnte. Dens afsluttende påstand, "Anthropics officielle repo er kun overgået af Superpowers," er falsk — det officielle repo ligger på en femteplads. Intet i baseline-svaret var opdigtet; hvert tal, det gav, var reelt. Det besvarede bare et andet spørgsmål: "hvilke repos taler blogindlæg om?" — fordi dets seks værktøjskald var websøgninger, og søgeresultater er en popularitetskonkurrence om dækning, ikke om stjerner.

Metoden, sort på hvidt

Baseline vs. skill-kørsel: værktøjskald, adfærd og tokenforbrug

Hvorfor ændrer en tekstfil adfærden så meget? Fordi den fejl, den retter op på, ikke er uvidenhed — baseline-modellen ved godt, at GitHub har et API — det er standardvanen med at svare ud fra, hvad der dukker op først. Skillen gør god praksis fra "noget modellen måske gør" til "noget modellen skal gøre, før den må konkludere noget som helst":

  1. Regel 1 (live evidens) tvang datostemplet og API-kaldene igennem i stedet for at stole på søgeuddrag.
  2. Regel 3 (uafhængige kilder) er grunden til, at emne-gennemgangene fandt sted — én søgevej er ikke nok til en bærende "top 5"-påstand.
  3. Regel 5 (uverificeret betyder, at man siger uverificeret) frembragte de to flag i stedet for tavs selvsikkerhed.
  4. Regel 7 (angrib din egen konklusion) er grunden til, at den gik på jagt efter repos, der ville vælte sin egen rangering — og fandt dem.

De ærlige omkostninger, samme mønster som vores kontrollerede benchmark fandt: den disciplinerede kørsel brugte 11 værktøjskald mod 6, og 64,445 tokens mod 49,988 — +29% på denne opgave. Verifikation er ikke gratis. Den er bare langt billigere end at være selvsikkert forkert i et dokument, nogen handler ud fra.

Hvad det her ikke beviser

Ét spørgsmål er en anekdote, ikke et benchmark — den kontrollerede seks-spørgsmåls-version med verifikation på påstandsniveau (13.0% → 5.4% forkerte påstande) er beviset; det her er demonstrationen. Skillen er heller ikke et orakel for fuldstændighed: i den kontrollerede kørsel prissatte den engang ét leverandørniveau og overså et billigere. Og stjernetallene ovenfor var sande den 10. juli 2026 og vil ændre sig — hvilket, meget passende, er præcis den slags forbehold, skillen tvinger dig til at skrive.

PRØV DET SELV

Hele eksperimentet kan gentages på ti minutter: installer skillen, vælg et vilkårligt spørgsmål med kontrollerbare tal, kør det to gange, verificer mod primærkilden. Skillen er gratis, MIT-licenseret, ~1,500 tokens.

Hent research-discipline på GitHub

FAQ

Cherry-pickede I spørgsmålet? Det var det første spørgsmål, vi kørte efter at have udgivet skillen, valgt fordi vores eget katalogdata kunne dobbelttjekke det. Det kontrollerede benchmark med seks forhåndsregistrerede spørgsmål er den systematiske version, og den er enig.

Ville en klogere model gøre skillen overflødig? Baseline her var en aktuel model med fuld webadgang. Kløften lå ikke i kapacitet — den lå i standardindstillinger. Regler ændrer standardindstillinger.

Hvorfor fik begge kørsler stjernetallene rigtige, men kun den ene fik rangeringen rigtig? Fordi præcision og fuldstændighed fejler uafhængigt af hinanden. Hvert tal, baseline citerede, var reelt; fejlen lå i det, den aldrig ledte efter. Det er den farligste fejltype i AI-research: intet i svaret ser forkert ud.

Hvad med de +29% tokens? Kombiner den med token-discipline, som skærer sessionsspild ned med omkring 20% på multi-step-opgaver. Disciplin i det, du læser, disciplin i det, du hævder — de to er designet til at køre sammen.

★ 9.6/10 × 3

Den gratis startpakke

De 3 skills med vores højeste testscorer plus installations-tjeklisten — det setup, vi selv ville lægge på en frisk maskine. Gratis, på mail.

Én mail med pakken + et kort ugentligt overblik over nye testresultater. Afmeld når som helst.