Samma fråga, samma modell, en skill: AI-research live

Samma fråga, samma modell, en skill: AI-research live

En timme efter att vi publicerade research-discipline körde vi experimentet du egentligen vill se: inte ett kurerat benchmark, utan en enda levande fråga, ställd två gånger, med svaren kontrollerade i offentlighet. Den här artikeln är hela protokollet — vad vi frågade, vad varje körning gjorde och varje verifieringssteg — så att du kan köra om det själv.

Upplägget

Frågan. "Vilka är de mest populära Claude Code-skillsen just nu? Namnge de fem populäraste skill-repona på GitHub efter antal stjärnor, med aktuella siffror. Hur står sig Anthropics officiella repo mot communityns?" — en fråga med ett objektivt kontrollerbart svar som ändras varje vecka, precis där AI-research tyst ruttnar.

De två körningarna. Identiska Claude Sonnet-agenter, identisk prompt, identiska verktyg (webbsökning, webbhämtning, shell). En skillnad: den andra agenten läste först SKILL.md från en kopia av research-discipline installerad precis som vilken användare som helst skulle installera den —

git clone https://github.com/Skillproofdev/research-discipline ~/.claude/skills/research-discipline

Det är hela interventionen: ~1 500 tokens regler som modellen läser innan den börjar jobba.

Domaren. När båda svaren var klara hämtade vi stjärnantalet för varje repo som något av svaren nämnde — plus kandidaterna ingen av dem nämnde — direkt från GitHub API, den enda auktoriteten på sina egna siffror. Ingen LLM dömde i den här slingan; bara gh api repos/<owner>/<repo>.

Vad som kom tillbaka

De verkliga topp 5-skill-repona efter stjärnor, och vilka baseline-researchen missade

Baseline-svaret ser bra ut. Fem repon, trovärdiga beskrivningar, stjärnantal som stämmer på siffran, självsäker syntes i slutet. Om vi inte hade kontrollerat hade vi skickat det som det var.

Det är fel på det sätt som spelar roll. Den verkliga topp 5:an, verifierad mot den levande API:n, innehåller tre repon som baseline aldrig hittade — med 228k, 190k och 164k stjärnor. De är inte obskyra: alla tre är större än tre av de fem repon baseline faktiskt nämnde. Slutpåståendet, "Anthropics officiella repo kommer bara efter Superpowers", är falskt — det officiella repot ligger på femte plats. Inget baseline skrev var hittepå; varje siffra den gav var verklig. Den svarade bara på en annan fråga: "vilka repon pratar bloggarna om?" — eftersom dess sex verktygsanrop var websökningar, och sökresultat är en popularitetstävling om synlighet, inte om stjärnor.

Skill-körningen svarade på frågan som faktiskt ställdes. Dess första regel — bevis ska vara levande; minnet och första sidan av sökresultat är ledtrådar, inte bevis — knuffade den från googlande till uppräkning: den frågade GitHub API direkt och svepte igenom tre GitHub-ämneslistor (agent-skills, claude-skills, claude-code-skills) för att säkerställa att inget stort gömde sig utanför bloggosfären. Alla dess fem siffror stämde med den levande API:n när vi kontrollerade igen. Den gjorde också två saker ingen bad om men en noggrann researchare skulle göra: den skilde faktiska skill-repon från kurerade länklistor (baseline blandade ihop dem), och den satte två osäkerhetsflaggor — en som noterade att flera av topprepona bara är några månader gamla med ovanligt snabb stjärntillväxt ([unverified] om det är organiskt), en som medgav att ett marknadsplatspåstående spårades till ett enda blogginlägg ([single-source]). Båda flaggorna höll för granskning.

Metoden, i detalj

Baseline mot skill-körning: verktygsanrop, beteende och tokenkostnad

Varför ändrar en textfil beteendet så mycket? För att felet den riktar in sig på inte är okunskap — baseline-modellen vet att GitHub har ett API — det är standardvanan att svara utifrån det som dyker upp först. Skillen omvandlar god praxis från "något modellen kanske gör" till "något modellen måste göra innan den får påstå något":

  1. Regel 1 (levande bevis) tvingade fram datumstämpeln och API-anropen i stället för att lita på sökutdrag.
  2. Regel 3 (oberoende källor) är anledningen till att ämnessvepningarna hände — en enda sökväg räcker inte för ett bärande "topp 5"-påstående.
  3. Regel 5 (overifierat betyder att säga overifierat) gav de två flaggorna i stället för tyst självsäkerhet.
  4. Regel 7 (attackera din egen slutsats) är anledningen till att den letade efter repon som skulle bryta sin egen rankning — och hittade dem.

De ärliga kostnaderna, samma sak som vårt kontrollerade benchmark visade: den disciplinerade körningen använde 11 verktygsanrop mot 6, och 64 445 tokens mot 49 988 — +29% på den här uppgiften. Verifiering är inte gratis. Den är bara mycket billigare än att vara självsäkert fel i ett dokument någon agerar utifrån.

Vad det här inte bevisar

En fråga är en anekdot, inte ett benchmark — den kontrollerade sexfrågeversionen med verifiering på påståendenivå (13.0% → 5.4% felaktiga påståenden) är beviset; det här är demonstrationen. Skillen är inte heller något fullständighetsorakel: i den kontrollerade körningen prissatte den en gång en leverantörsnivå och missade en billigare. Och stjärnantalen ovan stämde den 10 juli 2026 och kommer att förändras — vilket, passande nog, är exakt den typen av brasklapp skillen tvingar dig att skriva.

PROVA SJÄLV

Hela experimentet går att upprepa på tio minuter: installera skillen, välj en fråga med kontrollerbara siffror, kör den två gånger, verifiera mot primärkällan. Skillen är gratis, MIT-licensierad, ~1 500 tokens.

Hämta research-discipline på GitHub

Vanliga frågor

Plockade ni ut frågan selektivt? Det var den första frågan vi körde efter att skillen publicerades, vald för att vår egen katalogdata kunde dubbelkolla den. Det kontrollerade benchmarket med sex förregistrerade frågor är den systematiska versionen, och den håller med.

Skulle en smartare modell göra skillen onödig? Baseline här var en aktuell modell med full webbåtkomst. Gapet handlade inte om förmåga — det handlade om standardinställningar. Regler ändrar standardinställningar.

Varför fick båda körningarna rätt stjärnantal men bara en rätt rankning? För att korrekthet och fullständighet brister oberoende av varandra. Varje siffra baseline citerade var verklig; felet låg i det den aldrig letade efter. Det är det farligaste felläget inom AI-research: inget i svaret ser fel ut.

Vad händer med de +29% i tokens? Kombinera den med token-discipline, som skär ner sessionsspill med ungefär 20% på flerstegsarbete. Disciplin i vad du läser, disciplin i vad du påstår — de två är designade att köras tillsammans.

★ 9.6/10 × 3

Gratis startpaket

De 3 skills som fått våra högsta testbetyg plus installationschecklistan — setupen vi själva skulle lägga på en ny maskin. Gratis, via e-post.

Ett mejl med paketet + en kort veckosammanfattning av nya testresultat. Avsluta prenumerationen när du vill.