
Hvorfor halvparten av Claude-skills ikke virker
Hvis du søkte etter "claude skill fungerer ikke," her er kortversjonen: det er sannsynligvis ikke deg. Vi installerer og tester hver eneste skill vi lister, på et rent oppsett, etter forfatterens egne instruksjoner, og scorer deretter resultatet mot Claude helt uten skill. Feilmønstrene er så konsistente at vi nå kan rangere dem etter hyppighet.
Den lange versjonen har tall, og hvert eneste ett er beregnet fra våre offentlige testdata. Katalogen vår har for øyeblikket 73 skills. 45 har vært gjennom hele protokollen; 28 står fortsatt i testkøen. Av de 45 testede fikk 35 en ren godkjenning. De andre 10, eller 22 %, fikk dommen "fungerer med oppsett," som betyr at skillen slik den ble levert ikke virket, og vi måtte gripe inn: installere en manglende avhengighet, koble opp en MCP-forbindelse, eller fylle inn konfigurasjon README aldri nevnte. På tvers av hele katalogen gir det 35 av 73 skills, 48 %, med dommen "testet, fungerer" i dag. Litt under halvparten. Derav tittelen.
Og det underdriver problemet, for de 45 testede skillsene er allerede overlevere. Krypperen vår sveiper GitHub hver 12. time og har registrert 267 repositorier i oppdagelseskøen. Skills som er forlatt, duplisert eller åpenbart ødelagt blir kuttet ved triage og når aldri en scoret test. Feilmønstrene under er det vi finner i skills som er gode nok til å være verdt å teste.
Tallene, før historiefortellingen
Vår score er 25 poeng fordelt på fire kriterier: installerer rent (5), trigger pålitelig (5), output vs. baseline (10), dokumentasjon og ærlighet (5), normalisert til en score ut av 10. Slik gjorde 45 testede skills det på hvert kriterium:
| Kriterium | Perfekt score | Trekk på minst ett poeng | Scoret 3/5 eller dårligere |
|---|---|---|---|
| Installerer rent (/5) | 34 av 45 | 11 (24 %) | 8 (18 %) |
| Trigger pålitelig (/5) | 14 av 45 | 31 (69 %) | 0 |
| Output vs. baseline (/10) | 2 av 45 på 10 | — | 5 lå på 7/10-gulvet |
| Dokumentasjon og ærlighet (/5) | 5 av 45 | 40 (89 %) | 12 (27 %) |
Ikke én eneste skill av de 45 fikk perfekt 25. Totalscorene ligger fra 6,8 til 9,6 av 10, med en median på 8,4, og 9 av de 45 ligger under 8,0. De fire feilmodusene tilsvarer tabellens fire rader.
Feilmodus 1: triggerbeskrivelsen som aldri utløser
Dette er den mest utbredte svakheten i dataene våre. Bare 14 av 45 testede skills, 31 %, fikk perfekt 5/5 på "trigger pålitelig." De andre 31 utløses ustabilt: de bommer på formuleringer de burde fange opp, eller de aktiveres på urelatert arbeid. Legg merke til nullen i tabellens siste kolonne, derimot. Ingen testet skill scoret under 4/5 på triggering, og det er overlevelsesskjevhet, ikke kvalitet. En skill hvis trigger er fullstendig død blir fanget opp ved triage og får aldri en score. De som når frem til testing bommer bare litt.
Mekanismen er lite glamorøs. Når du sender en prompt, avgjør Claude om skillen skal lastes basert på én ting: description-feltet i SKILL.md-frontmatteren. Ikke README, ikke koden, ikke de 400 linjene med gjennomtenkte instruksjoner under frontmatteren. Hvis beskrivelsen ikke kobler ordene dine til skillens jobb, ligger skillen i mappen din uten å gjøre noe, og du konkluderer med at Claude-skills ikke virker.
Forfattere fortsetter å skrive dette feltet som om det var en landingsside. To anonymiserte par fra testingen vår, lett omskrevet:
En beskrivelse som aldri utløser:
"Supercharge arbeidsflyten din for innhold med AI-drevet skriveintelligens. Skriv bedre, raskere, smartere."
Samme jobb, skrevet av en skill som scoret 5/5 på triggering:
"Bruk når brukeren vil opprette, lese eller redigere Word-dokumenter (.docx). Trigger på enhver nevnelse av 'Word-dokument', '.docx', eller en forespørsel om en rapport, memo eller brev som en Word-fil. Ikke bruk for PDF-er eller regneark."
En til, fra datakategorien:
"Din ultimate SQL-assistent for alt innen data."
Versus:
"Bruk når brukeren ber om å skrive, feilsøke eller optimalisere en SQL-spørring, nevner en tabell eller et skjema, eller limer inn en spørringsfeil. Ikke trigger på generelle dataspørsmål uten noen spørring involvert."
Forskjellen handler ikke om skrivetalent. De gode beskrivelsene navngir de eksakte frasene en bruker faktisk ville skrevet, og de sier når skillen ikke skal utløses. I vår protokoll tester vi begge retninger: promptene skillen hevder å håndtere, nærliggende formuleringer, og bevisst urelaterte forespørsler. De fleste 4/5-scorene kommer fra skills som består den første sjekken og snubler på den andre eller tredje.
Du kan sjekke dette før du installerer noe som helst. SKILL.md er vanlig markdown, lesbar på GitHub. Hvis beskrivelsen kunne fungert som en reklameplakat, vil skillen underprestere. Hvis du feilsøker din egen, lim den inn i vår gratis skill-validator, som flagger markedsføringsspråk-beskrivelser sammen med strukturelle problemer.
Feilmodus 2: installasjonsråte
Alle våre 10 "fungerer med oppsett"-dommer er installasjonsfeil av ett eller annet slag. Mønsteret vises tydelig i scorene: skills som besto uten videre scorer i snitt 4,97 av 5 på installasjon. Skills med oppsett-dom scorer i snitt 3,2.
Hva som faktisk gikk galt, fra testnotatene våre:
- Udeklarerte skill-avhengigheter. En faktura-ekstraheringsskill som stille krever at PDF-skillen er installert først for skannede dokumenter, pluss en énlinjes lokalitetsendring for europeiske datoformater som README ikke nevner. Output var genuint god (8/10) når vi først fant ut av det. Det å finne ut av det tok en hel kveld.
- Udeklarerte tjenesteavhengigheter. En planleggingsskill som kun er rådgivende inntil du kobler til en kalender-MCP. En innboks-triage-skill som trenger Gmail eller Outlook koblet opp. En metrikk-skill som forutsetter at en analyse-eksport eksisterer. Ingen av disse er urimelige krav. Alle hører hjemme på første linje i README, ikke i en supportsak.
- Feil mappedybde. Klassikeren. Instruksjoner som legger skillen på
skills/name/name/SKILL.md, ett nivå for dypt, hvor Claude aldri finner den. Skillen "installeres" uten feilmelding og utløses så aldri, noe som sender deg på jakt etter feilmodus 1 når det egentlige problemet er en filsti. - Instruksjoner skrevet for en eldre Claude Code. Git-workflow er et mildt tilfelle: commits og branch-håndtering fungerer umiddelbart, men den interaktive rebase-veiledningen forutsetter funksjoner Claude Code bevisst blokkerer, så de stegene må du kjøre manuelt selv.
Ett ærlig unntak verdt å nevne: brand-guidelines har en oppsett-dom fordi den er ubrukelig inntil du fyller inn din egen merkevarepalett og tone, og den sier det rett ut. Oppsett med hensikt er greit. Oppsett ved utelatelse er feilmodusen.
Tegnet, før du installerer: en README hvis installasjonsseksjon er én vag linje. Sammenlign det med installasjonsblokken på en skill som scoret 5/5, som DOCX. Spesifikke kommandoer, spesifikke filstier, forutsetninger klart angitt. Den er to linjer lang fordi to linjer er alt en fungerende installasjon trenger.
Feilmodus 3: skillen utløses og ingenting blir bedre
Den mest subtile feilen, og grunnen til at vår scoring vekter output vs. baseline med 10 av 25 poeng, dobbelt så mye som noe annet kriterium. Testen er brutal: vi kjører samme reelle oppgave to ganger, én gang med skillen installert og én gang uten, og sammenligner. En skill må slå naken Claude, ellers har den ingen grunn til å oppta kontekst.
Gulvet i vårt testede utvalg er 7/10, og fem skills ligger nøyaktig der. Det betyr at selv blant skills som består, leverer omtrent hver niende en forbedring du ville trengt en side-om-side-sammenligning for å legge merke til. Under 7 overlever ikke skills til en oppføring, og oppdagelseskøen er full av kandidater i det området: "skriveforbedrings"-skills i kategorier hvor grunnmodellen allerede er sterk, og skills som bare er en systemprompt som i praksis sier vær utmerket.
Bare to skills fikk 10/10 på output, og de viser hvordan en opptjent forbedring ser ut. Frontend-design fikk samme landingsside-brief med og uten skillen; versjonen med skill hadde en ekte typografiskala og en bevisst fargepalett, og ingen av neon-gradient-tegnene som kjennetegner standard output. Humanizer fjernet tankestrek-overforbruk og "delve"-klasse-vokabular fra AI-utkast grundig nok til at to redaktører ikke pålitelig kunne flagge resultatet som AI-assistert. Nitten av 45 skills scoret 9 eller bedre på output. Skill-konseptet fungerer. Det bare fungerer ikke automatisk.
GRATIS STARTPAKKE
De 3 skillsene i vår gratis startpakke slår alle baseline i testing, som er terskelen de fleste ikke klarer. Vi sender dem til deg med installasjonssjekklisten vi bruker på hver eneste test. Gratis.
Få den gratis startpakkenFeilmodus 4: README skriver sjekker skillen ikke kan innløse
Dokumentasjon og ærlighet er det svakeste kriteriet i hele datasettet. Fem av 45 skills scoret 5/5. Førti mistet poeng, og 12 scoret 3/5. For å gjenta: den mediane testede skillen har bedre output enn dokumentasjon.
Hva som koster poeng her, i rekkefølge etter hvor ofte vi ser det:
- Løfter testen motsier. En README som hevder "fungerer med alle fakturaformater" mens skillen trenger en lokalitetsinnstilling for ikke-amerikanske datoer. En "full git-automatisering"-pitch på en skill som ikke kan utføre interaktive rebaser i Claude Code i det hele tatt. Vi behandler ikke dette som løgn, vanligvis. Vi behandler det som forfattere som dokumenterer skillen de hadde tenkt å skrive, fremfor den de faktisk skrev.
- Manglende forutsetninger. Hver udeklarert avhengighet fra feilmodus 2 er også en dokumentasjonsfeil, som er grunnen til at oppsett-dom-skills i snitt scorer 3,4/5 på dokumentasjon mens rene godkjenninger scorer 3,97.
- Taushet om atferd du ville ønsket å kjenne til. Om skillen ringer hjem, hva den gjør med filinnholdet ditt, hvilke modellversjoner den er skrevet mot. Sjeldne, men alvorlige tilfeller, skjulte nettverkskall eller instruksjoner formet som prompt-injeksjon gjemt midt i filen, er grunnen til at dette kriteriet finnes i det hele tatt. Vi leser hver SKILL.md vi lister, fra topp til bunn. Du bør gjøre det samme for alt utenfor en testet katalog.
Vi har ikke kjørt regresjonen, men den uformelle observasjonen holder på tvers av 45 tester: README-merkeantall og installasjonsseksjon-kvalitet beveger seg i motsatte retninger.
Hva toppsjiktet gjør annerledes
Seks skills, 13 % av alt vi har testet, deler toppscoren 9,6/10: DOCX, skill-creator og frontend-design fra Anthropics offisielle repo, test-driven-development og systematic-debugging fra Jesse Vincents superpowers-samling, og humanizer fra fellesskapet. Ytterligere seks, inkludert xlsx, pdf og sql-queries, ligger på 9,2. Det toppsjiktet har til felles er sjekkbart:
Perfekte installasjoner og perfekte triggere, uten unntak. Alle seks scoret 5/5 på begge. Uansett hvilken kreativ energi som gikk inn i disse skillsene, ble ingen av den brukt på beskrivelsen; de leser som spesifikasjoner, med eksplisitte triggerfraser og eksplisitte unntak.
Avgrenset til det grunnmodellen er dårlig på. Claude trenger ikke en skill for å skrive prosa. Den trenger derimot en for å produsere en ekte .docx med stiler og sporede endringer, eller for å slutte å "fikse" en race condition ved å gjette. Systematic-debugging fikk sin score på en bug Claude tidligere hadde "fikset" tre ganger uten å faktisk fikse den én gang; skillens hypotese-test-verifiser-løkke satte en stopper for gjettingen. Hver toppscorer treffer et gap du kan navngi i én setning.
Dokumentasjon som underselger. Den laveste dokumentasjonsscoren blant de seks er en 4. READMEene deres angir forutsetninger og innrømmer begrensninger; adjektiver er sjeldne. Det viser seg at forfatterne som tester sine egne installasjonsinstruksjoner, også skriver beskrivelser som trigger. Håndverk korrelerer med seg selv.
Også verdt å merke seg: pedigré hjelper, men avgjør ikke. Ti av de elleve Anthropic-forfattede skillsene vi testet besto rent, og unntaket er oppsett med hensikt. Men en tredjedel av toppsjiktet er én enkelt fellesskapsforfatter som brydde seg, og mange fellesskapsskills overgår offisielle i sin kategori. Det mest stjernemerkede repositoriet i oppdagelseskøen vår har over 85 000 stjerner og fortsatt ingen dom, fordi stjerner ikke er en test.
Hvis du skal velge skills
Bruk testede. Det er en egeninteressert setning på et nettsted hvis hele produkt er å teste skills, så her er resonnementet du kan sjekke selv: de fire feilmodusene over er usynlige i en GitHub-oppføring. Stjerneantall måler markedsføringsrekkevidde. En README måler forfatterens optimisme. Den eneste måten å vite om en skill slår baseline er å kjøre baselinen, noe som tar oss omtrent en kveld per skill, ganger 45 så langt.
Start med de beste skillsene fra 2026 for tverrkategori-rangeringen, eller gå rett til din kategori, for eksempel de beste kodeskillsene. Hver oppføring lenker til testnotatene sine, inkludert løsningene for skills som trenger dem.
SKILLPROOF-PAKKE
Optimizer Pack er hvordan det testede sjiktet ser ut i praksis: fire effektivitetsskills som besto hele protokollen, ferdigkonfigurert slik at installasjonsfeilene over ikke kan skje. Spar kvelden med sortering.
Få Optimizer Pack — $10Hvis du skal skrive en
Feilmodusene fungerer som en sjekkliste, og tre av de fire er billige å unngå.
Skriv beskrivelsen som en triggerspesifikasjon: frasene en bruker faktisk ville skrevet, pluss hva skillen skal ignorere. Test deretter installasjonsinstruksjonene på en maskin som ikke er din egen, eller i det minste i en ny mappe, og deklarer hver avhengighet, inkludert andre skills og MCP-forbindelser. Kjør vår skill-validator før du publiserer; den fanger opp de strukturelle problemene og reklameplakat-beskrivelsesproblemet på sekunder. For hele gjennomgangen, fra frontmatter til publisering, se hvordan skrive din egen Claude-skill.
Den fjerde feilmodusen, å slå baseline, er den som krever ekte tankearbeid. Før du skriver noe som helst, kjør målsoppgaven din gjennom Claude uten noen skill. Hvis outputen allerede er fin, har du ikke en skill, du har en readme for en funksjon Claude leveres med. 9,6-sjiktet finnes fordi disse forfatterne fant ekte gap. Ironisk nok er det beste verktøyet for jobben selv en skill: skill-creator satte opp en fungerende intern skill for oss i løpet av én økt, og dens beskrivelsesoptimaliseringssteg forbedret triggering målbart i vår test.
Den ubehagelige delen
Ingenting i disse dataene sier at økosystemet er dårlig. Det sier at økosystemet er ugjennomgått, som er et annet problem med en kjent form. Nettleserutvidelser rundt 2010, npm rundt 2016: en lav terskel for publisering pluss ingen verifiseringslag produserer en katalog hvor medianelementet er middelmådig, de beste elementene er genuint utmerkede, og ingen overflatesignal skiller dem. Skills som stryker på vår installasjonssjekk har hundrevis av stjerner. To av våre seks toppscorere kommer fra repositorier de fleste aldri har hørt om.
Den vanlige korreksjonen kommer til slutt, en blanding av gjennomgangslag og omdømme. Inntil den gjør det, ligger byrden på den som installerer, og tallene over er hva byrden ser ut som: 22 % av testede skills ødelagt slik de ble levert, 69 % med ufullkomne triggere, 89 % med dokumentasjon som mistet poeng. Vi kommer til å fortsette å publisere dataene uansett. Den fulle protokollen og scoringsrubrikken finnes på metodologisiden, og hver figur i denne artikkelen er reproduserbar fra de per-skill testnotatene.
Ofte stilte spørsmål
Hvorfor trigger ikke Claude-skillen min?
Sjekk tre ting i rekkefølge. Først, filstien: SKILL.md må ligge på ~/.claude/skills/<navn>/SKILL.md, ikke ett nivå dypere; en feilplassert skill feiler stille. For det andre, frontmatter-description: hvis den leser som et slagord, har Claude ingenting å matche prompten din mot. Skriv den om til å navngi de eksakte frasene du faktisk skriver, eller kjør den gjennom skill-validatoren. For det tredje, prompt med ord fra beskrivelsen ordrett; hvis det utløser, er beskrivelsens dekning problemet ditt.
Hvordan avgjør dere at en skill "fungerer"?
Ren installasjon på et nytt oppsett etter forfatterens egne instruksjoner, triggersjekker i begge retninger (utløses på hevdede prompts, holder seg stille på urelaterte), og en reell oppgave scoret mot en baseline uten skill, verdt 10 av 25 poeng. Dommer: bestått, fungerer-med-oppsett, eller fortsatt-i-kø. Metodologisiden har rubrikken; hver skill-side har notatene.
Er offisielle Anthropic-skills mer pålitelige enn fellesskapets?
Mer pålitelige i snitt: 10 av de 11 vi testet besto rent, og unntaket (brand-guidelines) krever konfigurasjon med hensikt. Men gjennomsnittet er ikke det interessante tallet. To av våre seks toppscorede skills kommer fra én fellesskapsforfatters repo, og humanizer, en fellesskapsskill, er en av bare to skills som scorer 10/10 på output. Testresultater slår proveniens.
Betyr disse resultatene at jeg bør unngå Claude-skills?
Tvert imot. Det testede sjiktet er stillferdig utmerket: 19 av 45 skills scoret 9 eller bedre på output vs. baseline, og de seks beste er forskjellen mellom Claude som et chattevindu og Claude som et verktøy som produserer ferdig arbeid. Funnet er snevrere enn "skills fungerer ikke." Det er at halvparten av det som er publisert har en svakhet du ikke kan se fra oppføringen, så installer basert på testdata, ikke stjerner.
★ 9.6/10 × 3
Den gratis startpakken
De 3 skillsene med våre høyeste testscorer pluss installasjonssjekklisten — oppsettet vi selv ville lagt på en fersk maskin. Gratis, på e-post.