
Hvorfor halvdelen af Claude skills ikke virker
Har du søgt på "claude skill virker ikke", er den korte version denne: det er nok ikke dig. Vi installerer og tester hver skill, vi lister, på en ren opsætning, efter forfatterens egne instruktioner, og bedømmer derefter resultatet mod Claude helt uden skill. Fejlmønstrene er så konsistente, at vi nu kan rangere dem efter hyppighed.
Den lange version har tal, og hvert eneste er beregnet ud fra vores offentlige testdata. Vores katalog rummer i øjeblikket 73 skills. 45 har været igennem hele protokollen; 28 står stadig i testkøen. Af de 45 testede fik 35 en ren godkendelse. De øvrige 10, eller 22%, fik en "virker med opsætning"-dom, hvilket betyder, at skillen som den blev udgivet ikke virkede, og vi måtte gribe ind: installere en manglende afhængighed, koble en MCP-forbindelse til, eller udfylde konfiguration, README'en aldrig nævnte. På tværs af hele kataloget giver det 35 ud af 73 skills, 48%, med en dom på "testet, virker" i dag. Lidt under halvdelen. Deraf titlen.
Og det underdriver problemet, for de 45 testede skills er allerede overlevere. Vores crawler gennemsøger GitHub hver 12. time og har registreret 267 repositories i opdagelseskøen. Skills, der er forladte, duplikerede eller åbenlyst defekte, bliver sorteret fra ved triage og når aldrig frem til en scoret test. Fejlmønstrene nedenfor er det, vi finder i de skills, der er gode nok til at være værd at teste.
Tallene, før historiefortællingen
Vores score er 25 point fordelt på fire kriterier: installerer rent (5), trigger pålideligt (5), output vs. baseline (10), dokumentation og ærlighed (5), normaliseret til en score ud af 10. Sådan klarede 45 testede skills sig på hvert:
| Kriterium | Perfekt score | Fik trukket mindst ét point | Scorede 3/5 eller derunder |
|---|---|---|---|
| Installerer rent (/5) | 34 ud af 45 | 11 (24%) | 8 (18%) |
| Trigger pålideligt (/5) | 14 ud af 45 | 31 (69%) | 0 |
| Output vs. baseline (/10) | 2 ud af 45 med 10 | — | 5 lå på gulvet på 7/10 |
| Dokumentation & ærlighed (/5) | 5 ud af 45 | 40 (89%) | 12 (27%) |
Ikke én eneste af de 45 skills scorede en perfekt 25. Samlede scorer ligger mellem 6,8 og 9,6 ud af 10, med en median på 8,4, og 9 af de 45 ligger under 8,0. De fire fejltyper svarer til tabellens fire rækker.
Fejltype 1: triggerbeskrivelsen der aldrig affyres
Dette er den mest udbredte defekt i vores data. Kun 14 ud af 45 testede skills, 31%, scorede en perfekt 5/5 på "trigger pålideligt." De øvrige 31 fyrer inkonsekvent: de misser formuleringer, de burde fange, eller de aktiveres på urelateret arbejde. Læg mærke til nullet i tabellens sidste kolonne. Ingen testet skill scorede under 4/5 på triggering, og det er overlevelsesbias, ikke kvalitet. En skill, hvis trigger er helt død, bliver fanget ved triage og når aldrig en score. Dem, der når frem til test, fejlrammer bare.
Mekanismen er uglamourøs. Når du sender en prompt, afgør Claude, om en skill skal loades, ud fra én ting: description-feltet i SKILL.md's frontmatter. Ikke README'en, ikke koden, ikke de 400 linjer omhyggelige instruktioner nedenunder frontmatter. Hvis beskrivelsen ikke forbinder dine ord med skillens opgave, ligger skillen bare i din mappe og gør ingenting, og du konkluderer, at Claude skills ikke virker.
Forfattere bliver ved med at skrive det felt, som var det en landingsside. To anonymiserede par fra vores testning, let omskrevet:
En beskrivelse, der aldrig affyres:
"Supercharge din indholdsworkflow med AI-drevet skriveintelligens. Skriv bedre, hurtigere, smartere."
Samme opgave, skrevet af en skill der scorede 5/5 på triggering:
"Brug når brugeren vil oprette, læse eller redigere Word-dokumenter (.docx). Trigger på enhver nævnelse af 'Word-dokument', '.docx', eller en anmodning om en rapport, et memo eller et brev som Word-fil. Brug ikke til PDF'er eller regneark."
Endnu et, fra datakategorien:
"Din ultimative SQL-assistent til alt inden for data."
Versus:
"Brug når brugeren beder om at skrive, debugge eller optimere en SQL-forespørgsel, nævner en tabel eller et skema, eller indsætter en forespørgselsfejl. Trigger ikke på generelle dataspørgsmål uden nogen forespørgsel involveret."
Forskellen er ikke skrivetalent. De gode beskrivelser navngiver de præcise formuleringer, en bruger ville skrive, og de siger, hvornår skillen ikke skal fyre. I vores protokol tester vi begge retninger: de prompts, skillen hævder at håndtere, tilstødende formuleringer og bevidst urelaterede anmodninger. De fleste 4/5-scorer kommer fra skills, der består det første tjek og snubler på det andet eller tredje.
Du kan tjekke dette, før du installerer noget som helst. SKILL.md er almindelig markdown, læsbar på GitHub. Hvis beskrivelsen kunne fungere som en reklametavle, vil skillen underprestere. Hvis du fejlretter din egen, så indsæt den i vores gratis skill-validator, som flagger marketingsprog-beskrivelser sammen med strukturelle problemer.
Fejltype 2: installationsrust
Alle 10 af vores "virker med opsætning"-domme er installationsfejl af én eller anden art. Mønstret viser sig tydeligt i scorerne: skills, der bestod uden forbehold, scorer i gennemsnit 4,97 ud af 5 på installation. Opsætnings-dom-skillsene scorer i gennemsnit 3,2.
Hvad der faktisk gik galt, fra vores testnotater:
- Uerklærede skill-afhængigheder. En faktura-udtræknings-skill, der stiltiende kræver, at PDF-skillen er installeret først til scannede dokumenter, plus en enkelt linjes lokale-rettelse for europæiske datoformater, som README'en ikke nævner. Output var reelt godt (8/10), da vi fandt ud af det. At finde ud af det tog en hel aften.
- Uerklærede service-afhængigheder. En planlægningsskill, der kun er rådgivende, indtil du forbinder en kalender-MCP. En indbakke-triage-skill, der kræver Gmail eller Outlook koblet til. En metrics-skill, der antager, at en analytics-eksport findes. Ingen af disse er urimelige krav. De hører alle hjemme i README'ens første linje, ikke i en supportsag.
- Forkert mappedybde. Klassikeren. Instruktioner, der efterlader skillen i
skills/navn/navn/SKILL.md, ét niveau for dybt, hvor Claude aldrig finder den. Skillen "installeres" uden fejlmeddelelse og trigger derefter aldrig, hvilket sender dig af sted efter fejltype 1, mens det faktiske problem er en sti. - Instruktioner skrevet til en ældre Claude Code. Git-workflow er et mildt tilfælde: commits og branch-håndtering virker med det samme, men den interaktive rebase-vejledning forudsætter funktioner, Claude Code bevidst blokerer, så de trin er dine at køre manuelt.
Én ærlig undtagelse værd at nævne: brand-guidelines bærer en opsætnings-dom, fordi den er ubrugelig, indtil du udfylder din egen brandpalette og stemme, og den siger det ligeud. Opsætning by design er fint. Opsætning by udeladelse er fejltypen.
Advarselstegnet, før du installerer: en README, hvis installationsafsnit er én vag linje. Sammenlign det med installationsblokken på en skill, der scorede 5/5, som DOCX. Specifikke kommandoer, specifikke stier, forudsætninger angivet. Den er to linjer lang, fordi to linjer er alt, en fungerende installation kræver.
Fejltype 3: skillen affyres, og intet forbedres
Den mest subtile fejl, og grunden til at vores scoring vægter output vs. baseline med 10 ud af 25 point, dobbelt så meget som noget andet kriterium. Testen er ligeud: vi kører den samme rigtige opgave to gange, én gang med skillen installeret og én gang uden, og sammenligner. En skill skal slå nøgen Claude, ellers har den ingen grund til at optage plads i konteksten.
Gulvet i vores testede sæt er 7/10, og fem skills ligger præcis der. Det betyder, at selv blandt skills, der består, leverer omtrent én ud af ni en forbedring, du ville skulle have en side-om-side-sammenligning for at bemærke. Under 7 overlever skills ikke til en liste, og opdagelseskøen er fuld af kandidater i det interval: "skrive-forbedrings"-skills i kategorier, hvor grundmodellen allerede er stærk, og skills, der bare er en systemprompt, der i praksis siger: vær fremragende.
Kun to skills fik 10/10 på output, og de viser, hvordan en fortjent forskel ser ud. Frontend-design fik den samme landing-page-brief med og uden skillen; med-skill-versionen havde en reel typeskala og en bevidst palette, og ingen af de neon-gradient-tegn, der kendetegner standardoutput. Humanizer strippede em-dash-overforbrug og "delve"-klasse-ordforråd fra AI-udkast så grundigt, at to redaktører ikke pålideligt kunne flagge resultatet som AI-assisteret. Nitten ud af 45 skills scorede 9 eller bedre på output. Skill-konceptet virker. Det virker bare ikke automatisk.
GRATIS STARTPAKKE
De 3 skills i vores gratis startpakke slår alle baseline i testning, hvilket er den bar, de fleste ikke når. Vi sender dem til dig sammen med den installationstjekliste, vi bruger ved hver test. Gratis.
Få den gratis startpakkeFejltype 4: README'en skriver checks, skillen ikke kan indfri
Dokumentation og ærlighed er det svageste kriterium i hele datasættet. Fem ud af 45 skills scorede 5/5. Fyrre tabte point, og 12 scorede 3/5. Gentaget: den mediane testede skill har bedre output end dokumentation.
Hvad der koster point her, i den rækkefølge, vi ser det oftest:
- Løfter, testen modsiger. En README, der hævder "virker med ethvert fakturaformat," mens skillen kræver en lokale-indstilling for ikke-amerikanske datoer. En "fuld git-automation"-pitch på en skill, der slet ikke kan udføre interaktive rebases i Claude Code. Vi behandler ikke det som løgn, som regel. Vi behandler det som forfattere, der dokumenterer den skill, de havde til hensigt at skrive, snarere end den, de skrev.
- Manglende forudsætninger. Enhver uerklæret afhængighed fra fejltype 2 er også en dokumentationsfejl, hvorfor opsætnings-dom-skills scorer i gennemsnit 3,4/5 på dokumentation, mens rene godkendelser scorer i gennemsnit 3,97.
- Tavshed om adfærd, du ville ønske at vide. Om skillen ringer hjem, hvad den gør med dit filindhold, hvilke modelversioner den er skrevet mod. Sjældne, men alvorlige tilfælde, skjulte netværkskald eller prompt-injection-formede instruktioner begravet midt i filen, er hvorfor dette kriterium overhovedet findes. Vi læser hver SKILL.md, vi lister, fra start til slut. Det bør du også gøre med alt fra uden for et testet katalog.
Vi har ikke kørt regressionen, men den uformelle observation holder på tværs af 45 tests: README-badge-antal og installationsafsnittets kvalitet bevæger sig i modsatte retninger.
Hvad topklassen gør anderledes
Seks skills, 13% af alt, vi har testet, deler topscoren på 9,6/10: DOCX, skill-creator, og frontend-design fra Anthropics officielle repo, test-driven-development og systematic-debugging fra Jesse Vincents superpowers-samling, og humanizer fra fællesskabet. Seks andre, inklusive xlsx, pdf og sql-queries, ligger på 9,2. Hvad topklassen har til fælles, kan tjekkes:
Perfekte installationer og perfekte triggere, uden undtagelse. Alle seks scorede 5/5 på begge. Uanset hvilken kreativ energi der gik i disse skills, blev ingen af den brugt på beskrivelsen; de læser som specifikationer, med eksplicitte triggerfraser og eksplicitte undtagelser.
Afgrænset til det, grundmodellen er dårlig til. Claude behøver ikke en skill for at skrive prosa. Den har brug for én til at producere en reel .docx med stilarter og sporede ændringer, eller til at stoppe med at "fikse" en race condition ved at gætte. Systematic-debugging optjente sin score på en fejl, Claude tidligere havde "fikset" tre gange uden at fikse den én gang; skillens hypotese-test-verificer-loop stoppede gætteriet. Hver topscorer rammer et hul, du kan navngive i én sætning.
Dokumentation der underdriver. Den laveste dokumentationsscore blandt de seks er en 4. Deres README'er angiver forudsætninger og indrømmer begrænsninger; adjektiver er få. Det viser sig, at forfattere, der tester deres egne installationsinstruktioner, også skriver beskrivelser, der trigger. Håndværk korrelerer med sig selv.
Værd at bemærke også: herkomst hjælper, men afgør ikke. Ti ud af de elleve Anthropic-forfattede skills, vi testede, bestod rent, og undtagelsen er opsætning by design. Men en tredjedel af topklassen er én community-forfatter, der brød sig om det, og masser af community-skills overgår officielle i deres kategori. Det mest stjernemarkerede repository i vores opdagelseskø har over 85.000 stjerner og stadig ingen dom, for stjerner er ikke en test.
Hvis du vælger skills
Brug testede. Det er en selvbetjenende sætning på et site, hvis hele produkt er at teste skills, så her er ræsonnementet til at tjekke selv: de fire fejltyper ovenfor er usynlige i en GitHub-liste. Stjerneantal måler markedsføringsrækkevidde. En README måler forfatterens optimisme. Den eneste måde at vide, om en skill slår baseline, er at køre baseline, hvilket tager os omkring en aften pr. skill, gange 45 indtil videre.
Start med de bedste skills fra 2026 for kryds-kategori-listen, eller gå direkte til din kategori, for eksempel de bedste kodeskills. Hver entry linker til sine testnotater, inklusive workarounds for skills, der har brug for dem.
SKILLPROOF-PAKKE
Optimizer Pack er, hvordan den testede klasse ser ud i praksis: fire effektivitetsskills, der bestod hele protokollen, forkonfigureret så installationsfejlene ovenfor ikke kan ske. Spar aftenen med sortering.
Få Optimizer Pack — $10Hvis du skriver en
Fejltyperne fungerer som en tjekliste, og tre af de fire er billige at undgå.
Skriv beskrivelsen som en trigger-specifikation: formuleringerne, en bruger ville skrive, plus hvad skillen skal ignorere. Test derefter installationsinstruktionerne på en maskine, der ikke er din, eller i det mindste i en frisk mappe, og erklær hver afhængighed, inklusive andre skills og MCP-forbindelser. Kør vores skill-validator, før du udgiver; den fanger de strukturelle problemer og reklametavle-beskrivelses-problemet på sekunder. For hele gennemgangen, fra frontmatter til udgivelse, se hvordan du skriver din egen Claude skill.
Den fjerde fejltype, at slå baseline, er den, der kræver reel eftertanke. Før du skriver noget som helst, så kør din målopgave gennem Claude uden nogen skill. Hvis outputtet allerede er fint, har du ikke en skill, du har en readme til en funktion, Claude leveres med. 9,6-klassen findes, fordi de forfattere fandt reelle huller. Ironisk nok er det bedste værktøj til jobbet selv en skill: skill-creator skabte en fungerende intern skill for os på én session, og dens beskrivelses-optimeringstrin målbart forbedrede triggeringen i vores test.
Den ubekvemme del
Intet i disse data siger, at økosystemet er dårligt. Det siger, at økosystemet er ureviewet, hvilket er et andet problem med en velkendt form. Browserudvidelser omkring 2010, npm omkring 2016: en lav barriere for udgivelse plus intet verifikationslag producerer et katalog, hvor den mediane genstand er middelmådig, de bedste genstande er reelt fremragende, og intet overfladesignal adskiller dem. Skills, der fejler vores installationstjek, har hundredvis af stjerner. To af vores seks topscorere kommer fra repos, de fleste aldrig har hørt om.
Den sædvanlige korrektion kommer til sidst, en blanding af reviewlag og omdømme. Indtil den gør, ligger byrden hos den, der installerer, og tallene ovenfor er, hvad byrden ser ud som: 22% af testede skills defekte som udgivet, 69% med ufuldkomne triggere, 89% med dokumentation, der tabte point. Vi vil fortsætte med at udgive dataene uanset. Den fulde protokol og scoringsrubrik er på metodesiden, og hvert tal i denne artikel er reproducerbart ud fra de enkelte skills' testnotater.
Ofte stillede spørgsmål
Hvorfor trigger min Claude skill ikke?
Tjek tre ting i rækkefølge. Først stien: SKILL.md skal ligge i ~/.claude/skills/<navn>/SKILL.md, ikke ét niveau dybere; en fejlplaceret skill fejler tavst. For det andet frontmatter-description: hvis den lyder som et slogan, har Claude intet at matche din prompt imod. Omskriv den til at navngive de præcise formuleringer, du rent faktisk skriver, eller kør den gennem skill-validatoren. For det tredje: prompt med ord fra beskrivelsen ordret; hvis det trigger, er beskrivelsens dækning dit problem.
Hvordan afgør I, om en skill "virker"?
Ren installation på en frisk opsætning efter forfatterens egne instruktioner, triggertjek i begge retninger (fyrer på hævdede prompts, forbliver stille på urelaterede), og en rigtig opgave scoret mod en uden-skill-baseline, værd 10 af 25 point. Domme: bestået, virker-med-opsætning, eller stadig-i-kø. Metodesiden har rubrikken; hver skills side har notaterne.
Er officielle Anthropic-skills mere pålidelige end community-skills?
Mere pålidelige i gennemsnit: 10 af de 11, vi testede, bestod rent, og undtagelsen (brand-guidelines) kræver konfiguration med vilje. Men gennemsnittet er ikke det interessante tal. To af vores seks topscorede skills kommer fra én community-forfatters repo, og humanizer, en community-skill, er én af kun to skills, der scorer 10/10 på output. Testresultater slår herkomst.
Betyder disse resultater, at jeg bør undgå Claude skills?
Det modsatte. Den testede klasse er stille og roligt fremragende: 19 ud af 45 skills scorede 9 eller bedre på output vs. baseline, og de seks bedste er forskellen mellem Claude som et chatvindue og Claude som et værktøj, der producerer færdigt arbejde. Konklusionen er smallere end "skills virker ikke." Den er, at halvdelen af det, der udgives, har en defekt, du ikke kan se fra listen, så installer ud fra testdata, ikke ud fra stjerner.
★ 9.6/10 × 3
Den gratis startpakke
De 3 skills med vores højeste testscorer plus installations-tjeklisten — det setup, vi selv ville lægge på en frisk maskine. Gratis, på mail.