
Varför hälften av Claude skills inte fungerar
Om du sökte på "claude skill fungerar inte" så är kortversionen: det är troligen inte du. Vi installerar och testar varje skill vi listar, på en ren installation, enligt författarens egna instruktioner, och jämför sedan resultatet mot Claude helt utan skill. Felmönstren är så konsekventa att vi nu kan rangordna dem efter frekvens.
Långversionen har siffror, och varenda en är beräknad från vår publika testdata. Vår katalog innehåller just nu 73 skills. 45 har gått igenom hela protokollet; 28 väntar fortfarande i testkön. Av de 45 testade fick 35 ett rent godkänt. De andra 10, alltså 22%, fick domen "fungerar med extra konfiguration", vilket betyder att skillen som den levererades inte fungerade och vi fick ingripa: installera ett saknat beroende, koppla upp en MCP-anslutning, eller fylla i konfiguration som README aldrig nämnde. Räknat på hela katalogen ger det 35 av 73 skills, 48%, med domen "testad, fungerar" idag. Strax under hälften. Därav titeln.
Och det underskattar problemet, för de 45 testade skillsen är redan överlevare. Vår crawler sveper igenom GitHub var 12:e timme och har lagt in 267 repon i upptäcktskön. Skills som är övergivna, duplicerade eller uppenbart trasiga sorteras bort vid triage och når aldrig ett poängsatt test. Felmönstren nedan är vad vi hittar i de skills som är tillräckligt bra för att testas.
Siffrorna, före berättandet
Vår poäng är 25 poäng fördelat på fyra kriterier: installeras rent (5), triggar tillförlitligt (5), output jämfört med baseline (10), dokumentation och ärlighet (5), normaliserat till en poäng av 10. Så här gick det för 45 testade skills på varje kriterium:
| Kriterium | Full poäng | Fick avdrag | Fick 3/5 eller sämre |
|---|---|---|---|
| Installeras rent (/5) | 34 av 45 | 11 (24%) | 8 (18%) |
| Triggar tillförlitligt (/5) | 14 av 45 | 31 (69%) | 0 |
| Output vs. baseline (/10) | 2 av 45 fick 10 | — | 5 låg på golvnivån 7/10 |
| Dokumentation & ärlighet (/5) | 5 av 45 | 40 (89%) | 12 (27%) |
Ingen enda av de 45 skills fick full pott på 25. Totalpoängen sträcker sig från 6,8 till 9,6 av 10, med ett medianvärde på 8,4, och 9 av de 45 hamnar under 8,0. De fyra felmönstren motsvarar tabellens fyra rader.
Felmönster 1: triggerbeskrivningen som aldrig aktiveras
Detta är den vanligaste bristen i vår data. Bara 14 av 45 testade skills, 31%, fick full pott 5/5 på "triggar tillförlitligt". De andra 31 aktiveras inkonsekvent: de missar formuleringar de borde fånga upp, eller så aktiveras de vid orelaterat arbete. Lägg märke till nollan i tabellens sista kolumn dock. Ingen testad skill fick under 4/5 på triggning, och det är överlevnadsbias, inte kvalitet. En skill vars trigger är helt död fångas upp vid triage och får aldrig ens en poäng. De som når fram till test missar bara ibland.
Mekaniken är föga glamorös. När du skickar en prompt avgör Claude om en skill ska laddas baserat på en enda sak: description-fältet i SKILL.md:s frontmatter. Inte README, inte koden, inte de 400 raderna noggranna instruktioner under frontmattern. Om beskrivningen inte kopplar dina ord till skillens uppgift ligger skillen bara i din mapp och gör ingenting, och du drar slutsatsen att Claude skills inte fungerar.
Författare fortsätter att skriva det fältet som om det vore en landningssida. Två anonymiserade par från vår testning, lätt omskrivna:
En beskrivning som aldrig aktiveras:
"Ge ditt innehållsarbete en boost med AI-driven skrivintelligens. Skriv bättre, snabbare, smartare."
Samma jobb, skrivet av en skill som fick 5/5 på triggning:
"Använd när användaren vill skapa, läsa eller redigera Word-dokument (.docx). Trigga på alla omnämnanden av 'Word-dokument', '.docx', eller en förfrågan om en rapport, promemoria eller brev som Word-fil. Använd inte för PDF:er eller kalkylblad."
En till, från datakategorin:
"Din ultimata SQL-assistent för allt inom data."
Jämfört med:
"Använd när användaren ber om att skriva, felsöka eller optimera en SQL-fråga, nämner en tabell eller ett schema, eller klistrar in ett query-fel. Trigga inte på generella datafrågor utan någon fråga inblandad."
Skillnaden ligger inte i skrivtalang. De bra beskrivningarna namnger de exakta fraser en användare skulle skriva, och de säger när skillen inte ska aktiveras. I vårt protokoll testar vi båda riktningarna: de promptar skillen påstår sig hantera, närliggande formuleringar, och medvetet orelaterade förfrågningar. De flesta 4/5-poängen kommer från skills som klarar den första kontrollen men snubblar på den andra eller tredje.
Du kan kontrollera detta innan du installerar något. SKILL.md är vanlig markdown, läsbar direkt på GitHub. Om beskrivningen skulle kunna vara en reklamskylt kommer skillen att underprestera. Om du felsöker din egen, klistra in den i vår kostnadsfria skill-validator, som flaggar säljande formuleringar tillsammans med strukturella problem.
Felmönster 2: installationsruttet
Alla 10 av våra domar "fungerar med extra konfiguration" är installationsfel av något slag. Mönstret syns tydligt i poängen: skills som klarade sig rakt av har i snitt 4,97 av 5 på installation. Skills med konfigurationsdom har i snitt 3,2.
Vad som faktiskt gick fel, från våra testanteckningar:
- Odeklarerade skill-beroenden. En faktura-extraheringsskill som i tysthet kräver att PDF-skillen är installerad först för skannade dokument, plus en enrads lokalinställning för europeiska datumformat som README inte nämner. Outputen var genuint bra (8/10) när vi väl räknat ut det. Att räkna ut det tog en kväll.
- Odeklarerade tjänstberoenden. En schemaläggningsskill som bara är rådgivande tills du kopplar en kalender-MCP. En inkorgs-triageskill som behöver Gmail eller Outlook uppkopplat. En mätvärdesskill som förutsätter att en analysexport existerar. Inget av dessa krav är orimligt. Alla hör hemma på första raden i README, inte i ett supportärende.
- Fel mappdjup. Klassikern. Instruktioner som lämnar skillen på
skills/namn/namn/SKILL.md, en nivå för djupt, där Claude aldrig hittar den. Skillen "installeras" utan felmeddelande och triggar sedan aldrig, vilket får dig att jaga felmönster 1 när det egentliga problemet är en sökväg. - Instruktioner skrivna för en äldre Claude Code. Git-workflow är ett milt fall: commits och grenhantering fungerar direkt, men vägledningen om interaktiv rebase förutsätter funktioner som Claude Code medvetet blockerar, så de stegen får du köra manuellt själv.
Ett ärligt undantag värt att nämna: brand-guidelines bär en konfigurationsdom eftersom den är oanvändbar tills du fyller i din egen varumärkespalett och röst, och den säger det rakt ut. Konfiguration by design är okej. Konfiguration by underlåtenhet är felmönstret.
Tecknet, innan du installerar: en README vars installationsavsnitt är en vag rad. Jämför den mot installationsblocket på en skill som fick 5/5, som DOCX. Specifika kommandon, specifika sökvägar, förutsättningar angivna. Den är två rader lång eftersom två rader är allt en fungerande installation behöver.
Felmönster 3: skillen triggar och inget blir bättre
Det mest subtila felmönstret, och anledningen till att vår poängsättning viktar output mot baseline med 10 av 25 poäng, dubbelt så mycket som något annat kriterium. Testet är enkelt: vi kör samma verkliga uppgift två gånger, en gång med skillen installerad och en gång utan, och jämför. En skill måste slå ren Claude eller så har den ingen anledning att ta upp plats i kontexten.
Golvet i vår testade grupp är 7/10, och fem skills ligger exakt där. Det betyder att bland skills som klarar sig levererar ungefär var nionde en förbättring du skulle behöva en sida-vid-sida-jämförelse för att märka. Under 7 överlever skills inte till en listning, och upptäcktskön är full av kandidater i det intervallet: "skrivförbättrings"-skills i kategorier där basmodellen redan är stark, och skills som i praktiken bara är en systemprompt som säger, i klartext, var utmärkt.
Bara två skills fick 10/10 på output, och de visar hur en förtjänad förbättring ser ut. Frontend-design fick samma landningssidesuppdrag med och utan skillen; versionen med skill hade en riktig typskala och en avsiktlig färgpalett, och inga av de neongradient-tecken som kännetecknar standardoutput. Humanizer tvättade bort överanvändningen av tankstreck och "fördjupa"-klassens ordförråd från AI-utkast så pass grundligt att två redaktörer inte tillförlitligt kunde flagga resultatet som AI-hjälpt. Nitton av 45 skills fick 9 eller bättre på output. Skill-konceptet fungerar. Det fungerar bara inte automatiskt.
GRATIS STARTPAKET
De 3 skills i vårt gratis startpaket slår alla baseline i testning, vilket är den ribba de flesta missar. Vi mejlar dem till dig tillsammans med installationschecklistan vi använder vid varje test. Gratis.
Hämta det gratis startpaketetFelmönster 4: README skriver checkar skillen inte kan lösa in
Dokumentation och ärlighet är det svagaste kriteriet i hela datasetet. Fem av 45 skills fick 5/5. Fyrtio tappade poäng, och 12 fick 3/5. Vi upprepar: medianskillen har bättre output än dokumentation.
Vad som kostar poäng här, i ordning efter hur ofta vi ser det:
- Löften som testet motsäger. En README som påstår "fungerar med alla fakturaformat" medan skillen behöver en lokalinställning för icke-amerikanska datum. En "fullständig git-automation"-pitch på en skill som inte kan utföra interaktiva rebaser i Claude Code alls. Vi behandlar det oftast inte som lögn. Vi behandlar det som att författare dokumenterar den skill de tänkte skriva snarare än den de faktiskt skrev.
- Saknade förutsättningar. Varje odeklarerat beroende från felmönster 2 är också ett dokumentationsfel, vilket är varför skills med konfigurationsdom i snitt får 3,4/5 på dokumentation medan rena godkännanden får 3,97.
- Tystnad om beteende du skulle vilja veta om. Om skillen ringer hem, vad den gör med dina filers innehåll, vilka modellversioner den skrevs mot. Sällsynta men allvarliga fall, dolda nätverksanrop eller instruktioner formade som prompt-injektion begravda mitt i filen, är varför detta kriterium finns över huvud taget. Vi läser varje SKILL.md vi listar, från början till slut. Du bör göra detsamma för allt utanför en testad katalog.
Vi har inte kört regressionen, men den informella observationen håller genom alla 45 tester: antal README-badges och installationsavsnittets kvalitet rör sig i motsatta riktningar.
Vad topptrion gör annorlunda
Sex skills, 13% av allt vi testat, delar topp-poängen 9,6/10: DOCX, skill-creator och frontend-design från Anthropics officiella repo, test-driven-development och systematic-debugging från Jesse Vincents superpowers-samling, och humanizer från communityn. Ytterligare sex, inklusive xlsx, pdf och sql-queries, ligger på 9,2. Vad topptrion har gemensamt går att kontrollera:
Perfekta installationer och perfekta triggers, utan undantag. Alla sex fick 5/5 på båda. Vilken kreativ energi som än lagts på dessa skills gick ingen av den till beskrivningen; de läses som specifikationer, med uttryckliga triggerfraser och uttryckliga undantag.
Avgränsade till det basmodellen är dålig på. Claude behöver ingen skill för att skriva prosa. Den behöver en för att producera en riktig .docx med stilar och spårade ändringar, eller för att sluta "fixa" ett race condition genom att gissa. Systematic-debugging förtjänade sin poäng på en bugg Claude tidigare "fixat" tre gånger utan att lösa den en enda gång; skillens hypotes-test-verifiera-loop stoppade gissandet. Varje topp-poängare siktar på ett gap du kan namnge i en enda mening.
Dokumentation som underdriver. Den lägsta dokumentationspoängen bland de sex är en 4:a. Deras README anger förutsättningar och medger begränsningar; adjektiv är sällsynta. Det visar sig att författarna som testar sina egna installationsinstruktioner också skriver beskrivningar som triggar. Hantverksskicklighet korrelerar med sig själv.
Också värt att notera: pedigree hjälper men avgör inte. Tio av de elva Anthropic-skrivna skills vi testat klarade sig rent, och undantaget är konfiguration by design. Men en tredjedel av topptrion är en enda community-författare som brydde sig, och gott om community-skills slår officiella inom sin kategori. Det mest stjärnmärkta repot i vår upptäcktskö har över 85 000 stjärnor och fortfarande ingen dom, eftersom stjärnor inte är ett test.
Om du väljer skills
Använd testade. Det är en självisk mening på en sajt vars hela produkt är att testa skills, så här är resonemanget att kontrollera själv: de fyra felmönstren ovan är osynliga i en GitHub-listning. Stjärnantal mäter marknadsräckvidd. En README mäter författarens optimism. Det enda sättet att veta om en skill slår baseline är att köra baseline, vilket tar oss ungefär en kväll per skill, gånger 45 hittills.
Börja med de bästa skillsen 2026 för listan över alla kategorier, eller gå direkt till din kategori, till exempel de bästa kodningsskillsen. Varje post länkar till sina testanteckningar, inklusive lösningarna för skills som behöver dem.
SKILLPROOF-PAKETET
Optimizer Pack är hur den testade nivån ser ut i praktiken: fyra effektivitetsskills som klarat hela protokollet, förkonfigurerade så att installationsfelen ovan inte kan inträffa. Spara kvällen av sortering.
Hämta Optimizer Pack — 10 dollarOm du skriver en
Felmönstren fungerar som en checklista, och tre av de fyra är billiga att undvika.
Skriv beskrivningen som en triggerspecifikation: fraserna en användare skulle skriva, plus vad skillen ska ignorera. Testa sedan installationsinstruktionerna på en maskin som inte är din, eller åtminstone i en ny mapp, och deklarera varje beroende, inklusive andra skills och MCP-anslutningar. Kör vår skill-validator innan du publicerar; den fångar de strukturella problemen och reklamskylt-beskrivningsproblemet på några sekunder. För hela genomgången, från frontmatter till publicering, se hur man skriver sin egen Claude skill.
Det fjärde felmönstret, att slå baseline, är det som kräver faktisk eftertanke. Innan du skriver något, kör din måluppgift genom Claude helt utan skill. Om outputen redan är bra har du inte en skill, du har en readme för en funktion Claude redan levererar med. 9,6-nivån existerar för att de författarna hittade riktiga gap. Ironiskt nog är det bästa verktyget för jobbet självt en skill: skill-creator byggde en fungerande intern skill åt oss på en session, och dess beskrivningsoptimeringssteg förbättrade mätbart triggningen i vårt test.
Den obekväma delen
Inget i denna data säger att ekosystemet är dåligt. Det säger att ekosystemet är ogranskat, vilket är ett annat problem med en bekant form. Webbläsartillägg runt 2010, npm runt 2016: en låg tröskel för publicering plus ingen verifieringsnivå ger en katalog där medianobjektet är medelmåttigt, de bästa objekten är genuint utmärkta, och ingen ytlig signal skiljer dem åt. Skills som misslyckas i vår installationskontroll har hundratals stjärnor. Två av våra sex topp-poängare kommer från repon de flesta aldrig hört talas om.
Den vanliga rättelsen kommer förr eller senare, någon blandning av granskningslager och rykte. Tills dess ligger bördan på den som installerar, och siffrorna ovan är hur bördan ser ut: 22% av testade skills trasiga som levererade, 69% med ofullständiga triggers, 89% med dokumentation som tappade poäng. Vi kommer fortsätta publicera datan oavsett. Hela protokollet och poängrubriken finns på metodik-sidan, och varje siffra i denna artikel går att återskapa från de skillspecifika testanteckningarna.
Vanliga frågor
Varför triggar inte min Claude skill?
Kontrollera tre saker i ordning. Först sökvägen: SKILL.md måste ligga på ~/.claude/skills/<namn>/SKILL.md, inte en katalog djupare; en felnästlad skill misslyckas tyst. Andra, frontmatter-description: om den läses som ett slagord har Claude inget att matcha din prompt mot. Skriv om den så att den namnger de exakta fraser du faktiskt skriver, eller kör den genom skill-validatorn. Tredje, prompta med ord direkt ur beskrivningen; om det triggar är beskrivningens täckning ditt problem.
Hur avgör ni att en skill "fungerar"?
Ren installation på ett nytt setup enligt författarens egna instruktioner, triggerkontroller i båda riktningarna (aktiveras vid påstådda promptar, håller tyst vid orelaterade), och en verklig uppgift poängsatt mot en baseline utan skill, värt 10 av 25 poäng. Domar: godkänd, fungerar-med-konfiguration, eller fortfarande-i-kön. Metodik-sidan har rubriken; varje skill-sida har anteckningarna.
Är officiella Anthropic-skills mer tillförlitliga än community-skills?
Mer tillförlitliga i snitt: 10 av de 11 vi testat klarade sig rent, och undantaget (brand-guidelines) kräver konfiguration med avsikt. Men snittet är inte det intressanta talet. Två av våra sex topp-poängade skills kommer från en enda community-författares repo, och humanizer, en community-skill, är en av bara två skills som fick 10/10 på output. Testresultat slår proveniens.
Betyder dessa resultat att jag bör undvika Claude skills?
Tvärtom. Den testade nivån är i det tysta utmärkt: 19 av 45 skills fick 9 eller bättre på output mot baseline, och de sex bästa är skillnaden mellan Claude som ett chattfönster och Claude som ett verktyg som producerar färdigt arbete. Slutsatsen är snävare än "skills fungerar inte." Den är att hälften av det som publiceras har en brist du inte kan se från listningen, så installera från testdata, inte från stjärnor.
★ 9.6/10 × 3
Gratis startpaket
De 3 skills som fått våra högsta testbetyg plus installationschecklistan — setupen vi själva skulle lägga på en ny maskin. Gratis, via e-post.