Hvor mange Claude-skills slår ren Claude? Vi målte det på 1.416

Hvor mange Claude-skills slår ren Claude? Vi målte det på 1.416

Hvor mange Claude-skills er reelt bedre end ren Claude? Vi har målt det.

Løftet om Claude-skills er overbevisende: et bibliotek af værktøjer, der kan installeres for at give modellen nye kapabiliteter, fra interaktion med API'er til generering af kompleks kode. Det officielle katalog og tredjeparts-repositories lister tusindvis af dem. Men dette rejser et kritisk spørgsmål for enhver udvikler, hvis tid er værdifuld: forbedrer Claude-skills reelt output på en målbar måde?

Det er let at finde skills, der hævder at være revolutionerende. Det er meget sværere at finde objektive beviser. De fleste skill-mapper er netop det – mapper. De lister skills baseret på forfatterens beskrivelse, men de validerer ikke påstandene. En skill kan være i stykker, forældet eller, i mange tilfælde, ikke bedre end hvad basismodellen kan gøre på egen hånd. Dette skaber et betydeligt signal-støj-problem.

Hos SkillProof lister vi ikke skills; vi tester dem. Fordi vi har kørt alle skills fra kataloget mod en baseline, kan vi fastslå den faktiske andel, der slår en Claude uden skills, med beviserne bag. Denne artikel præsenterer disse beviser. Vi måler hver skills ydeevne mod den samme model uden nogen skill installeret for at afgøre, om den giver en reel, kvantificerbar fordel.

Signal-støj-problemet i opdagelsen af skills

Hvis du har prøvet at integrere skills i din arbejdsgang, har du sandsynligvis stødt på opdagelsesproblemet. Du har en opgave i tankerne, måske at generere Terraform-konfigurationer eller interagere med et specifikt SaaS API. Du søger i et katalog, finder en skill med et lovende navn og læser dens SKILL.md-fil, som beskriver dens funktion og giver brugseksempler.

Du installerer den og prøver eksempel-prompten. Nogle gange virker det. Oftere indebærer processen friktion. Skill'en kan kaste en fejl, kræve udokumenterede miljøvariabler eller producere output, der slet ikke ligner eksemplet. Du kan ende med at bruge en time på at debugge en andens værktøj, kun for at opdage, at det var dårligt skrevet eller forladt for måneder siden.

Denne trial-and-error-cyklus er ineffektiv. Kerneproblemet er, at de fleste skill-kataloger fungerer som package managers uden en CI/CD-pipeline. De indekserer, hvad der eksisterer, men giver ingen garanti for kvalitet. Der er ingen uafhængig verifikation for at bekræfte, at en skill virker som annonceret, for slet ikke at tale om, at den tilbyder en forbedring i forhold til en velformuleret prompt til basismodellen. Testbyrden falder udelukkende på slutbrugeren.

Dette er det problem, vi satte os for at løse. For at afgøre, om Claude code skills er værd at installere, har du brug for en konsistent, gentagelig testmetodologi og en klar baseline for sammenligning.

Hvordan vi måler "bedre": Baseline uden skills

For at besvare spørgsmålet, "Er denne skill bedre end ingenting?", har du brug for en stringent definition af "ingenting". For os er "ingenting" selve basis-Claude-modellen – det, vi kalder baseline uden skills. Hele vores metodologi er bygget op omkring sammenligning af en skills ydeevne mod denne kontrol.

Processen er ligetil og designet til at afspejle en reel brugssituation. For hver skill udfører vi følgende trin:

  1. Definér testcases: Vi analyserer skill'ens tilsigtede funktion og opretter et sæt repræsentative opgaver. For en Kubernetes manifest-generator kan dette involvere prompts til at oprette Deployments, Services og Ingress-objekter med varierende kompleksitet.

  2. Kør baseline: Vi kører disse test-prompts mod den rene Claude-model uden nogen skill installeret. Vi gemmer outputtet som vores kontrolcase. Dette viser, hvad en kompetent bruger kunne opnå alene med prompting.

  3. Kør skill'en: Vi installerer skill'en og kører præcis det samme sæt test-prompts. Dette er vores eksperimentelle case.

  4. Bedøm outputs: En menneskelig reviewer sammenligner baseline-outputtet og skill'ens output side om side. Vi bruger en detaljeret rubrik til at bedømme dem på korrekthed, fuldstændighed, overholdelse af instruktioner og effektivitet. Den endelige dom er en enkelt score ud af 10, der måler det løft, som skill'en giver i forhold til baseline.

A høj score (8-10/10) indikerer en betydelig forbedring. En medium score (6-7/10) indikerer en funktionel skill, der tilbyder en marginal fordel. En lav score (1-5/10) indikerer en skill, der er buggy, svær at bruge eller yder dårligere end baseline. Du kan læse de fulde detaljer om vores bedømmelsessystem på vores /methodology side.

Denne claude skills vs no skill baseline sammenligning er den eneste måde at generere objektive data om en skills reelle værdi. Marketingpåstande og forfatterbeskrivelser er irrelevante; det eneste, der betyder noget, er den målte ydeevne på en reel opgave.

Dommen: Hvilken procentdel af Claude-skills virker?

Så, hvad siger dataene? Efter at have anvendt vores metodologi på det offentlige skill-økosystem, tegner der sig et klart billede. I skrivende stund har vi installeret og eksekveret 1416 unikke skills.

Resultaterne viser, at et flertal af skills giver en vis værdi, men en meget betydelig del – over en tredjedel – er enten i stykker, kræver kompleks opsætning eller er aktivt skadelige for modellens ydeevne.

Her er den overordnede opdeling af vores resultater:

Dom Antal Procentdel af total Beskrivelse
Bestået & listet 889 63% Skill'en installeres rent, virker som beskrevet og scorer højere end baseline uden skills.
Kræver manuel opsætning 467 33% Skill'en er funktionel, men kræver udokumenteret opsætning (f.eks. miljøvariabler, API-nøgler) eller har store forbehold.
Scorer under baseline 60 4% Skill'en er aktivt skadelig og producerer output, der er mindre præcist, mindre komplet eller mere fejlbehæftet end ren Claude.

Disse tal er tankevækkende. Selvom det er godt, at næsten to tredjedele af skills består vores verifikation, betyder det, at hvis du vælger en tilfældig skill fra et offentligt katalog, har du en 1 ud af 3 chance for, at det er spild af din tid.

Mere alarmerende er de 4%, der scorer under baseline. Disse er skills, der ikke kun undlader at hjælpe, men aktivt forværrer modellens output. At installere en af disse er en nedgradering for dit system. Disse data giver et klart svar på spørgsmålet om, hvilken procentdel af Claude-skills der virker: det er langt fra 100%.

Anatomien af en fejlslagen skill

At forstå, hvorfor skills fejler, er lige så vigtigt som at vide, hvilke der lykkes. De fejl, vi registrerer, falder generelt i to kategorier: dem, der er aktivt skadelige, og dem, der simpelthen er ufuldstændige.

Kategori 1: Scorer under baseline

De 60 skills i denne kategori repræsenterer det værst tænkelige scenarie. De lover at tilføje en kapabilitet, men introducerer i stedet fejl, begrænsninger eller regressioner. For eksempel testede vi en SQL-query-generator, der var beregnet til at skrive komplekse forespørgsler fra naturligt sprog. På vores test-prompts producerede den konsekvent syntaktisk ugyldig SQL. Den rene Claude-baseline, givet de samme prompts, producerede korrekt SQL hver gang. Skill'ens interne logik var fejlbehæftet og styrede aktivt modellen mod et dårligere resultat.

En anden almindelig fejltype er overbegrænsning. En skill designet til at håndhæve et specifikt JSON-skema kan være så rigid, at den får modellen til at nægte at besvare legitime prompts, der falder lidt uden for dens snævre definition, hvorimod basismodellen ville have håndteret anmodningen elegant. Disse skills er værre end ubrugelige; de er en hæmsko.

Kategori 2: Kræver manuel opsætning

Dette er en meget større kategori, der omfatter 467 af de skills, vi testede. Disse skills er ikke nødvendigvis dårligt designede, men de er dårligt dokumenterede. De repræsenterer en massiv skjult tidsomkostning for udviklere.

Et typisk eksempel er en skill, der fungerer som en klient for et tredjeparts-API. Koden kan være fuldt funktionel, men SKILL.md-filen undlader at nævne, at brugeren først skal oprette en konto, generere en API-nøgle og sætte den som en miljøvariabel ved navn THIRD_PARTY_API_KEY. Uden denne information fejler skill'en med en generisk AuthenticationError.

Vores team gør arbejdet med at afdække disse skjulte krav og dokumenterer dem i vores resultater. Men for en gennemsnitlig bruger er dette en blindgyde. Skill'en virker ødelagt, og de afinstallerer den efter en frustrerende halv times debugging. Dette er ikke en fejl i modellen, men en fejl i udvikleroplevelsen. Gode skills skal være brugbare 'out of the box', med alle afhængigheder og konfigurationstrin klart dokumenteret.

Karakteristika for en højtscorende skill

Hvis en tredjedel af skills er problematiske, hvordan ser de andre to tredjedele – de succesfulde – så ud? Er Claude code skills værd at installere? Ja, hvis de tilhører gruppen med høj score.

Højtscorende skills deler flere fælles træk:

  1. De leverer reelle værktøjer: De bedste skills omformulerer ikke bare en prompt. De giver modellen adgang til nye kapabiliteter. En skill, der kan tjekke en URL for en 200 OK-status, et fil-patching-værktøj, der kan anvende en diff på en lokal fil, eller en skill, der interagerer med en live cloud-udbyders API, er alle eksempler på reelle værktøjer. De tillader modellen at udføre handlinger i verden, ikke bare tale om dem. Dette giver et klart, ubestrideligt løft i forhold til baseline.

  2. De er atomare og pålidelige: Top-skills fokuserer på at gøre én ting godt. En skill til at konvertere et tidsstempel til en ISO 8601-streng er mere tilbøjelig til at være robust og nyttig end en monolitisk "DevOps-assistent"-skill, der forsøger at gøre tyve forskellige ting.

  3. De har fremragende dokumentation: SKILL.md behandles som en kritisk del af værktøjet. Den indeholder klare instruktioner, fungerende eksempler for almindelige brugsscenarier og eksplicit dokumentation af enhver påkrævet opsætning, som miljøvariabler eller autentificering.

Når en skill opfylder disse kriterier, er forbedringen ikke subtil. Den transformerer modellen fra en tekstgenerator til en interaktiv agent, der kan udføre opgaver, hvilket sparer betydelig tid og kræfter. Det er disse skills, der lever op til det oprindelige løfte.

Find skills, der reelt forbedrer din arbejdsgang

Den centrale konklusion fra vores forskning er, at det rå antal tilgængelige skills er en forfængelighedsmetrik. Økosystemets værdi ligger ikke i dets størrelse, men i tætheden af verificerede værktøjer af høj kvalitet. At installere skills blindt baseret på deres beskrivelser er en ineffektiv og frustrerende strategi.

Spørgsmålet, udviklere bør stille, er ikke "forbedrer Claude-skills reelt output?", men snarere "hvilke skills forbedrer output, og med hvor meget?"

At besvare det spørgsmål er grunden til, at vi byggede SkillProof. Vi udfører testene og publicerer resultaterne – inklusiv fejlene – så du kan tage skills i brug med tillid. Vores katalog er ikke en udtømmende liste over alle eksisterende skills. Det er en kurateret mappe af skills, der beviseligt virker og giver en målbar fordel i forhold til baseline uden skills.

Relateret læsning: hvorfor så mange skills kommer til kort · om GitHub-stjerner forudsiger en god skill.

Pointen med disse data er ikke at fraråde brugen af skills, men at opfordre til at bruge de rigtige. Vi har gjort arbejdet med at teste 1416 skills, så du ikke behøver at gøre det. Du kan gennemse de 889 skills, der bestod vores baseline-tests, i vores fulde katalog. Hvis du vil springe søgningen over, tilbyder vi også en kurateret pakke med de 50 mest effektfulde skills for $10.

★ 9.6/10 × 3

Den gratis startpakke

De 3 skills med vores højeste testscorer plus installations-tjeklisten — det setup, vi selv ville lægge på en frisk maskine. Gratis, på mail.

Én mail med pakken + et kort ugentligt overblik over nye testresultater. Afmeld når som helst.