
Perché metà delle skill Claude non funziona — i dati
Se hai cercato "claude skill non funziona", ecco la versione breve: probabilmente non è colpa tua. Installiamo e testiamo ogni skill che elenchiamo, su un setup pulito, seguendo le istruzioni dell'autore stesso, e poi valutiamo il risultato confrontandolo con Claude senza alcuna skill. I pattern di fallimento sono così costanti che ormai possiamo classificarli per frequenza.
La versione lunga ha dei numeri, e ognuno di essi è calcolato dai nostri dati di test pubblici. Il nostro catalogo conta oggi 73 skill. 45 sono passate per il protocollo completo; 28 sono ancora in coda di test. Delle 45 testate, 35 hanno ottenuto una promozione pulita. Le altre 10, cioè il 22%, hanno ricevuto un verdetto "funziona con setup", il che significa che la skill così com'è non funzionava e abbiamo dovuto intervenire: installare una dipendenza mancante, collegare una connessione MCP, o completare una configurazione che il README non menzionava mai. Su tutto il catalogo, questo lascia 35 skill su 73, il 48%, con un verdetto "testata, funziona" oggi. Poco meno della metà. Da cui il titolo.
E questo sottostima il problema, perché le 45 skill testate sono già sopravvissute. Il nostro crawler passa al setaccio GitHub ogni 12 ore e ha archiviato 267 repository nella coda di scoperta. Le skill abbandonate, duplicate o palesemente rotte vengono scartate al triage e non arrivano mai a un test valutato. I modi di fallimento qui sotto sono ciò che troviamo nelle skill abbastanza buone da meritare un test.
I numeri, prima delle storie
Il nostro punteggio è di 25 punti su quattro criteri: si installa senza problemi (5), si attiva in modo affidabile (5), output vs. baseline (10), documentazione e onestà (5), normalizzato su un punteggio da 10. Ecco come se la sono cavata 45 skill testate su ciascun criterio:
| Criterio | Punteggio pieno | Penalizzata di almeno un punto | Punteggio 3/5 o peggio |
|---|---|---|---|
| Si installa senza problemi (/5) | 34 su 45 | 11 (24%) | 8 (18%) |
| Si attiva in modo affidabile (/5) | 14 su 45 | 31 (69%) | 0 |
| Output vs. baseline (/10) | 2 su 45 a 10 | — | 5 ferme al minimo di 7/10 |
| Documentazione e onestà (/5) | 5 su 45 | 40 (89%) | 12 (27%) |
Nessuna delle 45 skill ha ottenuto un 25 perfetto. I punteggi complessivi vanno da 6,8 a 9,6 su 10, con una mediana di 8,4, e 9 delle 45 sono sotto l'8,0. I quattro modi di fallimento corrispondono alle quattro righe della tabella.
Modo di fallimento 1: la descrizione trigger che non scatta mai
Questo è il difetto più diffuso nei nostri dati. Solo 14 skill testate su 45, il 31%, hanno ottenuto un 5/5 perfetto su "si attiva in modo affidabile". Le altre 31 si attivano in modo incoerente: mancano formulazioni che dovrebbero intercettare, oppure si attivano su lavori non correlati. Nota però quello zero nell'ultima colonna della tabella. Nessuna skill testata ha ottenuto meno di 4/5 sull'attivazione, e questo è un effetto di sopravvivenza, non di qualità. Una skill il cui trigger è completamente morto viene intercettata al triage e non ottiene mai un punteggio. Quelle che arrivano al test si limitano a sbagliare mira.
Il meccanismo non ha nulla di affascinante. Quando invii un prompt, Claude decide se caricare una skill basandosi su una sola cosa: il campo description nel frontmatter di SKILL.md. Non il README, non il codice, non le 400 righe di istruzioni accurate sotto il frontmatter. Se la descrizione non collega le tue parole al compito della skill, la skill resta nella tua cartella senza fare nulla, e tu concludi che le skill di Claude non funzionano.
Gli autori continuano a scrivere quel campo come se fosse una landing page. Due coppie anonimizzate dai nostri test, leggermente riformulate:
Una descrizione che non scatta mai:
"Potenzia il tuo flusso di lavoro sui contenuti con un'intelligenza di scrittura potenziata dall'IA. Scrivi meglio, più velocemente, in modo più intelligente."
Lo stesso compito, scritto da una skill che ha ottenuto 5/5 sull'attivazione:
"Da usare quando l'utente vuole creare, leggere o modificare documenti Word (.docx). Si attiva su qualsiasi menzione di 'documento Word', '.docx', o una richiesta di un report, memo o lettera come file Word. Non usare per PDF o fogli di calcolo."
Un'altra ancora, dalla categoria dati:
"Il tuo assistente SQL definitivo per tutto ciò che riguarda i dati."
Contro:
"Da usare quando l'utente chiede di scrivere, correggere o ottimizzare una query SQL, nomina una tabella o uno schema, o incolla un errore di query. Non attivare su domande generiche sui dati senza query coinvolta."
La differenza non è talento di scrittura. Le buone descrizioni nominano le frasi esatte che un utente digiterebbe, e dicono quando non attivarsi. Nel nostro protocollo testiamo entrambe le direzioni: i prompt che la skill dichiara di gestire, formulazioni simili, e richieste deliberatamente non correlate. La maggior parte dei punteggi 4/5 arriva da skill che superano il primo controllo e inciampano sul secondo o terzo.
Puoi verificarlo prima di installare qualsiasi cosa. SKILL.md è markdown semplice, leggibile su GitHub. Se la descrizione potrebbe fungere da cartellone pubblicitario, la skill renderà poco. Se stai facendo debug della tua, incollala nel nostro validatore di skill gratuito, che segnala le descrizioni da spot pubblicitario insieme ai problemi strutturali.
Modo di fallimento 2: il degrado dell'installazione
Tutti e 10 i nostri verdetti "funziona con setup" sono fallimenti di installazione di un tipo o dell'altro. Il pattern emerge chiaramente nei punteggi: le skill promosse senza riserve ottengono in media 4,97 su 5 sull'installazione. Le skill con verdetto di setup ottengono in media 3,2.
Cosa si è effettivamente rotto, dalle nostre note di test:
- Dipendenze da altre skill non dichiarate. Una skill di estrazione fatture che richiede silenziosamente che la skill PDF sia installata prima per i documenti scansionati, più una modifica di una riga per i formati data europei che il README non menziona. L'output era genuinamente buono (8/10) una volta capito il problema. Capirlo ci è costato una serata.
- Dipendenze da servizi non dichiarate. Una skill di pianificazione che è solo consultiva finché non colleghi un MCP per il calendario. Una skill di smistamento posta che ha bisogno di Gmail o Outlook collegati. Una skill di metriche che presuppone l'esistenza di un export analytics. Nessuno di questi requisiti è irragionevole. Tutti appartengono alla prima riga del README, non a un ticket di supporto.
- Profondità di cartella sbagliata. Il classico. Istruzioni che lasciano la skill a
skills/name/name/SKILL.md, un livello troppo in profondità, dove Claude non la trova mai. La skill "si installa" senza messaggi d'errore e poi non si attiva mai, il che ti manda a caccia del modo di fallimento 1 quando il problema reale è un percorso. - Istruzioni scritte per una Claude Code più vecchia. Git-workflow è un caso lieve: commit e gestione dei branch funzionano subito, ma la guida al rebase interattivo presuppone capacità che Claude Code blocca deliberatamente, quindi quei passaggi tocca eseguirli manualmente.
Un'eccezione onesta che vale la pena citare: brand-guidelines porta un verdetto di setup perché è inutile finché non inserisci la tua palette e voce di brand, e lo dichiara apertamente. Il setup per design va bene. Il setup per omissione è il modo di fallimento.
Il segnale, prima di installare: un README la cui sezione di installazione è una riga vaga. Confrontala con il blocco di installazione di qualsiasi skill che ha ottenuto 5/5, come DOCX. Comandi specifici, percorsi specifici, prerequisiti dichiarati. È lungo due righe perché due righe sono tutto ciò che serve a un'installazione che funziona.
Modo di fallimento 3: la skill si attiva e nulla migliora
Il fallimento più sottile, e il motivo per cui il nostro punteggio pesa l'output vs. baseline con 10 punti su 25, il doppio di qualsiasi altro criterio. Il test è brutale: eseguiamo lo stesso compito reale due volte, una con la skill installata e una senza, e confrontiamo. Una skill deve battere Claude nudo o non ha motivo di occupare contesto.
Il minimo nel nostro set testato è 7/10, e cinque skill si fermano esattamente lì. Questo significa che anche tra le skill promosse, circa una su nove offre un miglioramento che noteresti solo con un confronto diretto. Sotto 7, le skill non sopravvivono fino a un elenco, e la coda di scoperta è piena di candidate in quel range: skill "di miglioramento della scrittura" in categorie dove il modello base è già forte, e skill che sono un unico system prompt che dice, in sostanza, sii eccellente.
Solo due skill hanno ottenuto un 10/10 sull'output, e mostrano cosa significa un miglioramento guadagnato sul campo. Frontend-design ha ricevuto lo stesso brief per una landing page con e senza la skill; la versione con skill aveva una vera scala tipografica e una palette intenzionale, senza nessuno dei segnali da gradiente al neon che caratterizzano l'output di default. Humanizer ha eliminato l'eccesso di trattini lunghi e il vocabolario da "approfondire" tipico dell'IA dalle bozze generate dall'IA, in modo così accurato che due editor non sono riusciti a segnalare in modo affidabile il risultato come assistito dall'IA. Diciannove skill su 45 hanno ottenuto 9 o più sull'output. Il concetto di skill funziona. Semplicemente non funziona in automatico.
STARTER PACK GRATUITO
Le 3 skill del nostro starter pack gratuito battono tutte la baseline nei test, che è l'ostacolo su cui inciampa la maggior parte. Te le mandiamo via email con la checklist di installazione che usiamo in ogni test. Gratis.
Ottieni lo starter pack gratuitoModo di fallimento 4: il README scrive assegni che la skill non può incassare
Documentazione e onestà è il criterio più debole dell'intero dataset. Cinque skill su 45 hanno ottenuto 5/5. Quaranta hanno perso punti, e 12 hanno ottenuto 3/5. Ripetiamolo: la skill mediana testata ha un output migliore della sua documentazione.
Cosa costa punti qui, in ordine di frequenza:
- Promesse che il test smentisce. Un README che dichiara "funziona con qualsiasi formato di fattura" mentre la skill ha bisogno di un'impostazione locale per le date non statunitensi. Un pitch di "automazione git completa" su una skill che non può eseguire affatto rebase interattivi in Claude Code. Di solito non lo consideriamo un mentire. Lo consideriamo autori che documentano la skill che intendevano scrivere invece di quella che hanno effettivamente scritto.
- Prerequisiti mancanti. Ogni dipendenza non dichiarata del modo di fallimento 2 è anche un fallimento di documentazione, motivo per cui le skill con verdetto di setup ottengono in media 3,4/5 sulla documentazione mentre le promozioni pulite ottengono 3,97.
- Silenzio su comportamenti che vorresti conoscere. Se la skill telefona a casa, cosa fa con il contenuto dei tuoi file, con quali versioni del modello è stata scritta. Casi rari ma seri, chiamate di rete nascoste o istruzioni a forma di prompt injection sepolte a metà file, sono il motivo per cui questo criterio esiste. Leggiamo ogni SKILL.md che elenchiamo, dall'inizio alla fine. Dovresti fare lo stesso per qualsiasi cosa provenga da fuori una directory testata.
Non abbiamo eseguito la regressione, ma l'osservazione informale regge su 45 test: il numero di badge nel README e la qualità della sezione di installazione si muovono in direzioni opposte.
Cosa fa diversamente il livello top
Sei skill, il 13% di tutto ciò che abbiamo testato, condividono il punteggio massimo di 9,6/10: DOCX, skill-creator, e frontend-design dal repository ufficiale di Anthropic, test-driven-development e systematic-debugging dalla collezione superpowers di Jesse Vincent, e humanizer dalla community. Altre sei, tra cui xlsx, pdf e sql-queries, si fermano a 9,2. Ciò che il livello top ha in comune è verificabile:
Installazioni perfette e trigger perfetti, senza eccezioni. Tutte e sei hanno ottenuto 5/5 su entrambi. Qualunque energia creativa sia stata spesa in queste skill, nessuna è andata nella descrizione; si leggono come specifiche tecniche, con frasi trigger esplicite ed esclusioni esplicite.
Mirate a ciò in cui il modello base è debole. Claude non ha bisogno di una skill per scrivere prosa. Ne ha bisogno per produrre un vero .docx con stili e modifiche tracciate, o per smettere di "risolvere" una race condition tirando a indovinare. Systematic-debugging ha guadagnato il suo punteggio su un bug che Claude aveva già "risolto" tre volte senza mai risolverlo davvero; il ciclo ipotesi-test-verifica della skill ha posto fine al tirare a indovinare. Ogni skill al top mira a una lacuna che puoi nominare in una sola frase.
Documentazione che si sottovaluta. Il punteggio più basso in documentazione tra le sei è un 4. I loro README dichiarano i prerequisiti e ammettono i limiti; gli aggettivi sono scarsi. Si scopre che gli autori che testano le proprie istruzioni di installazione scrivono anche descrizioni che si attivano correttamente. L'artigianato è correlato con se stesso.
Vale anche la pena notare: il pedigree aiuta ma non decide. Dieci delle undici skill firmate Anthropic che abbiamo testato sono passate senza problemi, e l'eccezione è un setup per design. Ma un terzo del livello top è un unico autore della community che ci ha messo cura, e molte skill della community superano quelle ufficiali nella loro categoria. Il repository più stellato nella nostra coda di scoperta ha oltre 85.000 stelle e ancora nessun verdetto, perché le stelle non sono un test.
Se stai scegliendo delle skill
Usa quelle testate. È una frase di parte su un sito il cui intero prodotto è testare skill, quindi ecco il ragionamento da verificare da solo: i quattro modi di fallimento sopra sono invisibili in un elenco GitHub. Il conteggio delle stelle misura la portata del marketing. Un README misura l'ottimismo dell'autore. L'unico modo per sapere se una skill batte la baseline è eseguire la baseline, il che ci richiede circa una serata a skill, moltiplicato per le 45 finora.
Inizia con le migliori skill del 2026 per la classifica trasversale alle categorie, oppure vai direttamente alla tua categoria, per esempio le migliori skill per il coding. Ogni voce collega le proprie note di test, incluse le soluzioni alternative per le skill che ne hanno bisogno.
SKILLPROOF PACK
L'Optimizer Pack è ciò che il livello testato sembra nella pratica: quattro skill di efficienza che hanno superato il protocollo completo, preconfigurate in modo che i fallimenti di installazione sopra non possano accadere. Risparmia la serata di selezione.
Ottieni l'Optimizer Pack — $10Se ne stai scrivendo una
I modi di fallimento fungono anche da checklist, e tre su quattro sono economici da evitare.
Scrivi la descrizione come una specifica di trigger: le frasi che un utente digiterebbe, più cosa la skill dovrebbe ignorare. Poi testa le istruzioni di installazione su una macchina che non è la tua, o almeno in una cartella nuova, e dichiara ogni dipendenza, incluse altre skill e connessioni MCP. Esegui il nostro validatore di skill prima di pubblicare; individua i problemi strutturali e il problema della descrizione da cartellone in pochi secondi. Per il percorso completo, dal frontmatter alla pubblicazione, vedi come scrivere una tua skill Claude.
Il quarto modo di fallimento, battere la baseline, è quello che richiede un pensiero vero. Prima di scrivere qualsiasi cosa, esegui il tuo compito target attraverso Claude senza alcuna skill. Se l'output è già valido, non hai una skill, hai un readme per una funzionalità che Claude offre già di serie. Il livello 9,6 esiste perché quegli autori hanno trovato lacune reali. Ironicamente, il miglior strumento per il lavoro è a sua volta una skill: skill-creator ci ha strutturato una skill interna funzionante in una sola sessione, e il suo passaggio di ottimizzazione della descrizione ha migliorato in modo misurabile l'attivazione nei nostri test.
La parte scomoda
Niente in questi dati dice che l'ecosistema sia negativo. Dice che l'ecosistema non è revisionato, il che è un problema diverso con una forma familiare. Le estensioni del browser intorno al 2010, npm intorno al 2016: una bassa barriera alla pubblicazione più nessun livello di verifica producono un catalogo dove l'elemento mediano è mediocre, i migliori sono genuinamente eccellenti, e nessun segnale superficiale li distingue. Le skill che falliscono il nostro controllo di installazione hanno centinaia di stelle. Due dei nostri sei migliori punteggi provengono da repository che quasi nessuno conosce.
La correzione consueta prima o poi arriva, un misto di livelli di revisione e reputazione. Fino ad allora, l'onere ricade su chi installa, e i numeri sopra sono ciò a cui somiglia quell'onere: il 22% delle skill testate rotte così come vengono distribuite, il 69% con trigger imperfetti, l'89% con documentazione che ha perso punti. Continueremo a pubblicare i dati in ogni caso. Il protocollo completo e la griglia di valutazione sono sulla pagina metodologia, e ogni cifra di questo articolo è riproducibile dalle note di test per singola skill.
Domande frequenti
Perché la mia skill Claude non si attiva?
Controlla tre cose in ordine. Primo, il percorso: SKILL.md deve trovarsi in ~/.claude/skills/<nome>/SKILL.md, non una cartella più in profondità; una skill annidata male fallisce silenziosamente. Secondo, il description nel frontmatter: se suona come uno slogan, Claude non ha nulla con cui confrontare il tuo prompt. Riscrivilo per nominare le frasi esatte che digiti davvero, o passalo nel validatore di skill. Terzo, scrivi il prompt con parole prese testualmente dalla descrizione; se si attiva, la copertura della descrizione è il tuo problema.
Come decidete che una skill "funziona"?
Installazione pulita su un setup nuovo seguendo le istruzioni dell'autore stesso, controlli di attivazione in entrambe le direzioni (si attiva sui prompt dichiarati, resta silente su quelli non correlati), e un compito reale valutato rispetto a una baseline senza skill, che vale 10 punti su 25. Verdetti: promossa, funziona-con-setup, o ancora in coda. La pagina metodologia ha la griglia di valutazione; ogni pagina skill ha le note.
Le skill ufficiali Anthropic sono più affidabili di quelle della community?
Più affidabili in media: 10 delle 11 che abbiamo testato sono passate senza problemi, e l'eccezione (brand-guidelines) richiede configurazione di proposito. Ma la media non è il numero interessante. Due dei nostri sei migliori punteggi provengono dal repository di un unico autore della community, e humanizer, una skill della community, è una delle sole due skill a ottenere 10/10 sull'output. I risultati dei test battono la provenienza.
Questi risultati significano che dovrei evitare le skill Claude?
Il contrario. Il livello testato è silenziosamente eccellente: 19 skill su 45 hanno ottenuto 9 o più sull'output vs. baseline, e le prime sei sono la differenza tra Claude come finestra di chat e Claude come strumento che produce lavoro finito. La scoperta è più circoscritta di "le skill non funzionano". È che metà di ciò che viene pubblicato ha un difetto che non puoi vedere dall'elenco, quindi installa dai dati di test, non dalle stelle.
★ 9.6/10 × 3
Lo starter pack gratuito
I 3 skill con i nostri punteggi di test più alti, più la checklist di installazione: il setup che metteremmo su una macchina appena formattata. Gratis, via email.