
Server MCP per verificare le skill di Claude prima di installarle
Installare una skill di Claude è un atto di fede. Trovi un file SKILL.md su GitHub, il README sembra convincente, il numero di stelle rassicurante, e lo copi in ~/.claude/skills/. Se poi faccia davvero qualcosa di utile, lo scopri solo dopo — di solito nel bel mezzo del lavoro che stavi cercando di portare a termine.
Passiamo le nostre giornate a colmare questa lacuna manualmente: installiamo la skill, eseguiamo un'attività reale due volte, una con e una senza la skill, e pubblichiamo la differenza. Finora, 743 skill. La parte più scomoda è sempre stata l'ultimo miglio. I verdetti si trovavano su un sito web, e i siti web sono per gli esseri umani. Lo strumento che installa le tue skill è un agente.
Così abbiamo messo i verdetti dove l'agente già si trova.
Una riga
claude mcp add skillproof -- npx -y skillproof-mcp
L'installazione è tutta qui. Nessuna chiave API, nessun account, nessun file di configurazione da modificare a mano. Funziona con qualsiasi client MCP — Claude Code, Claude Desktop, Cursor, Windsurf, Zed.
Ora, prima che il tuo agente cloni qualsiasi cosa, può chiedere.
Cosa risponde effettivamente
Il server espone due strumenti, che corrispondono alle due domande che gli utenti si pongono.
find_skill — "esiste una skill testata per questo?" Descrivi l'attività; ottieni in risposta le corrispondenze ordinate per punteggio, ognuna con il verdetto, il punteggio /10, i risultati del nostro test e il comando di installazione.
check_skill — "qualcuno mi ha consigliato questa, è valida?" Indichi una skill, uno slug o un repository GitHub; ottieni il nostro verdetto, oppure un onesto "non l'abbiamo testata — considerala non verificata".
Ogni risposta porta uno di tre verdetti:
- pass — installata correttamente, attivata quando previsto e ha superato Claude base su un'attività reale.
- setup — funziona, ma non immediatamente. La nota indica esattamente cosa devi fare prima.
- didn't pass — ha ottenuto un punteggio inferiore alla baseline senza skill. O non è stato possibile eseguirla, oppure ha funzionato ma con un risultato peggiore rispetto a non installarla.
È questo terzo verdetto che rende utile l'installazione.
La risposta di cui siamo più fieri
Chiedi al server una skill che converta Markdown in markup wiki di Confluence, ed ecco cosa risponde:
Confluence — NON SUPERATO Risultati del nostro test: eseguito lo script
convert_markdown_to_wiki.pyincluso su un documento di esempio reale. Converte silenziosamente il testo**bold**in corsivo wiki — un vero e proprio bug nella regex, non una scelta stilistica — e lascia le tabelle standard in stile GitHub completamente non convertite, nonostanteSKILL.mdelenchi esplicitamente le "tabelle" tra gli elementi gestiti.
Un catalogo che elenca solo i vincitori ti avrebbe mostrato quella skill con una descrizione amichevole, lasciando che fossi tu a scoprire il bug del grassetto che diventa corsivo, in un documento già inviato al tuo team. Il nostro dice al tuo agente di non provarci nemmeno.
Al momento nel catalogo ci sono 31 skill di questo tipo — testate, pubblicate e contrassegnate in rosso. Altre 59 sono alla pari con Claude base: funzionano, producono un risultato, e questo risultato non è migliore di quello che avresti ottenuto comunque. Nessun altro pubblica questi numeri, perché nessuno dei due lusinga l'ecosistema.
Da dove vengono i dati
Il server non contiene dati propri. Legge skillproof.dev/api/skills.json — lo stesso catalogo live che il sito web renderizza — e lo memorizza in cache per quindici minuti. Quando una skill viene ritestata dopo una nuova versione di Claude, la risposta che il tuo agente riceve cambia di conseguenza. Niente da aggiornare, niente da reinstallare.
La griglia di valutazione è pubblica: installazione /5, attivazione /5, output vs. baseline /10, documentazione e onestà /5, normalizzato a un punteggio su dieci. È descritta per intero nella nostra pagina sulla metodologia, compreso il motivo per cui l'output vale quanto tutto il resto messo insieme.
Se stai costruendo i tuoi strumenti, il catalogo è aperto sotto licenza CC BY — puoi usare il JSON, o l'intero contenuto come testo semplice, citando skillproof.dev.
I limiti, con onestà
Ci sono due cose che questo strumento non fa.
Non copre tutto. Abbiamo testato 743 skill sulle 16.682 che abbiamo indicizzato — la fascia più alta per numero di stelle e secondo la nostra selezione automatizzata. Se il tuo lavoro è di nicchia, la risposta potrebbe essere "nessuna skill testata corrisponde ancora a questa richiesta", e il server lo dice esplicitamente invece di inventare una raccomandazione. Preferiamo non restituire nulla piuttosto che garantire per qualcosa che non abbiamo mai eseguito.
E ogni verdetto ha una data. Le skill evolvono; una skill che ha superato il test a giugno può smettere di funzionare se una sua dipendenza cambia. Ogni scheda riporta la data in cui abbiamo eseguito il test, e il server trasmette questa data. I verdetti datati sono un dato di fatto, non un bug che possiamo aggirare con il codice — ma saprai sempre quanto è vecchio quello che stai leggendo.
Installalo e non pensarci più
Il caso d'uso migliore per questo strumento è che tu non ci debba più pensare. Il tuo agente controlla silenziosamente prima di installare, scarta le tre skill che ti avrebbero fatto perdere la serata e sceglie quella che è stata effettivamente testata per il lavoro che stai facendo.
claude mcp add skillproof -- npx -y skillproof-mcp
Il codice sorgente è su GitHub, con licenza MIT. È elencato nel registro ufficiale MCP come io.github.Skillproofdev/skillproof. Se ti dà una risposta sbagliata, è un bug nel nostro processo di test, non nell'infrastruttura — segnalacelo e rieseguiremo il test della skill.
★ 9.6/10 × 3
Lo starter pack gratuito
I 3 skill con i nostri punteggi di test più alti, più la checklist di installazione: il setup che metteremmo su una macchina appena formattata. Gratis, via email.