
Creamos un servidor MCP para verificar skills antes de instalar
Instalar una skill de Claude es un acto de fe. Encuentras un SKILL.md en GitHub, el README parece convincente, el número de estrellas es tranquilizador y lo copias en ~/.claude/skills/. Si realmente hace algo útil, lo descubres más tarde, normalmente en medio del trabajo que intentabas hacer.
Pasamos nuestros días cerrando esa brecha manualmente: instalamos la skill, ejecutamos una tarea real dos veces (una con ella y otra sin ella) y publicamos la diferencia. 743 skills hasta ahora. La parte incómoda siempre fue el último tramo. Los veredictos estaban en un sitio web, y los sitios web son para humanos. Lo que instala tus skills es un agente.
Así que pusimos los veredictos donde ya está el agente.
Una línea
claude mcp add skillproof -- npx -y skillproof-mcp
Esa es toda la configuración. Sin clave de API, sin cuenta, sin archivo de configuración que editar a mano. Funciona en cualquier cliente MCP: Claude Code, Claude Desktop, Cursor, Windsurf, Zed.
Ahora, antes de que tu agente clone cualquier cosa, puede preguntar.
Lo que realmente responde
El servidor expone dos herramientas que se corresponden con las dos preguntas que la gente realmente se hace.
find_skill — "¿hay alguna skill probada para esto?" Describes el trabajo y recibes coincidencias clasificadas por su puntuación, cada una con el veredicto, la puntuación sobre 10, lo que encontró nuestra prueba y el comando de instalación.
check_skill — "alguien me recomendó esta, ¿es buena?" Nombras una skill, un slug o un repositorio de GitHub y obtienes nuestro veredicto, o un honesto "no hemos probado esto, trátalo como no verificado".
Cada respuesta lleva uno de tres veredictos:
- pass — se instaló limpiamente, se activó cuando debía y superó a Claude sin skills en una tarea real.
- setup — cumple su función, pero no de inmediato. La nota indica exactamente lo que tienes que hacer primero.
- didn't pass — obtuvo una puntuación inferior a la de referencia sin skills. O no se pudo ejecutar en absoluto, o se ejecutó y te dejó en una situación peor que si no la hubieras instalado.
Ese tercer veredicto es el que hace que valga la pena instalar esto.
La respuesta de la que estamos más orgullosos
Pídele al servidor una skill que convierta Markdown a la sintaxis wiki de Confluence, y esto es lo que devuelve:
Confluence — DIDN'T PASS Lo que encontró nuestra prueba: ejecutamos el
convert_markdown_to_wiki.pyincluido en un documento de muestra real. Convierte silenciosamente el texto**bold**en cursiva de wiki —un error de regex genuino, no una elección de estilo— y deja las tablas estándar de estilo GitHub sin convertir, a pesar de queSKILL.mdlista explícitamente "tablas" entre los elementos que maneja.
Un directorio que solo listara ganadores te habría mostrado esa skill con una descripción amigable y te habría dejado encontrar el bug de negrita-a-cursiva por ti mismo, en un documento que ya habrías enviado a tu equipo. El nuestro le dice a tu agente que no se moleste.
Hay 31 skills como esa en el catálogo en este momento: probadas, publicadas y marcadas en rojo. Otras 59 empatan con Claude sin skills: se ejecutan, producen algo, y ese algo no es mejor que lo que habrías obtenido de todos modos. Nadie más publica ninguna de estas cifras, porque ninguna de las dos favorece al ecosistema.
De dónde vienen los datos
El servidor no almacena datos propios. Lee de skillproof.dev/api/skills.json —el mismo catálogo en vivo que renderiza el sitio web— y lo guarda en caché durante quince minutos. Cuando una skill se vuelve a probar después de una nueva versión de Claude, la respuesta que recibe tu agente cambia con ella. Nada que actualizar, nada que reinstalar.
La rúbrica de puntuación es pública: instalación /5, activación /5, resultado-vs-referencia /10, documentación y honestidad /5, normalizado a una puntuación sobre diez. Está detallada por completo en nuestra página de metodología, incluyendo por qué el resultado vale tanto como todo lo demás combinado.
Si estás construyendo tus propias herramientas, el catálogo está abierto bajo CC BY: puedes tomar el JSON, o todo el contenido como texto plano, y citar a skillproof.dev.
Los límites honestos
Hay dos cosas que esto no hace.
No lo cubre todo. Hemos probado 743 skills de las 16.682 que hemos indexado: el segmento superior por estrellas y por nuestro filtro automatizado. Si tu trabajo es de nicho, la respuesta bien podría ser "ninguna skill probada coincide todavía con esto", y el servidor dice exactamente eso en lugar de inventar una recomendación. Preferimos no devolver nada a respaldar algo que nunca hemos ejecutado.
Y un veredicto tiene una fecha. Las skills cambian con el tiempo; una skill que funcionaba en junio puede romperse cuando una de sus dependencias cambia. Cada ficha lleva la fecha en que la ejecutamos, y el servidor transmite esa fecha. Los veredictos antiguos son un hecho del mundo real, no un bug que podamos solucionar con código, pero siempre sabrás cuán antiguo es el que estás leyendo.
Instálalo y olvídate
El mejor de los casos para esta herramienta es que nunca más pienses en ella. Tu agente verifica silenciosamente antes de instalar, omite las tres skills que te habrían hecho perder la tarde y elige la que realmente fue probada para el trabajo que estás haciendo.
claude mcp add skillproof -- npx -y skillproof-mcp
El código fuente está en GitHub, con licencia MIT. Está listado en el registro oficial de MCP como io.github.Skillproofdev/skillproof. Si te da una mala respuesta, es un bug en nuestras pruebas, no en la infraestructura; avísanos y volveremos a ejecutar la skill.
★ 9.6/10 × 3
El pack de inicio gratis
Los 3 skills con nuestras mejores puntuaciones de test más la checklist de instalación: el setup que pondríamos en una máquina recién estrenada. Gratis, por email.