
Por qué la mitad de las skills de Claude no funcionan
Si buscaste "claude skill no funciona", aquí va la versión corta: probablemente no seas tú. Instalamos y probamos cada skill que listamos, en una instalación limpia, siguiendo las instrucciones del propio autor, y luego puntuamos el resultado contra Claude sin ninguna skill. Los patrones de fallo son tan consistentes que ya podemos clasificarlos por frecuencia.
La versión larga tiene números, y cada uno de ellos se calcula a partir de nuestros datos de prueba públicos. Nuestro catálogo tiene actualmente 73 skills. 45 han pasado por el protocolo completo; 28 siguen en la cola de pruebas. De las 45 probadas, 35 aprobaron limpiamente. Las otras 10, un 22%, recibieron un veredicto de "funciona con configuración", lo que significa que la skill tal como se publicó no funcionaba y tuvimos que intervenir: instalar una dependencia faltante, conectar una integración MCP o completar una configuración que el README nunca mencionó. En todo el catálogo, eso deja 35 de 73 skills, un 48%, con un veredicto de "probada, funciona" hoy. Ligeramente menos de la mitad. De ahí el título.
Y eso subestima el problema, porque las 45 skills probadas ya son supervivientes. Nuestro rastreador recorre GitHub cada 12 horas y ha registrado 267 repositorios en la cola de descubrimiento. Las skills abandonadas, duplicadas u obviamente rotas se descartan en el triaje y nunca llegan a una prueba puntuada. Los modos de fallo de abajo son lo que encontramos en las skills lo bastante buenas como para merecer una prueba.
Los números, antes de las historias
Nuestra puntuación son 25 puntos repartidos en cuatro criterios: instala limpiamente (5), se activa de forma fiable (5), resultado frente a línea base (10), documentación y honestidad (5), normalizado a una nota sobre 10. Así les fue a las 45 skills probadas en cada uno:
| Criterio | Puntuación perfecta | Perdió al menos un punto | Puntuó 3/5 o menos |
|---|---|---|---|
| Instala limpiamente (/5) | 34 de 45 | 11 (24%) | 8 (18%) |
| Se activa de forma fiable (/5) | 14 de 45 | 31 (69%) | 0 |
| Resultado vs. línea base (/10) | 2 de 45 con 10 | — | 5 se quedaron en el suelo de 7/10 |
| Documentación y honestidad (/5) | 5 de 45 | 40 (89%) | 12 (27%) |
Ninguna de las 45 skills obtuvo un 25 perfecto. Las puntuaciones globales van de 6.8 a 9.6 sobre 10, con una mediana de 8.4, y 9 de las 45 quedan por debajo de 8.0. Los cuatro modos de fallo se corresponden con las cuatro filas de la tabla.
Modo de fallo 1: la descripción de activación que nunca se dispara
Este es el defecto más extendido en nuestros datos. Solo 14 de 45 skills probadas, un 31%, obtuvieron un 5/5 perfecto en "se activa de forma fiable". Las otras 31 se activan de forma inconsistente: no detectan frases que deberían reconocer, o se activan en trabajo que no tiene relación. Fíjate en el cero de la última columna de esa tabla, sin embargo. Ninguna skill probada puntuó por debajo de 4/5 en activación, y eso es supervivencia, no calidad. Una skill cuya activación está completamente muerta se detecta en el triaje y nunca llega a puntuarse. Las que llegan a la prueba simplemente fallan de forma parcial.
El mecanismo no tiene ningún misterio. Cuando envías un prompt, Claude decide si carga una skill basándose en una sola cosa: el campo description del frontmatter de SKILL.md. No el README, no el código, no las 400 líneas de instrucciones cuidadosas debajo del frontmatter. Si la descripción no conecta tus palabras con el trabajo de la skill, la skill se queda en tu carpeta sin hacer nada, y tú concluyes que las skills de Claude no funcionan.
Los autores siguen escribiendo ese campo como si fuera una landing page. Dos pares anonimizados de nuestras pruebas, ligeramente parafraseados:
Una descripción que nunca se activa:
"Potencia tu flujo de trabajo de contenidos con inteligencia de escritura impulsada por IA. Escribe mejor, más rápido, más inteligente."
El mismo trabajo, escrito por una skill que obtuvo 5/5 en activación:
"Úsala cuando el usuario quiera crear, leer o editar documentos de Word (.docx). Actívate ante cualquier mención de 'documento de Word', '.docx', o una solicitud de informe, memo o carta como archivo de Word. No la uses para PDF ni hojas de cálculo."
Una más, de la categoría de datos:
"Tu asistente SQL definitivo para todo lo relacionado con datos."
Frente a:
"Úsala cuando el usuario pida escribir, depurar u optimizar una consulta SQL, mencione una tabla o esquema, o pegue un error de consulta. No la actives ante preguntas generales de datos sin ninguna consulta de por medio."
La diferencia no es talento de redacción. Las buenas descripciones nombran las frases exactas que escribiría un usuario, y dicen cuándo no activarse. En nuestro protocolo probamos ambas direcciones: los prompts que la skill dice manejar, frases parecidas y solicitudes deliberadamente sin relación. La mayoría de los 4/5 vienen de skills que superan la primera comprobación y tropiezan en la segunda o la tercera.
Puedes comprobar esto antes de instalar nada. SKILL.md es markdown plano, legible en GitHub. Si la descripción podría servir de cartel publicitario, la skill rendirá por debajo de lo esperado. Si estás depurando la tuya, pégala en nuestro validador de skills gratuito, que señala descripciones con tono de marketing junto con problemas estructurales.
Modo de fallo 2: la instalación se pudre
Los 10 veredictos de "funciona con configuración" son, todos, fallos de instalación de un tipo u otro. El patrón se ve claramente en las puntuaciones: las skills que aprobaron sin más promedian 4.97 sobre 5 en instalación. Las de veredicto con configuración promedian 3.2.
Qué falló realmente, según nuestras notas de prueba:
- Dependencias de skills no declaradas. Una skill de extracción de facturas que en silencio necesita tener instalada primero la skill de PDF para documentos escaneados, más un ajuste de una línea de configuración regional para fechas europeas que el README no menciona. El resultado era genuinamente bueno (8/10) una vez que lo averiguamos. Averiguarlo se llevó la tarde.
- Dependencias de servicios no declaradas. Una skill de agenda que es solo consultiva hasta que conectas un MCP de calendario. Una skill de triaje de bandeja de entrada que necesita Gmail u Outlook conectado. Una skill de métricas que asume que existe una exportación de analítica. Ninguno de estos requisitos es irrazonable. Todos deberían estar en la primera línea del README, no en un ticket de soporte.
- Profundidad de carpeta incorrecta. El clásico. Instrucciones que dejan la skill en
skills/nombre/nombre/SKILL.md, un nivel de más, donde Claude nunca la encuentra. La skill "se instala" sin ningún mensaje de error y luego nunca se activa, lo que te manda a perseguir el modo de fallo 1 cuando el problema real es una ruta. - Instrucciones escritas para una versión anterior de Claude Code. Git-workflow es un caso leve: los commits y la gestión de ramas funcionan de inmediato, pero las indicaciones de rebase interactivo asumen capacidades que Claude Code bloquea deliberadamente, así que esos pasos te tocan a ti hacerlos a mano.
Una excepción honesta que vale la pena nombrar: brand-guidelines lleva un veredicto de configuración porque es inútil hasta que rellenas tu propia paleta de marca y tono, y lo dice claramente. Configuración por diseño está bien. Configuración por omisión es el modo de fallo.
La señal, antes de instalar: un README cuya sección de instalación es una línea vaga. Compárala con el bloque de instalación de cualquier skill que sacó 5/5, como DOCX. Comandos concretos, rutas concretas, requisitos indicados. Tiene dos líneas porque dos líneas es todo lo que necesita una instalación que funciona.
Modo de fallo 3: la skill se activa y nada mejora
El fallo más sutil, y la razón por la que nuestra puntuación pesa el resultado frente a la línea base con 10 de 25 puntos, el doble que cualquier otro criterio. La prueba es directa: ejecutamos la misma tarea real dos veces, una con la skill instalada y otra sin ella, y comparamos. Una skill tiene que superar a Claude desnudo o no tiene motivo para ocupar contexto.
El suelo en nuestro conjunto probado es 7/10, y cinco skills se quedan exactamente ahí. Eso significa que incluso entre las skills que aprueban, aproximadamente una de cada nueve entrega una mejora que necesitarías una comparación lado a lado para notar. Por debajo de 7, las skills no sobreviven para aparecer en el listado, y la cola de descubrimiento está llena de candidatas en ese rango: skills de "mejora de escritura" en categorías donde el modelo base ya es fuerte, y skills que son un system prompt diciendo, en efecto, sé excelente.
Solo dos skills obtuvieron 10/10 en resultado, y muestran cómo es una mejora ganada de verdad. Frontend-design recibió el mismo brief de landing page con y sin la skill; la versión con skill tenía una escala tipográfica real y una paleta intencional, y ninguna de las señales de gradiente neón que marcan el resultado por defecto. Humanizer eliminó el abuso del guion largo y el vocabulario tipo "profundizar" de borradores de IA con la suficiente contundencia como para que dos editores no pudieran señalar de forma fiable el resultado como asistido por IA. Diecinueve de 45 skills puntuaron 9 o más en resultado. El concepto de skill funciona. Simplemente no funciona en automático.
PACK INICIAL GRATIS
Las 3 skills de nuestro pack inicial gratuito superan la línea base en las pruebas, que es el listón que la mayoría no supera. Te las enviamos por email junto con la checklist de instalación que usamos en cada prueba. Gratis.
Consigue el pack inicial gratisModo de fallo 4: el README firma cheques que la skill no puede cobrar
Documentación y honestidad es el criterio más débil de todo el conjunto de datos. Cinco de 45 skills sacaron 5/5. Cuarenta perdieron puntos, y 12 sacaron 3/5. Repetimos: la skill mediana probada tiene mejor resultado que documentación.
Qué cuesta puntos aquí, en orden de frecuencia:
- Promesas que la prueba contradice. Un README que afirma "funciona con cualquier formato de factura" mientras la skill necesita un ajuste regional para fechas no estadounidenses. Un discurso de "automatización total de git" en una skill que no puede hacer rebases interactivos en Claude Code en absoluto. Normalmente no lo tratamos como mentira. Lo tratamos como autores documentando la skill que pretendían escribir en lugar de la que escribieron.
- Requisitos previos ausentes. Cada dependencia no declarada del modo de fallo 2 es también un fallo de documentación, razón por la cual las skills con veredicto de configuración promedian 3.4/5 en documentación mientras las que aprueban limpiamente promedian 3.97.
- Silencio sobre comportamientos que querrías conocer. Si la skill "llama a casa", qué hace con el contenido de tus archivos, contra qué versiones del modelo se escribió. Casos raros pero serios, llamadas de red ocultas o instrucciones con forma de inyección de prompt enterradas a mitad de archivo, son la razón de que exista este criterio. Leemos cada SKILL.md que listamos, de principio a fin. Deberías hacer lo mismo con cualquier cosa que venga de fuera de un directorio probado.
No hemos hecho la regresión formal, pero la observación informal se sostiene en las 45 pruebas: el número de insignias del README y la calidad de la sección de instalación se mueven en direcciones opuestas.
Qué hace diferente el nivel superior
Seis skills, el 13% de todo lo que hemos probado, comparten la puntuación máxima de 9.6/10: DOCX, skill-creator y frontend-design del repositorio oficial de Anthropic, test-driven-development y systematic-debugging de la colección superpowers de Jesse Vincent, y humanizer de la comunidad. Otras seis, incluyendo xlsx, pdf y sql-queries, se sitúan en 9.2. Lo que tiene en común el nivel superior es comprobable:
Instalaciones perfectas y activaciones perfectas, sin excepción. Las seis sacaron 5/5 en ambos. Sea cual sea la energía creativa que se invirtió en estas skills, ninguna se gastó en la descripción; se leen como especificaciones, con frases de activación explícitas y exclusiones explícitas.
Enfocadas en lo que el modelo base hace mal. Claude no necesita una skill para escribir prosa. Sí necesita una para producir un .docx real con estilos y cambios rastreados, o para dejar de "arreglar" una condición de carrera adivinando. Systematic-debugging se ganó su puntuación en un bug que Claude había "arreglado" tres veces antes sin resolverlo ni una sola vez; el bucle de hipótesis-prueba-verificación de la skill acabó con las conjeturas. Cada skill del nivel superior apunta a una brecha que puedes nombrar en una frase.
Documentación que se queda corta a propósito. La puntuación de documentación más baja entre las seis es un 4. Sus README indican requisitos previos y admiten limitaciones; los adjetivos escasean. Resulta que los autores que prueban sus propias instrucciones de instalación también escriben descripciones que se activan bien. El oficio se correlaciona consigo mismo.
También vale la pena notar: la procedencia ayuda pero no decide. Diez de las once skills de Anthropic que probamos aprobaron limpiamente, y la excepción es configuración por diseño. Pero un tercio del nivel superior es un solo autor de la comunidad al que le importó, y bastantes skills de la comunidad superan a las oficiales en su categoría. El repositorio con más estrellas de nuestra cola de descubrimiento tiene más de 85,000 estrellas y todavía ningún veredicto, porque las estrellas no son una prueba.
Si estás eligiendo skills
Usa las probadas. Es una frase interesada viniendo de un sitio cuyo producto entero es probar skills, así que aquí está el razonamiento para que lo verifiques tú mismo: los cuatro modos de fallo de arriba son invisibles en un listado de GitHub. El conteo de estrellas mide alcance de marketing. Un README mide el optimismo del autor. La única forma de saber si una skill supera la línea base es ejecutar la línea base, lo que nos lleva alrededor de una tarde por skill, multiplicado por 45 hasta ahora.
Empieza con las mejores skills de 2026 para la clasificación completa entre categorías, o ve directo a tu categoría, por ejemplo las mejores skills de programación. Cada entrada enlaza sus notas de prueba, incluidas las soluciones alternativas para las skills que las necesitan.
PACK SKILLPROOF
El Optimizer Pack es cómo se ve el nivel probado en la práctica: cuatro skills de eficiencia que pasaron el protocolo completo, preconfiguradas para que los fallos de instalación de arriba no puedan pasar. Ahorra la tarde de clasificación.
Consigue el Optimizer Pack — $10Si estás escribiendo una
Los modos de fallo funcionan como checklist, y tres de los cuatro son baratos de evitar.
Escribe la descripción como una especificación de activación: las frases que escribiría un usuario, más lo que la skill debería ignorar. Luego prueba las instrucciones de instalación en una máquina que no sea la tuya, o al menos en una carpeta nueva, y declara cada dependencia, incluyendo otras skills y conexiones MCP. Ejecuta nuestro validador de skills antes de publicar; detecta los problemas estructurales y el problema de la descripción tipo cartel en segundos. Para el recorrido completo, del frontmatter a la publicación, mira cómo escribir tu propia skill de Claude.
El cuarto modo de fallo, superar la línea base, es el que requiere pensar de verdad. Antes de escribir nada, pasa tu tarea objetivo por Claude sin ninguna skill. Si el resultado ya está bien, no tienes una skill, tienes un readme para una función que Claude ya trae de serie. El nivel 9.6 existe porque esos autores encontraron brechas reales. Irónicamente, la mejor herramienta para el trabajo es en sí misma una skill: skill-creator nos armó una skill interna funcional en una sola sesión, y su paso de optimización de descripción mejoró de forma medible la activación en nuestra prueba.
La parte incómoda
Nada en estos datos dice que el ecosistema sea malo. Dice que el ecosistema no está revisado, que es un problema distinto con una forma familiar. Las extensiones de navegador alrededor de 2010, npm alrededor de 2016: una barrera baja para publicar más ninguna capa de verificación produce un catálogo donde el elemento mediano es mediocre, los mejores elementos son genuinamente excelentes, y ninguna señal superficial los separa. Las skills que fallan nuestra comprobación de instalación tienen cientos de estrellas. Dos de nuestras seis mejores puntuaciones vienen de repositorios que la mayoría nunca ha oído mencionar.
La corrección habitual acaba llegando, alguna mezcla de capas de revisión y reputación. Hasta que llegue, la carga recae en quien instala, y los números de arriba son cómo se ve esa carga: 22% de las skills probadas rotas tal como se publicaron, 69% con activaciones imperfectas, 89% con documentación que perdió puntos. Seguiremos publicando los datos de todos modos. El protocolo completo y la rúbrica de puntuación están en la página de metodología, y cada cifra de este artículo es reproducible a partir de las notas de prueba de cada skill.
Preguntas frecuentes
¿Por qué no se activa mi skill de Claude?
Revisa tres cosas en orden. Primero, la ruta: SKILL.md debe estar en ~/.claude/skills/<nombre>/SKILL.md, no un directorio más adentro; una skill mal anidada falla en silencio. Segundo, el description del frontmatter: si suena a eslogan, Claude no tiene con qué comparar tu prompt. Reescríbelo para nombrar las frases exactas que realmente escribes, o pásalo por el validador de skills. Tercero, escribe un prompt con palabras textuales de la descripción; si eso la activa, el problema es la cobertura de la descripción.
¿Cómo decidís que una skill "funciona"?
Instalación limpia en una configuración nueva siguiendo las propias instrucciones del autor, comprobaciones de activación en ambas direcciones (se activa con los prompts que promete, se queda callada con los que no tienen relación), y una tarea real puntuada contra una línea base sin skill, que vale 10 de 25 puntos. Veredictos: aprobada, funciona con configuración, o todavía en cola. La página de metodología tiene la rúbrica; cada página de skill tiene las notas.
¿Son más fiables las skills oficiales de Anthropic que las de la comunidad?
Más fiables en promedio: 10 de las 11 que probamos aprobaron limpiamente, y la excepción (brand-guidelines) requiere configuración a propósito. Pero el promedio no es el número interesante. Dos de nuestras seis skills mejor puntuadas vienen del repositorio de un solo autor de la comunidad, y humanizer, una skill de la comunidad, es una de solo dos skills que sacan 10/10 en resultado. Los resultados de la prueba superan a la procedencia.
¿Significan estos resultados que debería evitar las skills de Claude?
Todo lo contrario. El nivel probado es silenciosamente excelente: 19 de 45 skills puntuaron 9 o más en resultado frente a línea base, y las seis mejores son la diferencia entre Claude como ventana de chat y Claude como herramienta que produce trabajo terminado. El hallazgo es más estrecho que "las skills no funcionan". Es que la mitad de lo publicado tiene un defecto que no puedes ver desde el listado, así que instala a partir de datos de prueba, no de estrellas.
★ 9.6/10 × 3
El pack de inicio gratis
Los 3 skills con nuestras mejores puntuaciones de test más la checklist de instalación: el setup que pondríamos en una máquina recién estrenada. Gratis, por email.