¿Cuántas skills de Claude superan al modelo base? Lo medimos.

¿Cuántas skills de Claude superan al modelo base? Lo medimos.

¿Cuántas skills de Claude son realmente mejores que Claude sin skills? Lo medimos.

La promesa de las skills de Claude es atractiva: una biblioteca de herramientas que se pueden instalar para dar al modelo nuevas capacidades, desde interactuar con APIs hasta generar código complejo. El catálogo oficial y los repositorios de terceros listan miles de ellas. Pero esto plantea una pregunta crítica para cualquier desarrollador cuyo tiempo es valioso: ¿las skills de Claude realmente mejoran el resultado de forma medible?

Es fácil encontrar skills que afirman ser revolucionarias. Es mucho más difícil encontrar pruebas objetivas. La mayoría de los directorios de skills son solo eso: directorios. Listan skills basándose en la descripción del autor, pero no validan las afirmaciones. Una skill puede estar rota, desactualizada o, en muchos casos, no ser mejor que lo que el modelo base puede hacer por sí solo. Esto crea un problema significativo de señal-ruido.

En SkillProof, no listamos skills; las probamos. Como ejecutamos cada skill del catálogo contra una base de referencia, podemos afirmar la fracción real que supera a Claude sin skills, con la evidencia que lo respalda. Este artículo presenta esa evidencia. Medimos el rendimiento de cada skill contra el mismo modelo sin ninguna skill instalada para determinar si proporciona un beneficio real y cuantificable.

El problema de señal-ruido en el descubrimiento de skills

Si has intentado integrar skills en tu flujo de trabajo, probablemente te has encontrado con el problema del descubrimiento. Tienes una tarea en mente, quizás generar configuraciones de Terraform o interactuar con una API de SaaS específica. Buscas en un catálogo, encuentras una skill con un nombre prometedor y lees su archivo SKILL.md, que describe su función y proporciona ejemplos de uso.

La instalas y pruebas el prompt de ejemplo. A veces funciona. Con más frecuencia, el proceso implica fricción. La skill puede lanzar un error, requerir variables de entorno no documentadas o producir un resultado que no se parece en nada al ejemplo. Puedes pasar una hora depurando la herramienta de otra persona solo para descubrir que estaba mal escrita o fue abandonada hace meses.

Este ciclo de prueba y error es ineficiente. El problema principal es que la mayoría de los catálogos de skills funcionan como gestores de paquetes sin un pipeline de CI/CD. Indexan lo que existe pero no ofrecen ninguna garantía de calidad. No hay una verificación independiente que confirme que una skill funciona como se anuncia, y mucho menos que ofrezca una mejora sobre un prompt bien elaborado para el modelo base. La carga de las pruebas recae completamente en el usuario final.

Este es el problema que nos propusimos resolver. Para determinar si vale la pena instalar las skills de código de Claude, se necesita una metodología de prueba consistente y repetible, y una base de referencia clara para la comparación.

Cómo medimos "mejor": la base de referencia sin skills

Para responder a la pregunta "¿es esta skill mejor que nada?", se necesita una definición rigurosa de "nada". Para nosotros, "nada" es el modelo base de Claude en sí mismo, lo que llamamos la base de referencia sin skills. Toda nuestra metodología se basa en comparar el rendimiento de una skill con este control.

El proceso es directo y está diseñado para reflejar un caso de uso del mundo real. Para cada skill, realizamos los siguientes pasos:

  1. Definir casos de prueba: Analizamos la función prevista de la skill y creamos un conjunto de tareas representativas. Para un generador de manifiestos de Kubernetes, esto podría implicar prompts para crear objetos Deployment, Service e Ingress con complejidad variable.

  2. Ejecutar la base de referencia: Ejecutamos estos prompts de prueba contra el modelo Claude simple sin ninguna skill instalada. Guardamos el resultado como nuestro caso de control. Esto muestra lo que un usuario competente podría lograr solo con prompts.

  3. Ejecutar la skill: Instalamos la skill y ejecutamos exactamente el mismo conjunto de prompts de prueba. Este es nuestro caso experimental.

  4. Puntuar los resultados: Un revisor humano compara el resultado de la base de referencia y el de la skill, uno al lado del otro. Usamos una rúbrica detallada para puntuarlos en corrección, completitud, seguimiento de instrucciones y eficiencia. El veredicto final es una única puntuación sobre 10 que mide la mejora proporcionada por la skill sobre la base de referencia.

Una puntuación alta (8-10/10) indica una mejora significativa. Una puntuación media (6-7/10) indica una skill funcional que ofrece un beneficio marginal. Una puntuación baja (1-5/10) indica una skill que tiene errores, es difícil de usar o tiene un rendimiento peor que la base de referencia. Puedes leer todos los detalles de nuestro sistema de puntuación en nuestra página /methodology.

Esta comparación claude skills vs no skill baseline es la única forma de generar datos objetivos sobre el valor real de una skill. Las afirmaciones de marketing y las descripciones del autor son irrelevantes; lo único que importa es el rendimiento medido en una tarea real.

El veredicto: ¿Qué porcentaje de skills de Claude funciona?

Entonces, ¿qué dicen los datos? Después de aplicar nuestra metodología al ecosistema público de skills, surge una imagen clara. Al momento de escribir esto, hemos instalado y ejecutado 1416 skills únicas.

Los resultados muestran que la mayoría de las skills aportan algún valor, pero una porción muy significativa —más de un tercio— están rotas, requieren una configuración compleja o son activamente perjudiciales para el rendimiento del modelo.

Aquí está el desglose de alto nivel de nuestros hallazgos:

Veredicto Cantidad Porcentaje del total Descripción
Aprobada y listada 889 63% La skill se instala sin problemas, funciona como se describe y obtiene una puntuación más alta que la base de referencia sin skills.
Requiere configuración manual 467 33% La skill es funcional pero requiere una configuración no documentada (p. ej., variables de entorno, claves de API) o tiene advertencias importantes.
Puntúa por debajo de la base 60 4% La skill es activamente perjudicial, produciendo un resultado menos preciso, menos completo o más propenso a errores que Claude simple.

Estos números son aleccionadores. Aunque es bueno que casi dos tercios de las skills pasen nuestra verificación, significa que si eliges una skill al azar de un catálogo público, tienes 1 de cada 3 posibilidades de que sea una pérdida de tiempo.

Más alarmante es el 4% que puntúa por debajo de la base de referencia. Estas son skills que no solo no ayudan, sino que empeoran activamente el resultado del modelo. Instalar una de estas es un retroceso para tu sistema. Estos datos proporcionan una respuesta clara a la pregunta de qué porcentaje de skills de Claude funciona: está lejos del 100%.

Anatomía de una skill fallida

Entender por qué fallan las skills es tan importante como saber cuáles tienen éxito. Los fallos que registramos generalmente se dividen en dos categorías: los que son activamente perjudiciales y los que son simplemente incompletos.

Categoría 1: Puntuación por debajo de la base de referencia

Las 60 skills de esta categoría representan el peor de los casos. Prometen añadir una capacidad pero en su lugar introducen errores, restricciones o regresiones. Por ejemplo, probamos un generador de consultas SQL que debía escribir consultas complejas a partir de lenguaje natural. En nuestros prompts de prueba, produjo consistentemente SQL sintácticamente inválido. La base de referencia de Claude simple, con los mismos prompts, produjo SQL correcto todas las veces. La lógica interna de la skill era defectuosa, dirigiendo activamente al modelo hacia un resultado peor.

Otro modo de fallo común es la restricción excesiva. Una skill diseñada para forzar un esquema JSON específico puede ser tan rígida que hace que el modelo se niegue a responder a prompts legítimos que caen ligeramente fuera de su definición estrecha, mientras que el modelo base habría manejado la solicitud con soltura. Estas skills son peores que inútiles; son un lastre.

Categoría 2: Requiere configuración manual

Esta es una categoría mucho más grande, que comprende 467 de las skills que probamos. Estas skills no están necesariamente mal diseñadas, pero están mal documentadas. Representan un enorme coste de tiempo oculto para los desarrolladores.

Un ejemplo típico es una skill que actúa como cliente para una API de terceros. El código puede ser perfectamente funcional, pero el archivo SKILL.md no menciona que el usuario debe primero registrarse para obtener una cuenta, generar una clave de API y establecerla como una variable de entorno llamada THIRD_PARTY_API_KEY. Sin esta información, la skill falla con un AuthenticationError genérico.

Nuestro equipo hace el trabajo de descubrir estos requisitos ocultos, documentándolos en nuestros hallazgos. Pero para un usuario promedio, esto es un callejón sin salida. La skill parece rota y la desinstalan después de una frustrante media hora de depuración. Esto no es un fallo del modelo, sino un fallo de la experiencia del desarrollador. Las buenas skills deben ser utilizables directamente, con todas las dependencias y pasos de configuración claramente documentados.

Características de una skill de alta puntuación

Si un tercio de las skills son problemáticas, ¿cómo son los otros dos tercios, las exitosas? ¿Vale la pena instalar las skills de código de Claude? Sí, si pertenecen al grupo de alta puntuación.

Las skills de alta puntuación comparten varios rasgos comunes:

  1. Proporcionan herramientas reales: Las mejores skills no se limitan a reformular un prompt. Dan al modelo acceso a nuevas capacidades. Una skill que puede verificar si una URL devuelve un estado 200 OK, una herramienta para aplicar parches que puede aplicar un diff a un archivo local, o una skill que interactúa con la API de un proveedor de nube en tiempo real son ejemplos de herramientas reales. Permiten que el modelo realice acciones en el mundo, no solo que hable de ellas. Esto proporciona una mejora clara e innegable sobre la base de referencia.

  2. Son atómicas y fiables: Las skills de primer nivel se centran en hacer una cosa bien. Una skill para convertir una marca de tiempo a una cadena ISO 8601 tiene más probabilidades de ser robusta y útil que una skill monolítica de "asistente de DevOps" que intenta hacer veinte cosas diferentes.

  3. Tienen una documentación excelente: El archivo SKILL.md se trata como una parte crítica de la herramienta. Contiene instrucciones claras, ejemplos funcionales para casos de uso comunes y documentación explícita de cualquier configuración requerida, como variables de entorno o autenticación.

Cuando una skill cumple estos criterios, la mejora no es sutil. Transforma el modelo de un generador de texto en un agente interactivo que puede ejecutar tareas, ahorrando tiempo y esfuerzo significativos. Estas son las skills que cumplen la promesa original.

Cómo encontrar skills que realmente mejoren tu flujo de trabajo

La conclusión principal de nuestra investigación es que el número bruto de skills disponibles es una métrica de vanidad. El valor del ecosistema no reside en su tamaño, sino en la densidad de herramientas verificadas y de alta calidad. Instalar skills a ciegas basándose en sus descripciones es una estrategia ineficiente y frustrante.

La pregunta que los desarrolladores deberían hacerse no es "¿las skills de Claude realmente mejoran el resultado?", sino "qué skills mejoran el resultado y en qué medida?"

Responder a esa pregunta es la razón por la que creamos SkillProof. Realizamos las pruebas y publicamos los resultados —incluidos los fallos— para que puedas adoptar skills con confianza. Nuestro catálogo no es una lista exhaustiva de todas las skills existentes. Es un directorio curado de skills que han demostrado funcionar y proporcionar un beneficio medible sobre la base de referencia sin skills.

Lecturas relacionadas: por qué tantas skills no dan la talla · si las estrellas de GitHub predicen una buena skill.

El objetivo de estos datos no es desalentar el uso de skills, sino alentar el uso de las correctas. Hemos hecho el trabajo de probar 1416 skills para que tú no tengas que hacerlo. Puedes explorar las 889 skills que pasaron nuestras pruebas de base de referencia en nuestro catálogo completo. Si quieres saltarte la exploración, también ofrecemos un paquete curado con las 50 skills de mayor impacto por $10.

★ 9.6/10 × 3

El pack de inicio gratis

Los 3 skills con nuestras mejores puntuaciones de test más la checklist de instalación: el setup que pondríamos en una máquina recién estrenada. Gratis, por email.

Un email con el pack + un breve resumen semanal con nuevos resultados de test. Date de baja cuando quieras.