
CLAUDE.md estilo Karpathy: ¿supera a Claude base?
El CLAUDE.md inspirado en Karpathy: un análisis realista de las habilidades de planificación adversarial
Un repositorio de GitHub con un único archivo CLAUDE.md ha acumulado más de 100,000 estrellas al momento de escribir esto. A menudo se le conoce como la "habilidad de Karpathy", en referencia al trabajo de Andrej Karpathy en IA y educación. Esta popularidad plantea una pregunta fundamental para cualquier desarrollador que intente sacar más provecho de los modelos de lenguaje grandes: ¿realmente funciona este patrón?
Antes de analizar los resultados de nuestras pruebas, es esencial aclarar dos puntos. Primero, el repositorio en cuestión fue creado por Forrest Chang; está inspirado en Karpathy, no es de su autoría. Segundo, el archivo es un CLAUDE.md, no un SKILL.md. Es un conjunto de instrucciones para que un humano copie y pegue en una sesión de chat, no una habilidad formal que se pueda instalar para modificar el comportamiento del modelo de forma programática.
En SkillProof, no probamos prompts de copiar y pegar. Probamos habilidades. Las instalamos, las ejecutamos contra código del mundo real y medimos su rendimiento en comparación con el modelo base. Para investigar este fenómeno, identificamos y probamos un grupo de habilidades que implementan el mismo patrón subyacente que el CLAUDE.md de Chang: la planificación adversarial. Este artículo presenta nuestros hallazgos.
Deconstruyendo el patrón "Grill-Me"
La idea central detrás del popular CLAUDE.md es una forma de autocrítica estructurada. El prompt instruye al modelo no solo a producir una respuesta, sino a adoptar una persona —un panel de críticos expertos— para desafiar y refinar su propio resultado antes de presentar una versión final. El proceso generalmente es así:
- Plan inicial: El modelo genera un plan de alto nivel para resolver la solicitud del usuario.
- Autocrítica: Se le pide al modelo que "interrogue" su propio plan, identificando posibles fallos, casos límite y riesgos de implementación. Puede enumerar debilidades o hacerse preguntas aclaratorias a sí mismo.
- Resultado refinado: Basándose en la crítica, el modelo produce una respuesta final más robusta.
Esta técnica es una forma de planificación adversarial. Estás forzando al modelo a actuar como su propio red team, simulando un proceso de revisión que normalmente requeriría una segunda persona o un paso de verificación por separado. La hipótesis es que este diálogo interno produce un resultado más meditado y correcto, especialmente para tareas complejas como el diseño de sistemas o la implementación de algoritmos.
Este es el patrón que nos propusimos probar. Cuando los desarrolladores piden un análisis de la habilidad de Karpathy para Claude, este es el mecanismo por el que preguntan. ¿Forzar a un modelo a criticarse a sí mismo conduce a un código mediblemente mejor?
CLAUDE.md vs. SKILL.md: una distinción fundamental
La diferencia entre un CLAUDE.md y un SKILL.md no es solo semántica; es fundamental para cómo evaluamos el rendimiento.
Un CLAUDE.md es un prompt manual. Su efectividad puede variar enormemente dependiendo de la habilidad del usuario para adaptarlo, los detalles de su entrada y el estado de su sesión de chat. Es una receta, no una herramienta. No se puede evaluar una receta de forma estandarizada.
Un SKILL.md, tal como se define y utiliza en el directorio de SkillProof, es un archivo canónico y versionado que altera programáticamente el system prompt del modelo. Cuando usas una habilidad de nuestro directorio, se instala una vez. Cada solicitud posterior al modelo se beneficia (o se ve perjudicada) por las instrucciones de esa habilidad, sin necesidad de copiar y pegar manualmente. Esto permite realizar pruebas repetibles y objetivas.
Toda nuestra metodología de prueba se basa en este principio. Tomamos un SKILL.md, lo instalamos y lo ejecutamos contra una batería de tareas del mundo real. Comparamos su resultado —en términos de corrección, eficiencia y cumplimiento de los requisitos— con el del mismo modelo sin ninguna habilidad instalada. La puntuación resultante es una medida directa del valor añadido (o restado) por esa habilidad.
Para esta investigación, no probamos directamente el archivo de Forrest Chang. En su lugar, obtuvimos múltiples habilidades de la comunidad que formalizan el patrón de planificación adversarial en un formato SKILL.md reutilizable. Esto nos permitió responder a la pregunta: ¿el patrón en sí mismo, cuando se aplica de manera consistente, cumple su promesa?
Nuestra metodología de prueba para habilidades adversariales
Para realizar un análisis justo de grill-me claude skill tested, seleccionamos un conjunto representativo de tareas que son puntos débiles comunes para los desarrolladores y donde un modelo más "reflexivo" podría teóricamente destacar:
- Refactorización compleja: Reescribir una función monolítica con alta complejidad ciclomática en unidades más pequeñas y comprobables.
- Generación de cliente de API: Escribir una librería cliente para una especificación OpenAPI moderadamente compleja, incluyendo manejo de errores y modelos de solicitud/respuesta.
- Implementación de algoritmos: Implementar un algoritmo no trivial a partir de una descripción en prosa, como la búsqueda de rutas A* o una cola de prioridad.
- Generación de pruebas unitarias: Escribir una suite completa de pruebas unitarias para una clase con múltiples dependencias y casos límite.
Para cada tarea, ejecutamos dos pruebas: una con Claude base (el modelo sin habilidad) y otra con una habilidad de planificación adversarial instalada. Puntuamos los resultados basándonos en una rúbrica que incluye corrección funcional, calidad del código, completitud y eficiencia. La puntuación final de una habilidad representa su delta de rendimiento promedio en todas las tareas probadas.
Este riguroso proceso es cómo hemos evaluado las 1416 habilidades que actualmente seguimos en nuestro sistema. Es un panorama ruidoso: solo 889 (63%) de esas habilidades superan nuestro umbral para proporcionar un beneficio neto positivo. Otras 467 requieren una configuración no trivial o solo son útiles en contextos muy específicos. Las habilidades de planificación adversarial que probamos cayeron en todas estas categorías.
El veredicto: ¿Funciona realmente la habilidad inspirada en Karpathy?
La respuesta tiene matices. La efectividad del patrón de planificación adversarial depende en gran medida de la complejidad de la tarea. No es una mejora universal. Para algunas tareas, es activamente perjudicial.
Nuestras pruebas mostraron una tendencia clara:
| Tipo de tarea | Rendimiento de Claude base | Rendimiento de habilidad adversarial | Veredicto |
|---|---|---|---|
| Boilerplate simple (ej. un componente de React) | Rápido, 95% correcto | Más lento, sobre-critica, 90% correcto | Impacto negativo |
| Refactorización compleja | A menudo omite casos límite | Detecta más casos límite, pero verboso | Beneficio neto |
| Diseño de algoritmos desde cero | Propenso a lagunas lógicas | Mejor estructura lógica, más lento | Beneficio neto |
| Depuración de errores complejos | A menudo sugiere arreglos superficiales | Explora causas raíz más profundas | Beneficio neto |
Para tareas simples y bien definidas, el patrón adversarial añade una sobrecarga innecesaria. El modelo gasta tokens y tiempo criticando un plan que ya era suficiente. En algunos casos, el proceso de autocrítica incluso introdujo errores, ya que el modelo alucinó fallos y luego los "corrigió", rompiendo código que funcionaba perfectamente. Este es un hallazgo crucial para cualquiera que se pregunte si el karpathy claude md vale la pena para la codificación diaria.
Sin embargo, para tareas complejas y abiertas —del tipo que a menudo desconciertan a un desarrollador junior— el patrón proporciona un beneficio medible. Cuando se le pide que diseñe un sistema o refactorice una pieza enrevesada de código heredado, la fase de autocrítica obliga al modelo a considerar interacciones y casos límite que Claude base a menudo pasa por alto. El resultado final es más robusto y requiere menos corrección humana, aunque tarde más en generarse y sea significativamente más verboso.
Una habilidad de planificación adversarial que probamos superó claramente al modelo base en tareas de diseño de sistemas abiertos, pero puntuó por debajo en la generación de boilerplate simple. Esto resalta la necesidad de aplicar la habilidad correcta al trabajo correcto, en lugar de buscar un único "prompt divino" que lo domine todo.
El coste oculto: verbosidad y puntuaciones negativas
El inconveniente más inmediato de este patrón es la verbosidad. Una respuesta de una habilidad que utiliza planificación adversarial puede ser de 3 a 5 veces más larga que una respuesta de Claude base. Incluye el plan, la crítica completa y luego la respuesta final. Aunque los pasos intermedios pueden ofrecer una idea del "pensamiento" del modelo, también aumentan el consumo de tokens y la carga cognitiva del desarrollador que tiene que leerlo todo.
Más preocupante es el riesgo de un rendimiento negativo. Una habilidad mal implementada es peor que ninguna habilidad. En SkillProof, nuestro hallazgo más importante no es la lista de habilidades que funcionan, sino la de las que no. A día de hoy, 60 habilidades que hemos probado han puntuado POR DEBAJO de Claude base. Hacen que el modelo sea activamente menos preciso, menos eficiente o menos fiable.
Varias de las habilidades de planificación adversarial que probamos cayeron en esta categoría. El modo de fallo fue consistente: la fase de crítica se quedaba atascada en un bucle, o las "personas expertas" se contradecían entre sí, lo que llevaba a un resultado final confuso e incorrecto. En una prueba, una habilidad destinada a la optimización de consultas SQL entró en un bucle de crítica en el que debatía los méritos de JOIN frente a INNER JOIN (que son funcionalmente idénticos en la mayoría de los dialectos) y no llegó a producir ninguna consulta.
Esta es la realidad anti-hype del ecosistema de habilidades de IA. La popularidad y las estrellas de GitHub no se correlacionan con el rendimiento. Un patrón de prompt ingenioso tiene la misma probabilidad de perjudicar que de ayudar. La única forma de saberlo es probándolo.
Entonces, ¿vale la pena el patrón?
Volvamos a la pregunta original. ¿Vale la pena el patrón del CLAUDE.md inspirado en Karpathy?
Como herramienta de aprendizaje, absolutamente. Leer el CLAUDE.md de Chang y prompts similares es una excelente manera de entender el concepto de chain-of-thought y autocorrección. Experimentar con él manualmente puede ayudarte a desarrollar una mejor intuición para la creación de prompts.
Como herramienta de producción en forma de un SKILL.md instalado, la respuesta es un rotundo "depende". Nuestros datos muestran que para tareas específicas de alta complejidad, una habilidad adversarial bien implementada puede ser una herramienta poderosa para ingenieros senior. Puede actuar como una caja de resonancia lógica e incansable para problemas complejos. Para la codificación del día a día, es probable que sea lento, costoso y potencialmente contraproducente.
Este es precisamente el problema que SkillProof fue creado para resolver. En lugar de depender de la popularidad o del número de estrellas, puedes confiar en nuestros datos. Separamos las habilidades que proporcionan una mejora real y medible de las que son solo prompts ingeniosos pero ineficaces.
Lecturas relacionadas: el porcentaje de habilidades que realmente superan a Claude base · cómo ejecutamos cada habilidad antes de listarla.
Hemos probado docenas de habilidades que utilizan planificación adversarial y otras técnicas avanzadas. Para ver cuáles pasaron nuestras pruebas del mundo real y obtuvieron una puntuación de SkillProof, puedes explorar la categoría Productividad y Flujo de Trabajo en nuestro directorio. También agrupamos las habilidades con mejor rendimiento de todas las categorías en un paquete de inicio por $10, que te proporciona un conjunto de herramientas verificadas que realmente funcionan.
★ 9.6/10 × 3
El pack de inicio gratis
Los 3 skills con nuestras mejores puntuaciones de test más la checklist de instalación: el setup que pondríamos en una máquina recién estrenada. Gratis, por email.