Misma pregunta, mismo modelo: un antes y después en vivo

Misma pregunta, mismo modelo: un antes y después en vivo

Una hora después de publicar research-discipline, hicimos el experimento que de verdad querrías ver: no un benchmark curado, sino una sola pregunta en vivo, hecha dos veces, con las respuestas verificadas en público. Este artículo es el protocolo completo (qué preguntamos, qué hizo cada ejecución y cada paso de verificación) para que puedas repetirlo tú mismo.

El planteamiento

La pregunta. "¿Cuáles son los skills de Claude Code más populares ahora mismo? Nombra los 5 repositorios de skills más destacados en GitHub por estrellas, con las cifras actuales. ¿Cómo se compara el repo oficial de Anthropic con los de la comunidad?" — una pregunta con una respuesta objetivamente comprobable que cambia cada semana, que es justo donde la investigación con IA se pudre en silencio.

Las dos ejecuciones. Agentes Claude Sonnet idénticos, mismo prompt, mismas herramientas (búsqueda web, web fetch, shell). Una sola diferencia: el segundo agente primero leyó SKILL.md de una copia de research-discipline instalada tal como lo haría cualquier usuario —

git clone https://github.com/Skillproofdev/research-discipline ~/.claude/skills/research-discipline

Esa es toda la intervención: ~1,500 tokens de reglas que el modelo lee antes de ponerse a trabajar.

El árbitro. Cuando llegaron las dos respuestas, sacamos el número de estrellas de todos los repositorios que mencionaba cualquiera de las dos respuestas —además de los candidatos que ninguna mencionó— directamente de la API de GitHub, la única autoridad sobre sus propias cifras. Esta vez no hubo ningún LLM juzgando en el proceso; solo gh api repos/<owner>/<repo>.

Los resultados

Los verdaderos 5 repos de skills más destacados por estrellas, y cuáles se le escaparon a la investigación baseline

La respuesta baseline se ve genial. Cinco repositorios, descripciones plausibles, recuentos de estrellas exactos hasta el dígito, una síntesis segura de sí misma al final. Si no lo hubiéramos comprobado, la habríamos publicado tal cual.

Está mal justo donde importa. El verdadero top 5, verificado contra la API en vivo, incluye tres repositorios que el baseline nunca detectó, con 228k, 190k y 164k estrellas. No son repos oscuros: cada uno es más grande que tres de los cinco que el baseline sí nombró. Su afirmación final, "el repo oficial de Anthropic solo queda por detrás de Superpowers", es falsa: el repo oficial queda quinto. Nada de lo que escribió el baseline estaba inventado; cada cifra que dio era real. Simplemente respondió a otra pregunta: "¿de qué repos hablan los blogs?", porque sus seis llamadas a herramientas fueron búsquedas web, y los resultados de búsqueda son un concurso de popularidad por cobertura, no por estrellas.

La ejecución con el skill respondió a la pregunta que realmente se hizo. Su primera regla —la evidencia debe ser en vivo; la memoria y los resultados de la primera página de búsqueda son pistas, no pruebas— la llevó de googlear a enumerar: consultó la API de GitHub directamente y recorrió tres listados de temas de GitHub (agent-skills, claude-skills, claude-code-skills) para asegurarse de que no se le escapaba nada grande fuera de la blogosfera. Sus cinco cifras coincidieron con la API en vivo cuando volvimos a comprobarlas. Además, hizo dos cosas que nadie le pidió pero que haría cualquier investigador cuidadoso: separó los repositorios de skills reales de las listas de enlaces curadas (el baseline los mezcló), y añadió dos avisos de incertidumbre —uno señalando que varios de los repos principales tienen solo unos meses y un crecimiento de estrellas inusualmente rápido ([unverified] sobre si eso es orgánico), otro reconociendo que una afirmación sobre un marketplace se remontaba a un solo blog ([single-source]). Ambos avisos resistieron el escrutinio.

El método, explicado

Baseline vs. ejecución con skill: llamadas a herramientas, comportamiento y coste en tokens

¿Por qué un archivo de texto cambia tanto el comportamiento? Porque el fallo al que apunta no es la ignorancia —el modelo baseline sabe que GitHub tiene una API—, sino el hábito por defecto de responder con lo primero que aparece. El skill convierte la buena práctica de "algo que el modelo podría hacer" en "algo que el modelo debe hacer antes de poder afirmar nada":

  1. La regla 1 (evidencia en vivo) obligó a poner la fecha y a hacer las llamadas a la API en lugar de confiar en los fragmentos de búsqueda.
  2. La regla 3 (fuentes independientes) es la razón de los recorridos por temas: un solo camino de búsqueda no basta para sostener una afirmación de "top 5".
  3. La regla 5 (lo no verificado se declara como no verificado) produjo los dos avisos en lugar de una confianza silenciosa.
  4. La regla 7 (ataca tu propia conclusión) es la razón por la que se puso a buscar repos que rompieran su propio ranking, y los encontró.

Los costes reales, tal como encontró nuestro benchmark controlado: la ejecución disciplinada usó 11 llamadas a herramientas frente a 6, y 64,445 tokens frente a 49,988 —+29% en esta tarea—. Verificar no sale gratis. Simplemente sale mucho más barato que estar seguro de algo equivocado en un documento sobre el que alguien va a actuar.

Lo que esto no demuestra

Una sola pregunta es una anécdota, no un benchmark: la versión controlada de seis preguntas con verificación a nivel de afirmación (13.0% → 5.4% afirmaciones erróneas) es la evidencia; esto es la demostración. El skill tampoco es un oráculo de completitud: en la ejecución controlada, una vez indicó el precio de un plan de un proveedor y se le pasó uno más barato. Y las cifras de estrellas de arriba eran ciertas el 10 de julio de 2026 y van a cambiar, que es, precisamente, el tipo de advertencia que el skill te obliga a escribir.

PRUÉBALO TÚ MISMO

Todo el experimento se puede reproducir en diez minutos: instala el skill, elige cualquier pregunta con cifras comprobables, ejecútala dos veces, verifica con la fuente primaria. El skill es gratis, con licencia MIT, ~1,500 tokens.

Consigue research-discipline en GitHub

Preguntas frecuentes

¿Elegiste la pregunta a dedo? Fue la primera pregunta que hicimos después de publicar el skill, elegida porque los datos de nuestro propio catálogo podían verificarla. El benchmark controlado con seis preguntas preregistradas es la versión sistemática, y coincide.

¿Un modelo más inteligente haría innecesario el skill? El baseline de aquí ya era un modelo actual con acceso completo a la web. La brecha no era de capacidad, era de configuración por defecto. Las reglas cambian esa configuración por defecto.

¿Por qué las dos ejecuciones acertaron las cifras de estrellas pero solo una acertó el ranking? Porque la exactitud y la completitud fallan de forma independiente. Cada cifra que citó el baseline era real; el error estaba en lo que nunca buscó. Ese es el modo de fallo más peligroso en la investigación con IA: nada en la respuesta parece estar mal.

¿Y qué pasa con el +29% de tokens? Combínalo con token-discipline, que reduce el desperdicio en la sesión en torno a un 20% en trabajo de varios pasos. Disciplina en lo que lees, disciplina en lo que afirmas: los dos están pensados para funcionar juntos.

★ 9.6/10 × 3

El pack de inicio gratis

Los 3 skills con nuestras mejores puntuaciones de test más la checklist de instalación: el setup que pondríamos en una máquina recién estrenada. Gratis, por email.

Un email con el pack + un breve resumen semanal con nuevos resultados de test. Date de baja cuando quieras.