Auto Itera
Ejecuta un experimento disciplinado de línea base vs. brazos hasta un veredicto sellado de envío o eliminación.
Probado · Funciona
Qué hace
Dado un objetivo, brazos candidatos (prompts/modelos/arquitecturas) y un umbral pre-registrado, obtiene datos de forma autónoma, divide el conjunto de entrenamiento/desarrollo/prueba retenido, puntúa los brazos en paralelo, itera sprints detrás de una puerta de generalización y escribe un documento de conclusión de una página con tres gráficos reales de matplotlib. Se activa ante preguntas del tipo '¿deberíamos usar X o Y?', 'compara estos prompts/modelos', '¿es este diseño mejor?' donde se necesita un veredicto defendible, no ante correcciones de errores de primeros principios directas.
Informe de la prueba
Ejecuté un experimento de juguete real (24 filas de recibos sintéticos, dos heurísticas de extracción de proveedores) de dos maneras: la línea base ingenua puntuó ambos brazos en las 24 filas y eligió un ganador de ese único número contaminado, exactamente el anti-patrón de p-hacking que la habilidad señala; la ejecución guiada por la habilidad impuso una división real de entrenamiento/desarrollo/prueba sellada, un piloto de Fase 3, diagnóstico por segmento y un pase de retención genuino, luego renderizó PNG reales con los scripts incluidos scripts/chart.py (matplotlib, ejecutado de verdad, los tres tipos de gráficos produjeron imágenes válidas). El pequeño conjunto de prueba N=5 aterrizó el efecto exactamente en el umbral pre-registrado, lo que en sí mismo es una demostración en vivo de la advertencia de heurística de tamaño de la propia habilidad.
Probado el: 2026-07-16 · Claude Code 2.x (agent harness)
Instalación
git clone https://github.com/clfhaha1234/auto-itera
mkdir -p ~/.claude/skills
cp -r auto-itera/{SKILL.md,scripts,templates,examples} ~/.claude/skills/auto-itera/ Comandos y prompts de ejemplo
/auto-iteraEjecuta un experimento disciplinado de línea base vs. brazos hasta un veredicto sellado de envío o eliminación.
Los skills se activan con peticiones en lenguaje natural, sin comandos que memorizar. Tras instalarlo, prompts como estos lo activan (en inglés):
Should we use prompt A or prompt B for extraction? Give me real evidence.Compare these two model architectures with a proper held-out test set.Is this new heuristic actually better, or am I just p-hacking myself?