Codex Autoresearch

Bucle de optimización medido y reanudable con línea base, puerta de corrección y registro de evidencia

Por TheGreenCedar · TheGreenCedar/codex-autoresearch

Probado · Funciona ★ 8.8/10

Codex Autoresearch — Bucle de optimización medido y reanudable con línea base, puerta de corrección y registro de evidencia

Qué hace

Convierte una solicitud vaga de "hacerlo más rápido/pequeño" en un bucle medido: registra una línea base de benchmark, ejecuta un cambio con alcance por paquete, vuelve a ejecutar las comprobaciones de corrección y registra cada resultado (métrica, decisión, evidencia, siguiente acción) en un archivo de sesión reanudable con un git commit con alcance. Se activa en optimizaciones impulsadas por benchmarks (tiempo de ejecución de pruebas, tamaño del paquete, latencia, memoria), investigación cualitativa de brechas de calidad, reanudación de una sesión de autoresearch existente o preparación de una finalización de rama de revisión. Respaldado por una CLI de Node (autoresearch.mjs) que ejecuta el benchmark y verifica los comandos localmente.

Informe de la prueba

Construí un proyecto Node de juguete (sumTo vía array+reduce, un bench.mjs imprimiendo METRIC seconds= y un checks.mjs), luego ejecuté el bucle de dos maneras bajo un HOME temporal. Línea base (sin skill): simplemente reescribí la función a un bucle acumulador y volví a ejecutar bench (0.7297s -> 0.3652s) — un archivo más rápido, sin registro. Skill: la configuración escribió una sesión (autoresearch.md/.jsonl/.sh), doctor --check-benchmark confirmó el contrato METRIC, next+log capturó la línea base 0.7234, luego el paquete keep registró 0.3542 con las comprobaciones pasando (exit 0, "checks OK"), creó un git commit con alcance 8d4e192 tocando solo lib/sum.mjs, adjuntó una nota ASI (hypothesis/evidence/next-action), y finalize-preview produjo un plan de rama de revisión marcando la madurez "experimental". Diferencia decisiva: cuando introduje un cambio más rápido pero incorrecto (closed-form +1), las comprobaciones del paquete salieron con 1 y la CLI forzó el estado checks_failed como el único estado permitido, rechazando el keep — la ruta de la línea base no tiene tal puerta de regresión.

Probado el: 2026-07-21 · Claude Code 2.x (agent harness)

Instalación

git clone --depth 1 https://github.com/TheGreenCedar/codex-autoresearch.git /tmp/codex-autoresearch-src
mkdir -p ~/.claude/skills
cp -R /tmp/codex-autoresearch-src/plugins/codex-autoresearch/skills/codex-autoresearch ~/.claude/skills/codex-autoresearch
# NOTE: this is a Codex PLUGIN, not a standalone skill. The SKILL.md drives a Node CLI that
# lives OUTSIDE the skill folder at /tmp/codex-autoresearch-src/plugins/codex-autoresearch/scripts/autoresearch.mjs
# Requirements: Node >= 24. On first run the CLI hydrates a runtime (downloads the matching
# GitHub release tarball with sha256 verification, or build locally from the clone).
# Run commands from the package root, e.g.:
#   node /tmp/codex-autoresearch-src/plugins/codex-autoresearch/scripts/autoresearch.mjs setup --cwd <project> --name <s> --metric-name seconds --direction lower --benchmark-command "<cmd printing METRIC name=value>" --checks-command "<cmd>"
# Intended install path is Codex's /plugins picker (TheGreenCedar -> codex-autoresearch), which bundles the CLI.

Comandos y prompts de ejemplo

  • /codex-autoresearchBucle de optimización medido y reanudable con línea base, puerta de corrección y registro de evidencia

Los skills se activan con peticiones en lenguaje natural, sin comandos que memorizar. Tras instalarlo, prompts como estos lo activan (en inglés):

  • Start a new Codex Autoresearch loop
  • Resume and inspect the current autoresearch run
  • Show the autoresearch dashboard and quality gaps