Codex Autoresearch

Boucle d'optimisation mesurée et résumable avec référence, porte de correction et registre de preuves

par TheGreenCedar · TheGreenCedar/codex-autoresearch

Testé · Fonctionne ★ 8.8/10

Codex Autoresearch — Boucle d'optimisation mesurée et résumable avec référence, porte de correction et registre de preuves

Ce que fait

Transforme une requête vague "make it faster/smaller" en une boucle mesurée : elle enregistre une référence de benchmark, exécute un changement ciblé par paquet, réexécute les vérifications de correction et enregistre chaque résultat (métrique, décision, preuve, action suivante) dans un fichier de session résumable avec un commit git ciblé. Se déclenche sur l'optimisation basée sur des benchmarks (temps d'exécution des tests, taille du bundle, latence, mémoire), la recherche qualitative d'écarts de qualité, la reprise d'une session autoresearch existante ou la préparation d'une finalisation de branche de révision. S'appuie sur une CLI Node (autoresearch.mjs) qui exécute le benchmark et vérifie les commandes localement.

Rapport de test

J'ai construit un projet Node jouet (sumTo via array+reduce, un bench.mjs affichant METRIC seconds= et un checks.mjs), puis j'ai exécuté la boucle de deux manières sous un HOME temporaire. Référence (sans compétence) : j'ai simplement réécrit la fonction en une boucle d'accumulateur et réexécuté le bench (0.7297s -> 0.3652s) — un fichier plus rapide, pas d'enregistrement. Compétence : la configuration a écrit une session (autoresearch.md/.jsonl/.sh), doctor --check-benchmark a confirmé le contrat METRIC, next+log a capturé la référence 0.7234, puis le paquet keep a enregistré 0.3542 avec des vérifications réussies (exit 0, "checks OK"), a créé un commit git ciblé 8d4e192 ne touchant que lib/sum.mjs, a joint une note ASI (hypothèse/preuve/action suivante), et finalize-preview a produit un plan de branche de révision signalant la maturité "experimental". Différence décisive : lorsque j'ai fourni un changement plus rapide mais erroné (forme fermée +1), les vérifications du paquet ont renvoyé 1 et la CLI a forcé le statut checks_failed comme seul statut autorisé, refusant la conservation — le chemin de référence n'a pas de telle porte de régression.

Testé le: 2026-07-21 · Claude Code 2.x (agent harness)

Installation

git clone --depth 1 https://github.com/TheGreenCedar/codex-autoresearch.git /tmp/codex-autoresearch-src
mkdir -p ~/.claude/skills
cp -R /tmp/codex-autoresearch-src/plugins/codex-autoresearch/skills/codex-autoresearch ~/.claude/skills/codex-autoresearch
# NOTE: this is a Codex PLUGIN, not a standalone skill. The SKILL.md drives a Node CLI that
# lives OUTSIDE the skill folder at /tmp/codex-autoresearch-src/plugins/codex-autoresearch/scripts/autoresearch.mjs
# Requirements: Node >= 24. On first run the CLI hydrates a runtime (downloads the matching
# GitHub release tarball with sha256 verification, or build locally from the clone).
# Run commands from the package root, e.g.:
#   node /tmp/codex-autoresearch-src/plugins/codex-autoresearch/scripts/autoresearch.mjs setup --cwd <project> --name <s> --metric-name seconds --direction lower --benchmark-command "<cmd printing METRIC name=value>" --checks-command "<cmd>"
# Intended install path is Codex's /plugins picker (TheGreenCedar -> codex-autoresearch), which bundles the CLI.

Commandes et exemples de prompts

  • /codex-autoresearchBoucle d'optimisation mesurée et résumable avec référence, porte de correction et registre de preuves

Les skills se déclenchent sur des demandes en langage courant — aucune commande à retenir. Après installation, des prompts comme ceux-ci l'activent (en anglais) :

  • Start a new Codex Autoresearch loop
  • Resume and inspect the current autoresearch run
  • Show the autoresearch dashboard and quality gaps