Codex Autoresearch
Ciclo di ottimizzazione misurato e ripristinabile con baseline, gate di correttezza e registro delle prove
Promosso
Cosa fa
Trasforma una vaga richiesta "rendilo più veloce/piccolo" in un ciclo misurato: registra una baseline di benchmark, esegue una modifica mirata per pacchetto, riesegue i controlli di correttezza e registra ogni risultato (metrica, decisione, prova, azione successiva) in un file di sessione ripristinabile con un commit git mirato. Si attiva su ottimizzazione basata su benchmark (tempo di esecuzione del test, dimensione del bundle, latenza, memoria), ricerca qualitativa di lacune di qualità, ripresa di una sessione autoresearch esistente o preparazione di una finalizzazione di un ramo di revisione. Supportato da una CLI Node (autoresearch.mjs) che esegue il benchmark e controlla i comandi localmente.
Rapporto di test
Ho costruito un progetto Node giocattolo (sumTo tramite array+reduce, un bench.mjs che stampa METRIC seconds= e un checks.mjs), quindi ho eseguito il ciclo in due modi sotto una HOME temporanea. Baseline (nessuna skill): ho semplicemente riscritto la funzione in un ciclo accumulatore e rieseguito il benchmark (0.7297s -> 0.3652s) — un file più veloce, nessun record. Skill: il setup ha scritto una sessione (autoresearch.md/.jsonl/.sh), doctor --check-benchmark ha confermato il contratto METRIC, next+log ha catturato la baseline 0.7234, quindi il pacchetto keep ha registrato 0.3542 con i controlli superati (exit 0, "checks OK"), ha creato un commit git mirato 8d4e192 che toccava solo lib/sum.mjs, ha allegato una nota ASI (ipotesi/prova/azione successiva) e finalize-preview ha prodotto un piano di ramo di revisione che segnalava la maturità "experimental". Differenza decisiva: quando ho inserito una modifica più veloce ma errata (forma chiusa +1), i controlli del pacchetto sono usciti con 1 e la CLI ha forzato lo stato checks_failed come unico stato consentito, rifiutando il keep — il percorso di baseline non ha tale gate di regressione.
Testato il: 2026-07-21 · Claude Code 2.x (agent harness)
Installazione
git clone --depth 1 https://github.com/TheGreenCedar/codex-autoresearch.git /tmp/codex-autoresearch-src mkdir -p ~/.claude/skills cp -R /tmp/codex-autoresearch-src/plugins/codex-autoresearch/skills/codex-autoresearch ~/.claude/skills/codex-autoresearch # NOTE: this is a Codex PLUGIN, not a standalone skill. The SKILL.md drives a Node CLI that # lives OUTSIDE the skill folder at /tmp/codex-autoresearch-src/plugins/codex-autoresearch/scripts/autoresearch.mjs # Requirements: Node >= 24. On first run the CLI hydrates a runtime (downloads the matching # GitHub release tarball with sha256 verification, or build locally from the clone). # Run commands from the package root, e.g.: # node /tmp/codex-autoresearch-src/plugins/codex-autoresearch/scripts/autoresearch.mjs setup --cwd <project> --name <s> --metric-name seconds --direction lower --benchmark-command "<cmd printing METRIC name=value>" --checks-command "<cmd>" # Intended install path is Codex's /plugins picker (TheGreenCedar -> codex-autoresearch), which bundles the CLI.
Comandi e prompt di esempio
/codex-autoresearchCiclo di ottimizzazione misurato e ripristinabile con baseline, gate di correttezza e registro delle prove
Gli skill si attivano con richieste in linguaggio naturale, senza comandi da ricordare. Dopo l'installazione, prompt come questi lo attivano (in inglese):
Start a new Codex Autoresearch loopResume and inspect the current autoresearch runShow the autoresearch dashboard and quality gaps