Codex Autoresearch

Gemeten, hervatbare optimalisatieloop met baseline, correctheidspoort en bewijslogboek

Door TheGreenCedar · TheGreenCedar/codex-autoresearch

Getest · Werkt ★ 8.8/10

Codex Autoresearch — Gemeten, hervatbare optimalisatieloop met baseline, correctheidspoort en bewijslogboek

Wat het doet

Zet een vaag "maak het sneller/kleiner" verzoek om in een gemeten loop: het registreert een benchmark baseline, voert één gerichte wijziging per pakket uit, herhaalt correctheidscontroles, en logt elk resultaat (metric, decision, evidence, next action) naar een hervatbaar sessiebestand met een gerichte git commit. Activeert bij benchmark-gedreven optimalisatie (test runtime, bundle size, latency, memory), kwalitatief onderzoek naar kwaliteitsverschillen, het hervatten van een bestaande autoresearch sessie, of het voorbereiden van een review-branch finalisatie. Ondersteund door een Node CLI (autoresearch.mjs) die de benchmark en checks commando's lokaal uitvoert.

Testrapport

Ik bouwde een speelgoed Node project (sumTo via array+reduce, een bench.mjs die METRIC seconds= printte en een checks.mjs), en voerde de loop vervolgens op twee manieren uit onder een tijdelijke HOME. Baseline (geen skill): Ik herschreef de functie gewoon naar een accumulator loop en voerde bench opnieuw uit (0.7297s -> 0.3652s) — een sneller bestand, geen record. Skill: setup schreef een sessie (autoresearch.md/.jsonl/.sh), doctor --check-benchmark bevestigde het METRIC contract, next+log legde baseline 0.7234 vast, waarna het keep packet 0.3542 logde met geslaagde checks (exit 0, "checks OK"), creëerde scoped git commit 8d4e192 die alleen lib/sum.mjs aanraakte, voegde een ASI notitie toe (hypothesis/evidence/next-action), en finalize-preview produceerde een review-branch plan dat de volwassenheid "experimental" markeerde. Doorslaggevend verschil: toen ik een snellere maar verkeerde wijziging invoerde (closed-form +1), eindigden de checks van het pakket met 1 en dwong de CLI de status checks_failed als de enige toegestane status, weigerend de keep — het baseline pad heeft geen dergelijke regressiepoort.

Getest op: 2026-07-21 · Claude Code 2.x (agent harness)

Installatie

git clone --depth 1 https://github.com/TheGreenCedar/codex-autoresearch.git /tmp/codex-autoresearch-src
mkdir -p ~/.claude/skills
cp -R /tmp/codex-autoresearch-src/plugins/codex-autoresearch/skills/codex-autoresearch ~/.claude/skills/codex-autoresearch
# NOTE: this is a Codex PLUGIN, not a standalone skill. The SKILL.md drives a Node CLI that
# lives OUTSIDE the skill folder at /tmp/codex-autoresearch-src/plugins/codex-autoresearch/scripts/autoresearch.mjs
# Requirements: Node >= 24. On first run the CLI hydrates a runtime (downloads the matching
# GitHub release tarball with sha256 verification, or build locally from the clone).
# Run commands from the package root, e.g.:
#   node /tmp/codex-autoresearch-src/plugins/codex-autoresearch/scripts/autoresearch.mjs setup --cwd <project> --name <s> --metric-name seconds --direction lower --benchmark-command "<cmd printing METRIC name=value>" --checks-command "<cmd>"
# Intended install path is Codex's /plugins picker (TheGreenCedar -> codex-autoresearch), which bundles the CLI.

Commando's en voorbeeldprompts

  • /codex-autoresearchGemeten, hervatbare optimalisatieloop met baseline, correctheidspoort en bewijslogboek

Skills reageren op gewone verzoeken — geen commando's om te onthouden. Na installatie activeren prompts zoals deze de skill (in het Engels):

  • Start a new Codex Autoresearch loop
  • Resume and inspect the current autoresearch run
  • Show the autoresearch dashboard and quality gaps