Codex Autoresearch
Gemessene, fortsetzbare Optimierungsschleife mit Baseline, Korrektheitsprüfung und Evidenz-Ledger
Getestet · Funktioniert
Was es kann
Wandelt eine vage Anfrage wie "make it faster/smaller" in eine gemessene Schleife um: Sie zeichnet eine Benchmark-Baseline auf, führt eine gezielte Änderung pro Paket aus, wiederholt Korrektheitsprüfungen und protokolliert jedes Ergebnis (Metrik, Entscheidung, Evidenz, nächste Aktion) in einer fortsetzbaren Session-Datei mit einem gezielten git commit. Wird ausgelöst bei benchmark-getriebener Optimierung (Testlaufzeit, Bundle-Größe, Latenz, Speicher), qualitativer Qualitätslückenforschung, dem Fortsetzen einer bestehenden Autoresearch-Session oder der Vorbereitung einer Review-Branch-Finalisierung. Unterstützt durch eine Node CLI (autoresearch.mjs), die den Benchmark ausführt und Befehle lokal prüft.
Testbericht
Ich erstellte ein kleines Node-Projekt (sumTo über array+reduce, eine bench.mjs, die METRIC seconds= ausgibt, und eine checks.mjs) und führte die Schleife dann auf zwei Arten unter einem temporären HOME aus. Baseline (kein Skill): Ich schrieb die Funktion einfach in eine Akkumulatorschleife um und führte bench erneut aus (0.7297s -> 0.3652s) – eine schnellere Datei, kein Protokoll. Skill: setup schrieb eine Session (autoresearch.md/.jsonl/.sh), doctor --check-benchmark bestätigte den METRIC-Vertrag, next+log erfasste Baseline 0.7234, dann protokollierte das keep-Paket 0.3542 mit bestandenen Checks (exit 0, "checks OK"), erstellte einen gezielten git commit 8d4e192, der nur lib/sum.mjs berührte, fügte eine ASI-Notiz (hypothesis/evidence/next-action) hinzu, und finalize-preview erzeugte einen Review-Branch-Plan, der die Reife als "experimental" kennzeichnete. Entscheidender Unterschied: Als ich eine schnellere, aber falsche Änderung (geschlossene Form +1) eingab, beendeten die Checks des Pakets mit 1 und die CLI erzwang den Status checks_failed als einzigen zulässigen Status, wobei das Beibehalten verweigert wurde – der Baseline-Pfad hat kein solches Regressions-Gate.
Getestet am: 2026-07-21 · Claude Code 2.x (agent harness)
Installation
git clone --depth 1 https://github.com/TheGreenCedar/codex-autoresearch.git /tmp/codex-autoresearch-src mkdir -p ~/.claude/skills cp -R /tmp/codex-autoresearch-src/plugins/codex-autoresearch/skills/codex-autoresearch ~/.claude/skills/codex-autoresearch # NOTE: this is a Codex PLUGIN, not a standalone skill. The SKILL.md drives a Node CLI that # lives OUTSIDE the skill folder at /tmp/codex-autoresearch-src/plugins/codex-autoresearch/scripts/autoresearch.mjs # Requirements: Node >= 24. On first run the CLI hydrates a runtime (downloads the matching # GitHub release tarball with sha256 verification, or build locally from the clone). # Run commands from the package root, e.g.: # node /tmp/codex-autoresearch-src/plugins/codex-autoresearch/scripts/autoresearch.mjs setup --cwd <project> --name <s> --metric-name seconds --direction lower --benchmark-command "<cmd printing METRIC name=value>" --checks-command "<cmd>" # Intended install path is Codex's /plugins picker (TheGreenCedar -> codex-autoresearch), which bundles the CLI.
Befehle & Beispiel-Prompts
/codex-autoresearchGemessene, fortsetzbare Optimierungsschleife mit Baseline, Korrektheitsprüfung und Evidenz-Ledger
Skills reagieren auf normale Anfragen — keine Slash-Befehle nötig. Nach der Installation aktivieren Prompts wie diese den Skill (auf Englisch):
Start a new Codex Autoresearch loopResume and inspect the current autoresearch runShow the autoresearch dashboard and quality gaps