Codex Autoresearch

Gemessene, fortsetzbare Optimierungsschleife mit Baseline, Korrektheitsprüfung und Evidenz-Ledger

von TheGreenCedar · TheGreenCedar/codex-autoresearch

Getestet · Funktioniert ★ 8.8/10

Codex Autoresearch — Gemessene, fortsetzbare Optimierungsschleife mit Baseline, Korrektheitsprüfung und Evidenz-Ledger

Was es kann

Wandelt eine vage Anfrage wie "make it faster/smaller" in eine gemessene Schleife um: Sie zeichnet eine Benchmark-Baseline auf, führt eine gezielte Änderung pro Paket aus, wiederholt Korrektheitsprüfungen und protokolliert jedes Ergebnis (Metrik, Entscheidung, Evidenz, nächste Aktion) in einer fortsetzbaren Session-Datei mit einem gezielten git commit. Wird ausgelöst bei benchmark-getriebener Optimierung (Testlaufzeit, Bundle-Größe, Latenz, Speicher), qualitativer Qualitätslückenforschung, dem Fortsetzen einer bestehenden Autoresearch-Session oder der Vorbereitung einer Review-Branch-Finalisierung. Unterstützt durch eine Node CLI (autoresearch.mjs), die den Benchmark ausführt und Befehle lokal prüft.

Testbericht

Ich erstellte ein kleines Node-Projekt (sumTo über array+reduce, eine bench.mjs, die METRIC seconds= ausgibt, und eine checks.mjs) und führte die Schleife dann auf zwei Arten unter einem temporären HOME aus. Baseline (kein Skill): Ich schrieb die Funktion einfach in eine Akkumulatorschleife um und führte bench erneut aus (0.7297s -> 0.3652s) – eine schnellere Datei, kein Protokoll. Skill: setup schrieb eine Session (autoresearch.md/.jsonl/.sh), doctor --check-benchmark bestätigte den METRIC-Vertrag, next+log erfasste Baseline 0.7234, dann protokollierte das keep-Paket 0.3542 mit bestandenen Checks (exit 0, "checks OK"), erstellte einen gezielten git commit 8d4e192, der nur lib/sum.mjs berührte, fügte eine ASI-Notiz (hypothesis/evidence/next-action) hinzu, und finalize-preview erzeugte einen Review-Branch-Plan, der die Reife als "experimental" kennzeichnete. Entscheidender Unterschied: Als ich eine schnellere, aber falsche Änderung (geschlossene Form +1) eingab, beendeten die Checks des Pakets mit 1 und die CLI erzwang den Status checks_failed als einzigen zulässigen Status, wobei das Beibehalten verweigert wurde – der Baseline-Pfad hat kein solches Regressions-Gate.

Getestet am: 2026-07-21 · Claude Code 2.x (agent harness)

Installation

git clone --depth 1 https://github.com/TheGreenCedar/codex-autoresearch.git /tmp/codex-autoresearch-src
mkdir -p ~/.claude/skills
cp -R /tmp/codex-autoresearch-src/plugins/codex-autoresearch/skills/codex-autoresearch ~/.claude/skills/codex-autoresearch
# NOTE: this is a Codex PLUGIN, not a standalone skill. The SKILL.md drives a Node CLI that
# lives OUTSIDE the skill folder at /tmp/codex-autoresearch-src/plugins/codex-autoresearch/scripts/autoresearch.mjs
# Requirements: Node >= 24. On first run the CLI hydrates a runtime (downloads the matching
# GitHub release tarball with sha256 verification, or build locally from the clone).
# Run commands from the package root, e.g.:
#   node /tmp/codex-autoresearch-src/plugins/codex-autoresearch/scripts/autoresearch.mjs setup --cwd <project> --name <s> --metric-name seconds --direction lower --benchmark-command "<cmd printing METRIC name=value>" --checks-command "<cmd>"
# Intended install path is Codex's /plugins picker (TheGreenCedar -> codex-autoresearch), which bundles the CLI.

Befehle & Beispiel-Prompts

  • /codex-autoresearchGemessene, fortsetzbare Optimierungsschleife mit Baseline, Korrektheitsprüfung und Evidenz-Ledger

Skills reagieren auf normale Anfragen — keine Slash-Befehle nötig. Nach der Installation aktivieren Prompts wie diese den Skill (auf Englisch):

  • Start a new Codex Autoresearch loop
  • Resume and inspect the current autoresearch run
  • Show the autoresearch dashboard and quality gaps