Codex Autoresearch

Zmierzona, wznawialna pętla optymalizacji z bazą, bramką poprawności i rejestrem dowodów

Autor: TheGreenCedar · TheGreenCedar/codex-autoresearch

Testowano · Działa ★ 8.8/10

Codex Autoresearch — Zmierzona, wznawialna pętla optymalizacji z bazą, bramką poprawności i rejestrem dowodów

Co robi ten skill

Przekształca niejasne żądanie "make it faster/smaller" w zmierzoną pętlę: rejestruje bazową wartość benchmarku, uruchamia jedną zmianę w zakresie na pakiet, ponownie uruchamia testy poprawności i loguje każdy wynik (metryka, decyzja, dowód, następna akcja) do pliku sesji, który można wznowić, z zatwierdzeniem git w zakresie. Uruchamia się na optymalizację opartą na benchmarkach (czas wykonania testu, rozmiar pakietu, opóźnienie, pamięć), jakościowe badania luk w jakości, wznowienie istniejącej sesji autoresearch lub przygotowanie finalizacji gałęzi recenzji. Wspierane przez Node CLI (autoresearch.mjs), które uruchamia benchmark i lokalnie sprawdza polecenia.

Raport z testu

Zbudowałem zabawkowy projekt Node (sumTo za pomocą array+reduce, bench.mjs drukujący METRIC seconds= i checks.mjs), a następnie uruchomiłem pętlę na dwa sposoby w tymczasowym HOME. Baseline (bez umiejętności): po prostu przepisałem funkcję na pętlę akumulatora i ponownie uruchomiłem bench (0.7297s -> 0.3652s) — szybszy plik, bez zapisu. Umiejętność: setup zapisał sesję (autoresearch.md/.jsonl/.sh), doctor --check-benchmark potwierdził kontrakt METRIC, next+log przechwycił baseline 0.7234, następnie pakiet keep zalogował 0.3542 z przechodzącymi testami (exit 0, "checks OK"), utworzył zatwierdzenie git 8d4e192 dotykające tylko lib/sum.mjs, dołączył notatkę ASI (hypothesis/evidence/next-action), a finalize-preview wygenerował plan gałęzi recenzji oznaczający dojrzałość "experimental". Decydująca różnica: kiedy podałem szybszą, ale błędną zmianę (closed-form +1), testy pakietu zakończyły się z exit 1, a CLI wymusiło status checks_failed jako jedyny dozwolony status, odmawiając zachowania — ścieżka bazowa nie ma takiej bramki regresji.

Testowano: 2026-07-21 · Claude Code 2.x (agent harness)

Instalacja

git clone --depth 1 https://github.com/TheGreenCedar/codex-autoresearch.git /tmp/codex-autoresearch-src
mkdir -p ~/.claude/skills
cp -R /tmp/codex-autoresearch-src/plugins/codex-autoresearch/skills/codex-autoresearch ~/.claude/skills/codex-autoresearch
# NOTE: this is a Codex PLUGIN, not a standalone skill. The SKILL.md drives a Node CLI that
# lives OUTSIDE the skill folder at /tmp/codex-autoresearch-src/plugins/codex-autoresearch/scripts/autoresearch.mjs
# Requirements: Node >= 24. On first run the CLI hydrates a runtime (downloads the matching
# GitHub release tarball with sha256 verification, or build locally from the clone).
# Run commands from the package root, e.g.:
#   node /tmp/codex-autoresearch-src/plugins/codex-autoresearch/scripts/autoresearch.mjs setup --cwd <project> --name <s> --metric-name seconds --direction lower --benchmark-command "<cmd printing METRIC name=value>" --checks-command "<cmd>"
# Intended install path is Codex's /plugins picker (TheGreenCedar -> codex-autoresearch), which bundles the CLI.

Komendy i przykładowe prompty

  • /codex-autoresearchZmierzona, wznawialna pętla optymalizacji z bazą, bramką poprawności i rejestrem dowodów

Skille uruchamiają się na zwykłe polecenia — bez komend do zapamiętania. Po instalacji aktywują go prompty takie jak te (po angielsku):

  • Start a new Codex Autoresearch loop
  • Resume and inspect the current autoresearch run
  • Show the autoresearch dashboard and quality gaps