Auto Itera

Exécute une expérience disciplinée baseline vs bras jusqu'à un verdict scellé de livraison ou d'élimination des tests.

par clfhaha1234 · clfhaha1234/auto-itera

Testé · Fonctionne ★ 9.6/10

Auto Itera — Exécute une expérience disciplinée baseline vs bras jusqu'à un verdict scellé de livraison ou d'élimination des tests.

Ce que fait

Étant donné un objectif, des bras candidats (prompts/modèles/architectures) et un seuil pré-enregistré, source de manière autonome les données, divise l'entraînement/le développement/les tests tenus à l'écart, note les bras en parallèle, itère rapidement derrière une porte de généralisation et rédige un document de conclusion d'une page avec trois vrais graphiques matplotlib. Se déclenche sur les questions de type 'devrions-nous utiliser X ou Y', 'comparer ces prompts/modèles', 'cette conception est-elle meilleure' où un verdict défendable est nécessaire, pas sur des corrections de bugs simples basées sur des premiers principes.

Rapport de test

A exécuté une véritable expérience jouet (24 lignes de reçus synthétiques, deux heuristiques d'extraction de fournisseurs) de deux manières : la base de référence naïve a noté les deux bras sur les 24 lignes et a choisi un gagnant à partir de ce seul chiffre contaminé, exactement le contre-modèle de p-hacking que la compétence dénonce ; l'exécution guidée par la compétence a appliqué une véritable division entraînement/développement/tests scellés, un pilote de phase 3, un diagnostic par tranche et un véritable passage à l'écart - puis a rendu de vrais PNG avec les scripts groupés scripts/chart.py (matplotlib, exécuté réellement, les trois types de graphiques ont produit des images valides). Le minuscule ensemble de tests N=5 a appliqué l'effet exactement au seuil pré-enregistré, ce qui est en soi une démonstration en direct de l'avertissement d'heuristique de dimensionnement de la compétence.

Testé le: 2026-07-16 · Claude Code 2.x (agent harness)

Installation

git clone https://github.com/clfhaha1234/auto-itera
mkdir -p ~/.claude/skills
cp -r auto-itera/{SKILL.md,scripts,templates,examples} ~/.claude/skills/auto-itera/

Commandes et exemples de prompts

  • /auto-iteraExécute une expérience disciplinée baseline vs bras jusqu'à un verdict scellé de livraison ou d'élimination des tests.

Les skills se déclenchent sur des demandes en langage courant — aucune commande à retenir. Après installation, des prompts comme ceux-ci l'activent (en anglais) :

  • Should we use prompt A or prompt B for extraction? Give me real evidence.
  • Compare these two model architectures with a proper held-out test set.
  • Is this new heuristic actually better, or am I just p-hacking myself?