Analyze Results

Beregner statistikk og sammenligningstabeller fra ML-eksperimentresultater.

av wanshuiyin · wanshuiyin/Auto-claude-code-research-in-sleep

Krever oppsett ★ 6.8/10

Analyze Results — Beregner statistikk og sammenligningstabeller fra ML-eksperimentresultater.

Hva den gjør

Analyser ML-eksperimentresultater, beregn statistikk, generer sammenligningstabeller og innsikt. Brukes når brukeren sier «analyze results», «compare», eller trenger å tolke eksperimentelle data.

Testrapport

Testet på et 3-konfig x 3-seed accuracy/loss-sveip med én plantet divergert kjøring (config_B seed 2 på 0,400 mot søsknene 0,78/0,79). Verbatim-installasjon (git clone + cp) fungerer rent; skillen er en enkelt selvstendig prompt-arbeidsflyt-SKILL.md uten skript, API-nøkler eller eksterne avhengigheter. I A/B-testen flagget både skill-armen og den rene base-armen korrekt avvikeren, beregnet korrekte delta mot baseline, og løftet frem forbeholdet om config_A-vs-config_B-rangering med like god statistisk soliditet og presentasjon, så skillen ga ingen målbar gevinst over en agent uten skill på denne oppgaven.

Testet på: 2026-07-12 · Claude Code 2.x (agent harness)

Installer

git clone https://github.com/wanshuiyin/Auto-claude-code-research-in-sleep
cd Auto-claude-code-research-in-sleep
mkdir -p ~/.claude/skills
cp -r skills/analyze-results ~/.claude/skills/analyze-results

Kommandoer og eksempelprompter

  • /analyze-resultsBeregner statistikk og sammenligningstabeller fra ML-eksperimentresultater.

Skills utløses av vanlige forespørsler — ingen kommandoer å huske. Etter installasjonen aktiverer prompter som disse skillen (på engelsk):

  • Compare these experiment results and summarize findings
  • Analyze the results from my last training run
  • Generate a comparison table across these model runs