Analyze Results

Berechnet Statistiken und Vergleichstabellen aus ML-Experimentergebnissen.

von wanshuiyin · wanshuiyin/Auto-claude-code-research-in-sleep

Funktioniert mit Setup ★ 6.8/10

Analyze Results — Berechnet Statistiken und Vergleichstabellen aus ML-Experimentergebnissen.

Was es kann

Analysiert ML-Experimentergebnisse, berechnet Statistiken, erzeugt Vergleichstabellen und Erkenntnisse. Einsetzen, wenn Nutzer „analyze results“, „compare“ sagen oder experimentelle Daten interpretiert werden müssen.

Testbericht

Getestet an einem 3-Konfigurationen-x-3-Seeds-Accuracy/Loss-Sweep mit einem eingeschleusten divergierten Lauf (config_B seed 2 bei 0.400 gegenüber 0.78/0.79 bei den Geschwisterläufen). Die wortgetreue Installation (git clone + cp) funktioniert sauber; der Skill ist eine einzelne, in sich geschlossene Prompt-Workflow-SKILL.md ohne Skripte, API-Keys oder externe Abhängigkeiten. Im A/B-Test markierten sowohl der Skill-Arm als auch der reine Base-Arm den Ausreißer korrekt, berechneten korrekte Deltas gegenüber der Baseline und wiesen mit gleicher statistischer Solidität und Präsentation auf den config_A-vs-config_B-Ranking-Vorbehalt hin – der Skill brachte bei dieser Aufgabe also keinen messbaren Mehrwert gegenüber einem Agenten ohne Skill.

Getestet am: 2026-07-12 · Claude Code 2.x (agent harness)

Installation

git clone https://github.com/wanshuiyin/Auto-claude-code-research-in-sleep
cd Auto-claude-code-research-in-sleep
mkdir -p ~/.claude/skills
cp -r skills/analyze-results ~/.claude/skills/analyze-results

Befehle & Beispiel-Prompts

  • /analyze-resultsBerechnet Statistiken und Vergleichstabellen aus ML-Experimentergebnissen.

Skills reagieren auf normale Anfragen — keine Slash-Befehle nötig. Nach der Installation aktivieren Prompts wie diese den Skill (auf Englisch):

  • Compare these experiment results and summarize findings
  • Analyze the results from my last training run
  • Generate a comparison table across these model runs