Analyze Results

Calcule des statistiques et des tableaux comparatifs à partir de résultats d'expériences ML.

par wanshuiyin · wanshuiyin/Auto-claude-code-research-in-sleep

Fonctionne avec configuration ★ 6.8/10

Analyze Results — Calcule des statistiques et des tableaux comparatifs à partir de résultats d'expériences ML.

Ce que fait

Analyse les résultats d'expériences ML, calcule des statistiques, génère des tableaux comparatifs et des enseignements. À utiliser quand l'utilisateur dit « analyse les résultats », « compare », ou a besoin d'interpréter des données expérimentales.

Rapport de test

Testé sur un balayage accuracy/loss à 3 configurations x 3 graines avec un run divergent planté (config_B graine 2 à 0,400 contre 0,78/0,79 pour ses pairs). L'installation telle quelle (git clone + cp) fonctionne proprement ; le skill est un unique SKILL.md de workflow-prompt autonome, sans scripts, clés API ni dépendances externes. Dans l'A/B, le bras avec skill et le bras de base nu ont tous deux correctement signalé la valeur aberrante, calculé les bons écarts par rapport à la référence, et fait ressortir la réserve sur le classement config_A-vs-config_B avec une rigueur statistique et une présentation équivalentes — le skill n'a donc apporté aucun gain mesurable par rapport à un agent sans skill sur cette tâche.

Testé le: 2026-07-12 · Claude Code 2.x (agent harness)

Installation

git clone https://github.com/wanshuiyin/Auto-claude-code-research-in-sleep
cd Auto-claude-code-research-in-sleep
mkdir -p ~/.claude/skills
cp -r skills/analyze-results ~/.claude/skills/analyze-results

Commandes et exemples de prompts

  • /analyze-resultsCalcule des statistiques et des tableaux comparatifs à partir de résultats d'expériences ML.

Les skills se déclenchent sur des demandes en langage courant — aucune commande à retenir. Après installation, des prompts comme ceux-ci l'activent (en anglais) :

  • Compare these experiment results and summarize findings
  • Analyze the results from my last training run
  • Generate a comparison table across these model runs