Dataset Evaluation

Convalida dataset JSONL di fine-tuning rispetto agli schemi SageMaker SFT/DPO/RLVR, errori per riga

di awslabs · awslabs/agent-plugins

Promosso ★ 9.2/10

Dataset Evaluation — Convalida dataset JSONL di fine-tuning rispetto agli schemi SageMaker SFT/DPO/RLVR, errori per riga

Cosa fa

Rileva il formato di un dataset JSONL locale o S3 e lo convalida rispetto agli schemi di fine-tuning di SageMaker (Nova, GPT-OSS, open-weights SFT/DPO, Verl/RLVR ed eval) prima di un job di training. Si attiva su frasi come "il mio dataset è a posto", "controlla i miei dati di training" o "valuta i miei dati", eseguendo un format_detector.py incluso che campiona fino a 1MB e riporta il formato rilevato più gli errori numerati per riga. Riporta se i dati sono pronti e indica la skill di trasformazione del dataset quando non lo sono.

Rapporto di test

Installato in una HOME temporanea (il vero ~/.claude/skills è rimasto intatto) e ho eseguito il format_detector.py incluso su un dataset DPO di 240 righe che ho generato con 4 difetti nascosti. La baseline (ispezione visiva, nessuna skill) ha concluso "il formato sembra corretto, pronto per il training" e ha mancato tutti e quattro i difetti; l'esecuzione della skill ha classificato il file come open_weights_dpo e ha segnalato la riga 89 (JSON con stringa non terminata), 137 (manca 'rejected' -> sconosciuto), 201 ('rejected' null non str) e 226 (lista 'chosen' non str), exit 1. Il frontmatter viene analizzato con name+description; tutti e tre i file referenziati restituiscono HTTP 200; nessun problema di sicurezza. Unico attrito: boto3 viene importato a livello di modulo superiore, quindi è necessario anche per i file locali (presente sulla mia macchina alla versione 1.43.27; un venv pulito ha generato ModuleNotFoundError).

Testato il: 2026-07-21 · Claude Code 2.x (agent harness)

Installazione

git clone --depth 1 https://github.com/awslabs/agent-plugins.git /tmp/dataset-evaluation-src
mkdir -p ~/.claude/skills
cp -R /tmp/dataset-evaluation-src/plugins/sagemaker-ai/skills/dataset-evaluation ~/.claude/skills/dataset-evaluation
# Dependency: scripts/format_detector.py imports boto3 at module top level, so it is
#   required even for local-file validation:  pip install boto3
# Run directly:  python ~/.claude/skills/dataset-evaluation/scripts/format_detector.py <path-or-s3-uri>
#   add --json for machine-readable output; exit code 0 = valid, 1 = invalid/error
# Plugin-marketplace alternative: the skill ships in the sagemaker-ai plugin of the
#   awslabs/agent-plugins marketplace (.claude-plugin/marketplace.json).

Comandi e prompt di esempio

  • /dataset-evaluationConvalida dataset JSONL di fine-tuning rispetto agli schemi SageMaker SFT/DPO/RLVR, errori per riga

Gli skill si attivano con richieste in linguaggio naturale, senza comandi da ricordare. Dopo l'installazione, prompt come questi lo attivano (in inglese):

  • Check if my dataset is ready for SFT fine-tuning
  • Validate this DPO dataset schema before training
  • Evaluate my training data for format issues