Dataset Evaluation
Convalida dataset JSONL di fine-tuning rispetto agli schemi SageMaker SFT/DPO/RLVR, errori per riga
Promosso
Cosa fa
Rileva il formato di un dataset JSONL locale o S3 e lo convalida rispetto agli schemi di fine-tuning di SageMaker (Nova, GPT-OSS, open-weights SFT/DPO, Verl/RLVR ed eval) prima di un job di training. Si attiva su frasi come "il mio dataset è a posto", "controlla i miei dati di training" o "valuta i miei dati", eseguendo un format_detector.py incluso che campiona fino a 1MB e riporta il formato rilevato più gli errori numerati per riga. Riporta se i dati sono pronti e indica la skill di trasformazione del dataset quando non lo sono.
Rapporto di test
Installato in una HOME temporanea (il vero ~/.claude/skills è rimasto intatto) e ho eseguito il format_detector.py incluso su un dataset DPO di 240 righe che ho generato con 4 difetti nascosti. La baseline (ispezione visiva, nessuna skill) ha concluso "il formato sembra corretto, pronto per il training" e ha mancato tutti e quattro i difetti; l'esecuzione della skill ha classificato il file come open_weights_dpo e ha segnalato la riga 89 (JSON con stringa non terminata), 137 (manca 'rejected' -> sconosciuto), 201 ('rejected' null non str) e 226 (lista 'chosen' non str), exit 1. Il frontmatter viene analizzato con name+description; tutti e tre i file referenziati restituiscono HTTP 200; nessun problema di sicurezza. Unico attrito: boto3 viene importato a livello di modulo superiore, quindi è necessario anche per i file locali (presente sulla mia macchina alla versione 1.43.27; un venv pulito ha generato ModuleNotFoundError).
Testato il: 2026-07-21 · Claude Code 2.x (agent harness)
Installazione
git clone --depth 1 https://github.com/awslabs/agent-plugins.git /tmp/dataset-evaluation-src mkdir -p ~/.claude/skills cp -R /tmp/dataset-evaluation-src/plugins/sagemaker-ai/skills/dataset-evaluation ~/.claude/skills/dataset-evaluation # Dependency: scripts/format_detector.py imports boto3 at module top level, so it is # required even for local-file validation: pip install boto3 # Run directly: python ~/.claude/skills/dataset-evaluation/scripts/format_detector.py <path-or-s3-uri> # add --json for machine-readable output; exit code 0 = valid, 1 = invalid/error # Plugin-marketplace alternative: the skill ships in the sagemaker-ai plugin of the # awslabs/agent-plugins marketplace (.claude-plugin/marketplace.json).
Comandi e prompt di esempio
/dataset-evaluationConvalida dataset JSONL di fine-tuning rispetto agli schemi SageMaker SFT/DPO/RLVR, errori per riga
Gli skill si attivano con richieste in linguaggio naturale, senza comandi da ricordare. Dopo l'installazione, prompt come questi lo attivano (in inglese):
Check if my dataset is ready for SFT fine-tuningValidate this DPO dataset schema before trainingEvaluate my training data for format issues