Dataset Evaluation
Valide les jeux de données d'ajustement JSONL par rapport aux schémas SageMaker SFT/DPO/RLVR, erreurs par ligne
Testé · Fonctionne
Ce que fait
Détecte le format d'un jeu de données JSONL local ou S3 et le valide par rapport aux schémas d'ajustement SageMaker (Nova, GPT-OSS, SFT/DPO à poids ouverts, Verl/RLVR et eval) avant un travail d'entraînement. Se déclenche sur des expressions comme "is my dataset okay", "check my training data" ou "evaluate my data", exécutant un script format_detector.py inclus qui échantillonne jusqu'à 1 Mo et rapporte le format détecté ainsi que les erreurs numérotées par ligne. Indique si les données sont prêtes et renvoie à la compétence de transformation de jeu de données si elles ne le sont pas.
Rapport de test
Installé dans un HOME temporaire (le vrai ~/.claude/skills est confirmé intact) et exécuté le format_detector.py inclus contre un jeu de données DPO de 240 lignes que j'ai généré avec 4 défauts cachés. La référence (examen visuel tête/queue, sans compétence) a conclu "format looks correct, ready to train" et a manqué les quatre ; l'exécution de la compétence a classifié le fichier comme open_weights_dpo et a signalé la ligne 89 (JSON de chaîne non terminée), 137 (manque 'rejected' -> inconnu), 201 ('rejected' null n'est pas une chaîne), et 226 ('chosen' liste n'est pas une chaîne), exit 1. Le frontmatter est parsé avec name+description ; les trois fichiers référencés renvoient HTTP 200 ; pas de problèmes de sécurité. Seul frottement : boto3 est importé au niveau supérieur du module, il est donc nécessaire même pour les fichiers locaux (présent sur ma machine à 1.43.27 ; un venv propre a levé ModuleNotFoundError).
Testé le: 2026-07-21 · Claude Code 2.x (agent harness)
Installation
git clone --depth 1 https://github.com/awslabs/agent-plugins.git /tmp/dataset-evaluation-src mkdir -p ~/.claude/skills cp -R /tmp/dataset-evaluation-src/plugins/sagemaker-ai/skills/dataset-evaluation ~/.claude/skills/dataset-evaluation # Dependency: scripts/format_detector.py imports boto3 at module top level, so it is # required even for local-file validation: pip install boto3 # Run directly: python ~/.claude/skills/dataset-evaluation/scripts/format_detector.py <path-or-s3-uri> # add --json for machine-readable output; exit code 0 = valid, 1 = invalid/error # Plugin-marketplace alternative: the skill ships in the sagemaker-ai plugin of the # awslabs/agent-plugins marketplace (.claude-plugin/marketplace.json).
Commandes et exemples de prompts
/dataset-evaluationValide les jeux de données d'ajustement JSONL par rapport aux schémas SageMaker SFT/DPO/RLVR, erreurs par ligne
Les skills se déclenchent sur des demandes en langage courant — aucune commande à retenir. Après installation, des prompts comme ceux-ci l'activent (en anglais) :
Check if my dataset is ready for SFT fine-tuningValidate this DPO dataset schema before trainingEvaluate my training data for format issues