Dataset Evaluation

Validiert JSONL-Fine-Tuning-Datasets gegen SageMaker SFT/DPO/RLVR-Schemas, zeilenweise Fehler

von awslabs · awslabs/agent-plugins

Getestet · Funktioniert ★ 9.2/10

Dataset Evaluation — Validiert JSONL-Fine-Tuning-Datasets gegen SageMaker SFT/DPO/RLVR-Schemas, zeilenweise Fehler

Was es kann

Erkennt das Format eines lokalen oder S3 JSONL-Datasets und validiert es vor einem Trainingsjob gegen SageMaker-Fine-Tuning-Schemas (Nova, GPT-OSS, Open-Weights SFT/DPO, Verl/RLVR und Eval). Wird ausgelöst bei Formulierungen wie "is my dataset okay", "check my training data" oder "evaluate my data", wobei ein gebündeltes format_detector.py ausgeführt wird, das bis zu 1MB abtastet und das erkannte Format sowie zeilennummerierte Fehler meldet. Berichtet, ob die Daten bereit sind, und verweist auf den Dataset-Transformations-Skill, wenn dies nicht der Fall ist.

Testbericht

Installiert in ein temporäres HOME (echtes ~/.claude/skills bestätigt unberührt) und das gebündelte format_detector.py gegen ein 240-zeiliges DPO-Dataset ausgeführt, das ich mit 4 versteckten Fehlern generiert hatte. Baseline (Kopf-/Endprüfung, kein Skill) kam zu dem Schluss "format looks correct, ready to train" und übersah alle vier; der Skill-Lauf klassifizierte die Datei als open_weights_dpo und markierte Zeile 89 (unterminated-string JSON), 137 (fehlendes 'rejected' -> unknown), 201 ('rejected' null not str) und 226 ('chosen' list not str), exit 1. Frontmatter wird mit name+description geparst; alle drei referenzierten Dateien geben HTTP 200 zurück; keine Sicherheitsrisiken. Einziger Reibungspunkt: boto3 wird auf Modulebene importiert, sodass es auch für lokale Dateien benötigt wird (auf meinem System bei 1.43.27 vorhanden; eine saubere venv löste ModuleNotFoundError aus).

Getestet am: 2026-07-21 · Claude Code 2.x (agent harness)

Installation

git clone --depth 1 https://github.com/awslabs/agent-plugins.git /tmp/dataset-evaluation-src
mkdir -p ~/.claude/skills
cp -R /tmp/dataset-evaluation-src/plugins/sagemaker-ai/skills/dataset-evaluation ~/.claude/skills/dataset-evaluation
# Dependency: scripts/format_detector.py imports boto3 at module top level, so it is
#   required even for local-file validation:  pip install boto3
# Run directly:  python ~/.claude/skills/dataset-evaluation/scripts/format_detector.py <path-or-s3-uri>
#   add --json for machine-readable output; exit code 0 = valid, 1 = invalid/error
# Plugin-marketplace alternative: the skill ships in the sagemaker-ai plugin of the
#   awslabs/agent-plugins marketplace (.claude-plugin/marketplace.json).

Befehle & Beispiel-Prompts

  • /dataset-evaluationValidiert JSONL-Fine-Tuning-Datasets gegen SageMaker SFT/DPO/RLVR-Schemas, zeilenweise Fehler

Skills reagieren auf normale Anfragen — keine Slash-Befehle nötig. Nach der Installation aktivieren Prompts wie diese den Skill (auf Englisch):

  • Check if my dataset is ready for SFT fine-tuning
  • Validate this DPO dataset schema before training
  • Evaluate my training data for format issues