Dataset Evaluation
Valida conjuntos de datos JSONL de fine-tuning contra esquemas SageMaker SFT/DPO/RLVR, errores por línea
Probado · Funciona
Qué hace
Detecta el formato de un conjunto de datos JSONL local o de S3 y lo valida contra los esquemas de fine-tuning de SageMaker (Nova, GPT-OSS, SFT/DPO de pesos abiertos, Verl/RLVR y eval) antes de un trabajo de entrenamiento. Se activa con frases como "is my dataset okay", "check my training data" o "evaluate my data", ejecutando un format_detector.py incluido que muestrea hasta 1MB e informa el formato detectado más los errores numerados por línea. Informa si los datos están listos y apunta a la skill de transformación de datos cuando no lo están.
Informe de la prueba
Instalado en un HOME temporal (se confirmó que ~/.claude/skills real no fue tocado) y ejecuté el format_detector.py incluido contra un conjunto de datos DPO de 240 líneas que generé con 4 defectos ocultos. La línea base (inspección visual de principio a fin, sin skill) concluyó que "format looks correct, ready to train" y pasó por alto los cuatro; la ejecución de la skill clasificó el archivo como open_weights_dpo y marcó la línea 89 (JSON con cadena no terminada), 137 (falta 'rejected' -> desconocido), 201 ('rejected' null no es str), y 226 (lista 'chosen' no es str), exit 1. El frontmatter se analiza con name+description; los tres archivos referenciados devuelven HTTP 200; no hay indicios de seguridad. Única fricción: boto3 se importa a nivel superior del módulo, por lo que es necesario incluso para archivos locales (presente en mi máquina en 1.43.27; un venv limpio generó ModuleNotFoundError).
Probado el: 2026-07-21 · Claude Code 2.x (agent harness)
Instalación
git clone --depth 1 https://github.com/awslabs/agent-plugins.git /tmp/dataset-evaluation-src mkdir -p ~/.claude/skills cp -R /tmp/dataset-evaluation-src/plugins/sagemaker-ai/skills/dataset-evaluation ~/.claude/skills/dataset-evaluation # Dependency: scripts/format_detector.py imports boto3 at module top level, so it is # required even for local-file validation: pip install boto3 # Run directly: python ~/.claude/skills/dataset-evaluation/scripts/format_detector.py <path-or-s3-uri> # add --json for machine-readable output; exit code 0 = valid, 1 = invalid/error # Plugin-marketplace alternative: the skill ships in the sagemaker-ai plugin of the # awslabs/agent-plugins marketplace (.claude-plugin/marketplace.json).
Comandos y prompts de ejemplo
/dataset-evaluationValida conjuntos de datos JSONL de fine-tuning contra esquemas SageMaker SFT/DPO/RLVR, errores por línea
Los skills se activan con peticiones en lenguaje natural, sin comandos que memorizar. Tras instalarlo, prompts como estos lo activan (en inglés):
Check if my dataset is ready for SFT fine-tuningValidate this DPO dataset schema before trainingEvaluate my training data for format issues