Dataset Evaluation

Valida conjuntos de datos JSONL de fine-tuning contra esquemas SageMaker SFT/DPO/RLVR, errores por línea

Por awslabs · awslabs/agent-plugins

Probado · Funciona ★ 9.2/10

Dataset Evaluation — Valida conjuntos de datos JSONL de fine-tuning contra esquemas SageMaker SFT/DPO/RLVR, errores por línea

Qué hace

Detecta el formato de un conjunto de datos JSONL local o de S3 y lo valida contra los esquemas de fine-tuning de SageMaker (Nova, GPT-OSS, SFT/DPO de pesos abiertos, Verl/RLVR y eval) antes de un trabajo de entrenamiento. Se activa con frases como "is my dataset okay", "check my training data" o "evaluate my data", ejecutando un format_detector.py incluido que muestrea hasta 1MB e informa el formato detectado más los errores numerados por línea. Informa si los datos están listos y apunta a la skill de transformación de datos cuando no lo están.

Informe de la prueba

Instalado en un HOME temporal (se confirmó que ~/.claude/skills real no fue tocado) y ejecuté el format_detector.py incluido contra un conjunto de datos DPO de 240 líneas que generé con 4 defectos ocultos. La línea base (inspección visual de principio a fin, sin skill) concluyó que "format looks correct, ready to train" y pasó por alto los cuatro; la ejecución de la skill clasificó el archivo como open_weights_dpo y marcó la línea 89 (JSON con cadena no terminada), 137 (falta 'rejected' -> desconocido), 201 ('rejected' null no es str), y 226 (lista 'chosen' no es str), exit 1. El frontmatter se analiza con name+description; los tres archivos referenciados devuelven HTTP 200; no hay indicios de seguridad. Única fricción: boto3 se importa a nivel superior del módulo, por lo que es necesario incluso para archivos locales (presente en mi máquina en 1.43.27; un venv limpio generó ModuleNotFoundError).

Probado el: 2026-07-21 · Claude Code 2.x (agent harness)

Instalación

git clone --depth 1 https://github.com/awslabs/agent-plugins.git /tmp/dataset-evaluation-src
mkdir -p ~/.claude/skills
cp -R /tmp/dataset-evaluation-src/plugins/sagemaker-ai/skills/dataset-evaluation ~/.claude/skills/dataset-evaluation
# Dependency: scripts/format_detector.py imports boto3 at module top level, so it is
#   required even for local-file validation:  pip install boto3
# Run directly:  python ~/.claude/skills/dataset-evaluation/scripts/format_detector.py <path-or-s3-uri>
#   add --json for machine-readable output; exit code 0 = valid, 1 = invalid/error
# Plugin-marketplace alternative: the skill ships in the sagemaker-ai plugin of the
#   awslabs/agent-plugins marketplace (.claude-plugin/marketplace.json).

Comandos y prompts de ejemplo

  • /dataset-evaluationValida conjuntos de datos JSONL de fine-tuning contra esquemas SageMaker SFT/DPO/RLVR, errores por línea

Los skills se activan con peticiones en lenguaje natural, sin comandos que memorizar. Tras instalarlo, prompts como estos lo activan (en inglés):

  • Check if my dataset is ready for SFT fine-tuning
  • Validate this DPO dataset schema before training
  • Evaluate my training data for format issues