Dataset Evaluation

Waliduje zbiory danych JSONL do fine-tuningu względem schematów SageMaker SFT/DPO/RLVR, błędy w poszczególnych liniach

Autor: awslabs · awslabs/agent-plugins

Testowano · Działa ★ 9.2/10

Dataset Evaluation — Waliduje zbiory danych JSONL do fine-tuningu względem schematów SageMaker SFT/DPO/RLVR, błędy w poszczególnych liniach

Co robi ten skill

Wykrywa format lokalnego lub S3 zbioru danych JSONL i waliduje go względem schematów fine-tuningu SageMaker (Nova, GPT-OSS, open-weights SFT/DPO, Verl/RLVR i eval) przed zadaniem treningowym. Uruchamia się na frazy takie jak "is my dataset okay", "check my training data" lub "evaluate my data", uruchamiając dołączony format_detector.py, który próbkuje do 1MB i zgłasza wykryty format oraz błędy z numerami linii. Raportuje, czy dane są gotowe i wskazuje na umiejętność transformacji zbioru danych, gdy nie są.

Raport z testu

Zainstalowano w tymczasowym HOME (prawdziwe ~/.claude/skills potwierdzono jako nienaruszone) i uruchomiono dołączony format_detector.py na 240-liniowym zbiorze danych DPO, który wygenerowałem z 4 ukrytymi defektami. Baseline (oglądanie nagłówka/końca, bez umiejętności) stwierdził, że "format looks correct, ready to train" i przegapił wszystkie cztery; uruchomienie umiejętności sklasyfikowało plik jako open_weights_dpo i oznaczyło linię 89 (JSON z nieukończonym ciągiem), 137 (brak 'rejected' -> unknown), 201 ('rejected' null nie jest str) i 226 ('chosen' list nie jest str), exit 1. Frontmatter parsowany z name+description; wszystkie trzy odwołujące się pliki zwracają HTTP 200; brak zagrożeń bezpieczeństwa. Jedyny problem: boto3 jest importowane na najwyższym poziomie modułu, więc jest potrzebne nawet dla plików lokalnych (obecne na moim komputerze w wersji 1.43.27; czyste venv zgłosiło ModuleNotFoundError).

Testowano: 2026-07-21 · Claude Code 2.x (agent harness)

Instalacja

git clone --depth 1 https://github.com/awslabs/agent-plugins.git /tmp/dataset-evaluation-src
mkdir -p ~/.claude/skills
cp -R /tmp/dataset-evaluation-src/plugins/sagemaker-ai/skills/dataset-evaluation ~/.claude/skills/dataset-evaluation
# Dependency: scripts/format_detector.py imports boto3 at module top level, so it is
#   required even for local-file validation:  pip install boto3
# Run directly:  python ~/.claude/skills/dataset-evaluation/scripts/format_detector.py <path-or-s3-uri>
#   add --json for machine-readable output; exit code 0 = valid, 1 = invalid/error
# Plugin-marketplace alternative: the skill ships in the sagemaker-ai plugin of the
#   awslabs/agent-plugins marketplace (.claude-plugin/marketplace.json).

Komendy i przykładowe prompty

  • /dataset-evaluationWaliduje zbiory danych JSONL do fine-tuningu względem schematów SageMaker SFT/DPO/RLVR, błędy w poszczególnych liniach

Skille uruchamiają się na zwykłe polecenia — bez komend do zapamiętania. Po instalacji aktywują go prompty takie jak te (po angielsku):

  • Check if my dataset is ready for SFT fine-tuning
  • Validate this DPO dataset schema before training
  • Evaluate my training data for format issues