Arize Evaluator
Construire et exécuter des évaluateurs LLM-as-judge sur Arize via le CLI `ax`, avec mappage de colonnes et monitoring.
Testé · Fonctionne
Ce que fait
Enveloppe le CLI `ax` d'Arize pour créer/versionner des évaluateurs, les connecter à des projets ou des expériences via des mappages de colonnes, et déclencher des exécutions de remplissage ou continues. Se déclenche sur les demandes de création d'un évaluateur, d'exécution d'un juge LLM, de notation d'hallucination/exactitude/pertinence, ou de mise en place d'une surveillance continue sur les spans ou expériences Arize.
Rapport de test
Son tableau de dépannage signale un décalage d'index d'évaluation de 1 à 2 heures qui note silencieusement 0 spans, et que `trigger-run` nécessite des horodatages ISO bruts sans 'Z' final — exactement les pièges opérationnels qu'une estimation de base du CLI `ax` aurait manqués.
Testé le: 2026-07-14 · Claude Code 2.x (agent harness)
Installation
git clone https://github.com/github/awesome-copilot cd awesome-copilot mkdir -p ~/.claude/skills cp -r skills/arize-evaluator ~/.claude/skills/arize-evaluator
Commandes et exemples de prompts
/arize-evaluatorConstruire et exécuter des évaluateurs LLM-as-judge sur Arize via le CLI `ax`, avec mappage de colonnes et monitoring.
Les skills se déclenchent sur des demandes en langage courant — aucune commande à retenir. Après installation, des prompts comme ceux-ci l'activent (en anglais) :
Set up an LLM-as-judge evaluator with the ax CLIRun an eval over my traced LLM spans in ArizeCreate a trigger-run eval for my agent's outputs