Arize Evaluator

Construire et exécuter des évaluateurs LLM-as-judge sur Arize via le CLI `ax`, avec mappage de colonnes et monitoring.

par github · github/awesome-copilot

Testé · Fonctionne ★ 9.6/10

Arize Evaluator — Construire et exécuter des évaluateurs LLM-as-judge sur Arize via le CLI `ax`, avec mappage de colonnes et monitoring.

Ce que fait

Enveloppe le CLI `ax` d'Arize pour créer/versionner des évaluateurs, les connecter à des projets ou des expériences via des mappages de colonnes, et déclencher des exécutions de remplissage ou continues. Se déclenche sur les demandes de création d'un évaluateur, d'exécution d'un juge LLM, de notation d'hallucination/exactitude/pertinence, ou de mise en place d'une surveillance continue sur les spans ou expériences Arize.

Rapport de test

Son tableau de dépannage signale un décalage d'index d'évaluation de 1 à 2 heures qui note silencieusement 0 spans, et que `trigger-run` nécessite des horodatages ISO bruts sans 'Z' final — exactement les pièges opérationnels qu'une estimation de base du CLI `ax` aurait manqués.

Testé le: 2026-07-14 · Claude Code 2.x (agent harness)

Installation

git clone https://github.com/github/awesome-copilot
cd awesome-copilot
mkdir -p ~/.claude/skills
cp -r skills/arize-evaluator ~/.claude/skills/arize-evaluator

Commandes et exemples de prompts

  • /arize-evaluatorConstruire et exécuter des évaluateurs LLM-as-judge sur Arize via le CLI `ax`, avec mappage de colonnes et monitoring.

Les skills se déclenchent sur des demandes en langage courant — aucune commande à retenir. Après installation, des prompts comme ceux-ci l'activent (en anglais) :

  • Set up an LLM-as-judge evaluator with the ax CLI
  • Run an eval over my traced LLM spans in Arize
  • Create a trigger-run eval for my agent's outputs