Arize Evaluator
LLM-as-Judge-Evaluatoren auf Arize über das ax CLI erstellen und ausführen, mit Spaltenzuordnung und Monitoring.
Getestet · Funktioniert
Was es kann
Umschließt das Arize `ax` CLI, um Evaluatoren zu erstellen/versionieren, sie über Spaltenzuordnungen mit Projekten oder Experimenten zu verbinden und Backfill- oder kontinuierliche Läufe auszulösen. Löst bei Anfragen aus, einen Evaluator zu erstellen, einen LLM-Richter auszuführen, Halluzination/Korrektheit/Relevanz zu bewerten oder kontinuierliches Monitoring für Arize Spans oder Experimente einzurichten.
Testbericht
Die Troubleshooting-Tabelle weist auf eine 1-2-stündige eval-index-Verzögerung hin, die stillschweigend 0 Spans bewertet, und dass trigger-run reine ISO-Zeitstempel ohne nachgestelltes Z benötigt – genau die operativen Fallstricke, die eine Basisvermutung beim ax CLI falsch machen würde.
Getestet am: 2026-07-14 · Claude Code 2.x (agent harness)
Installation
git clone https://github.com/github/awesome-copilot cd awesome-copilot mkdir -p ~/.claude/skills cp -r skills/arize-evaluator ~/.claude/skills/arize-evaluator
Befehle & Beispiel-Prompts
/arize-evaluatorLLM-as-Judge-Evaluatoren auf Arize über das ax CLI erstellen und ausführen, mit Spaltenzuordnung und Monitoring.
Skills reagieren auf normale Anfragen — keine Slash-Befehle nötig. Nach der Installation aktivieren Prompts wie diese den Skill (auf Englisch):
Set up an LLM-as-judge evaluator with the ax CLIRun an eval over my traced LLM spans in ArizeCreate a trigger-run eval for my agent's outputs