Arize Evaluator
Vytváří a spouští LLM-as-judge evaluátory na Arize přes ax CLI, s column mapping a monitoringem.
Otestováno · Funguje
Co umí
Obaluje Arize `ax` CLI pro vytváření/verzování evaluátorů, jejich propojení s projekty nebo experimenty via column mappings, a trigger backfill nebo continuous runs. Spouští se na požadavky na vytvoření evaluátoru, spuštění LLM judge, score hallucination/correctness/relevance, nebo set up continuous monitoring on Arize spans or experiments.
Testovací report
Its troubleshooting table flags a 1-2 hour eval-index lag that silently scores 0 spans, and that trigger-run needs bare-ISO timestamps s no trailing Z — exactly the operational gotchas a baseline guess at the ax CLI would get wrong.
Testováno: 2026-07-14 · Claude Code 2.x (agent harness)
Instalace
git clone https://github.com/github/awesome-copilot cd awesome-copilot mkdir -p ~/.claude/skills cp -r skills/arize-evaluator ~/.claude/skills/arize-evaluator
Příkazy a ukázkové prompty
/arize-evaluatorVytváří a spouští LLM-as-judge evaluátory na Arize přes ax CLI, s column mapping a monitoringem.
Skilly se spouštějí běžnými požadavky — žádné příkazy k zapamatování. Po instalaci ho aktivují prompty jako tyto (anglicky):
Set up an LLM-as-judge evaluator with the ax CLIRun an eval over my traced LLM spans in ArizeCreate a trigger-run eval for my agent's outputs