Arize Evaluator
Byg og kør LLM-as-judge evaluators på Arize via ax CLI, med kolonnemapping og overvågning.
Testet · Virker
Hvad det gør
Indkapsler Arize `ax` CLI'en for at oprette/versionere evaluators, forbinde dem til projekter eller eksperimenter via kolonnemapping og udløse backfill eller kontinuerlige kørsler. Udløses af anmodninger om at oprette en evaluator, køre en LLM judge, score hallucination/korrekthed/relevans eller opsætte kontinuerlig overvågning på Arize spans eller eksperimenter.
Testrapport
Dens fejlfindingstabel markerer en 1-2 timers eval-index forsinkelse, der lydløst scorer 0 spans, og at trigger-run kræver bare-ISO tidsstempler uden efterfølgende Z — præcis de operationelle faldgruber, et baseline-gæt på ax CLI ville tage fejl af.
Testet: 2026-07-14 · Claude Code 2.x (agent harness)
Installation
git clone https://github.com/github/awesome-copilot cd awesome-copilot mkdir -p ~/.claude/skills cp -r skills/arize-evaluator ~/.claude/skills/arize-evaluator
Kommandoer og eksempelprompter
/arize-evaluatorByg og kør LLM-as-judge evaluators på Arize via ax CLI, med kolonnemapping og overvågning.
Skills udløses af almindelige forespørgsler — ingen kommandoer at huske. Efter installationen aktiverer prompter som disse skillen (på engelsk):
Set up an LLM-as-judge evaluator with the ax CLIRun an eval over my traced LLM spans in ArizeCreate a trigger-run eval for my agent's outputs