Arize Evaluator

Byg og kør LLM-as-judge evaluators på Arize via ax CLI, med kolonnemapping og overvågning.

Af github · github/awesome-copilot

Testet · Virker ★ 9.6/10

Arize Evaluator — Byg og kør LLM-as-judge evaluators på Arize via ax CLI, med kolonnemapping og overvågning.

Hvad det gør

Indkapsler Arize `ax` CLI'en for at oprette/versionere evaluators, forbinde dem til projekter eller eksperimenter via kolonnemapping og udløse backfill eller kontinuerlige kørsler. Udløses af anmodninger om at oprette en evaluator, køre en LLM judge, score hallucination/korrekthed/relevans eller opsætte kontinuerlig overvågning på Arize spans eller eksperimenter.

Testrapport

Dens fejlfindingstabel markerer en 1-2 timers eval-index forsinkelse, der lydløst scorer 0 spans, og at trigger-run kræver bare-ISO tidsstempler uden efterfølgende Z — præcis de operationelle faldgruber, et baseline-gæt på ax CLI ville tage fejl af.

Testet: 2026-07-14 · Claude Code 2.x (agent harness)

Installation

git clone https://github.com/github/awesome-copilot
cd awesome-copilot
mkdir -p ~/.claude/skills
cp -r skills/arize-evaluator ~/.claude/skills/arize-evaluator

Kommandoer og eksempelprompter

  • /arize-evaluatorByg og kør LLM-as-judge evaluators på Arize via ax CLI, med kolonnemapping og overvågning.

Skills udløses af almindelige forespørgsler — ingen kommandoer at huske. Efter installationen aktiverer prompter som disse skillen (på engelsk):

  • Set up an LLM-as-judge evaluator with the ax CLI
  • Run an eval over my traced LLM spans in Arize
  • Create a trigger-run eval for my agent's outputs