Arize Evaluator

Bygg och kör LLM-as-judge utvärderare på Arize via ax CLI, med kolumnmappning och övervakning.

av github · github/awesome-copilot

Testad · Fungerar ★ 9.6/10

Arize Evaluator — Bygg och kör LLM-as-judge utvärderare på Arize via ax CLI, med kolumnmappning och övervakning.

Vad den gör

Kapslar in Arize `ax` CLI för att skapa/versionera utvärderare, koppla dem till projekt eller experiment via kolumnmappningar och utlösa backfill eller kontinuerliga körningar. Utlöses av förfrågningar om att skapa en utvärderare, köra en LLM judge, poängsätta hallucination/korrekthet/relevans, eller ställa in kontinuerlig övervakning på Arize spans eller experiment.

Testrapport

Dess felsökningstabell flaggar en 1-2 timmars eval-index fördröjning som tyst poängsätter 0 spans, och att trigger-run behöver bare-ISO tidsstämplar utan avslutande Z – exakt de operativa fallgropar som en baslinjegissning på ax CLI skulle missa.

Testad: 2026-07-14 · Claude Code 2.x (agent harness)

Installation

git clone https://github.com/github/awesome-copilot
cd awesome-copilot
mkdir -p ~/.claude/skills
cp -r skills/arize-evaluator ~/.claude/skills/arize-evaluator

Kommandon och exempelprompter

  • /arize-evaluatorBygg och kör LLM-as-judge utvärderare på Arize via ax CLI, med kolumnmappning och övervakning.

Skills triggas av vanliga förfrågningar — inga kommandon att memorera. Efter installationen aktiverar prompter som dessa skillen (på engelska):

  • Set up an LLM-as-judge evaluator with the ax CLI
  • Run an eval over my traced LLM spans in Arize
  • Create a trigger-run eval for my agent's outputs