Arize Evaluator

Bygg og kjør LLM-as-judge evaluators på Arize via ax CLI, med kolonnemapping og overvåking.

av github · github/awesome-copilot

Bestått ★ 9.6/10

Arize Evaluator — Bygg og kjør LLM-as-judge evaluators på Arize via ax CLI, med kolonnemapping og overvåking.

Hva den gjør

Pakker Arize `ax` CLI for å opprette/versjonere evaluators, koble dem til prosjekter eller eksperimenter via kolonnemapping, og utløse backfill eller kontinuerlige kjøringer. Utløses ved forespørsler om å opprette en evaluator, kjøre en LLM judge, score hallucination/correctness/relevance, eller sette opp kontinuerlig overvåking på Arize spans eller eksperimenter.

Testrapport

Feilsøkingstabellen flagger en 1-2 timers eval-indeksforsinkelse som stille scorer 0 spans, og at trigger-run trenger bare-ISO tidsstempler uten etterfølgende Z – nøyaktig de operasjonelle fallgruvene et grunnlinje-gjetning på ax CLI ville gjort feil.

Testet på: 2026-07-14 · Claude Code 2.x (agent harness)

Installer

git clone https://github.com/github/awesome-copilot
cd awesome-copilot
mkdir -p ~/.claude/skills
cp -r skills/arize-evaluator ~/.claude/skills/arize-evaluator

Kommandoer og eksempelprompter

  • /arize-evaluatorBygg og kjør LLM-as-judge evaluators på Arize via ax CLI, med kolonnemapping og overvåking.

Skills utløses av vanlige forespørsler — ingen kommandoer å huske. Etter installasjonen aktiverer prompter som disse skillen (på engelsk):

  • Set up an LLM-as-judge evaluator with the ax CLI
  • Run an eval over my traced LLM spans in Arize
  • Create a trigger-run eval for my agent's outputs