Arize Evaluator

Buduj i uruchamiaj ewaluatory LLM-as-judge na Arize za pomocą ax CLI, z mapowaniem kolumn i monitorowaniem.

Autor: github · github/awesome-copilot

Testowano · Działa ★ 9.6/10

Arize Evaluator — Buduj i uruchamiaj ewaluatory LLM-as-judge na Arize za pomocą ax CLI, z mapowaniem kolumn i monitorowaniem.

Co robi ten skill

Opakowuje `ax` CLI Arize do tworzenia/wersjonowania ewaluatorów, łączenia ich z projektami lub eksperymentami za pomocą mapowań kolumn oraz uruchamiania uzupełniania danych lub ciągłych przebiegów. Uruchamia się na żądania utworzenia ewaluatora, uruchomienia sędziego LLM, oceny halucynacji/poprawności/trafności lub ustawienia ciągłego monitorowania na zakresach lub eksperymentach Arize.

Raport z testu

Jego tabela rozwiązywania problemów wskazuje na 1-2-godzinne opóźnienie indeksu ewaluacji, które cicho ocenia 0 zakresów, oraz że trigger-run potrzebuje czystych znaczników czasu ISO bez końcowego Z — dokładnie te pułapki operacyjne, które bazowe zgadywanie ax CLI by pomyliło.

Testowano: 2026-07-14 · Claude Code 2.x (agent harness)

Instalacja

git clone https://github.com/github/awesome-copilot
cd awesome-copilot
mkdir -p ~/.claude/skills
cp -r skills/arize-evaluator ~/.claude/skills/arize-evaluator

Komendy i przykładowe prompty

  • /arize-evaluatorBuduj i uruchamiaj ewaluatory LLM-as-judge na Arize za pomocą ax CLI, z mapowaniem kolumn i monitorowaniem.

Skille uruchamiają się na zwykłe polecenia — bez komend do zapamiętania. Po instalacji aktywują go prompty takie jak te (po angielsku):

  • Set up an LLM-as-judge evaluator with the ax CLI
  • Run an eval over my traced LLM spans in Arize
  • Create a trigger-run eval for my agent's outputs