Arize Evaluator

Construye y ejecuta evaluadores LLM-as-judge en Arize a través de la CLI ax, con mapeo de columnas y monitoreo.

Por github · github/awesome-copilot

Probado · Funciona ★ 9.6/10

Arize Evaluator — Construye y ejecuta evaluadores LLM-as-judge en Arize a través de la CLI ax, con mapeo de columnas y monitoreo.

Qué hace

Envuelve la CLI `ax` de Arize para crear/versionar evaluadores, conectarlos a proyectos o experimentos a través de mapeos de columnas, y activar rellenos o ejecuciones continuas. Se activa con solicitudes para crear un evaluador, ejecutar un juez LLM, calificar alucinación/corrección/relevancia, o configurar monitoreo continuo en spans o experimentos de Arize.

Informe de la prueba

Su tabla de solución de problemas señala un retraso de 1-2 horas en el índice de evaluación que puntúa silenciosamente 0 spans, y que trigger-run necesita marcas de tiempo ISO puras sin Z final — exactamente los inconvenientes operativos que una suposición de referencia de la CLI ax cometería.

Probado el: 2026-07-14 · Claude Code 2.x (agent harness)

Instalación

git clone https://github.com/github/awesome-copilot
cd awesome-copilot
mkdir -p ~/.claude/skills
cp -r skills/arize-evaluator ~/.claude/skills/arize-evaluator

Comandos y prompts de ejemplo

  • /arize-evaluatorConstruye y ejecuta evaluadores LLM-as-judge en Arize a través de la CLI ax, con mapeo de columnas y monitoreo.

Los skills se activan con peticiones en lenguaje natural, sin comandos que memorizar. Tras instalarlo, prompts como estos lo activan (en inglés):

  • Set up an LLM-as-judge evaluator with the ax CLI
  • Run an eval over my traced LLM spans in Arize
  • Create a trigger-run eval for my agent's outputs