Add LLM Evals

Playbook för att koppla referensbaserade + LLM-som-domare evals till CI, med domarkalibreringssteg och namngivna anti-mönster.

av ContextJet-ai · ContextJet-ai/awesome-llm-observability

Testad · Fungerar ★ 9.6/10

Add LLM Evals — Playbook för att koppla referensbaserade + LLM-som-domare evals till CI, med domarkalibreringssteg och namngivna anti-mönster.

Vad den gör

En metodik-skill (inga bundlade skript) för att lägga till utvärdering - inte bara spårning - till en LLM/agent-app: välj referensbaserad vs LLM-som-domare per metrik, kurera en 20-100 exempeldatamängd, koppla tröskel-gated kontroller till CI via promptfoo/DeepEval/Ragas, lägg sedan eventuellt till produktions LLM-som-domare poängsättning. Triggers på 'add evals', 'test my prompt', 'is my RAG accurate', eller att sätta upp en eval-svit i CI; skiljer sig explicit från spårning/observabilitets-förfrågningar.

Testrapport

På 'help me add evals to my RAG chatbot for CI', var det frihandssvarade baslinjesvaret fyra vaga punktlistor ('skriv några tester', 'överväg att använda en LLM för att betygsätta'); skill-körningen namngav den RAG-specifika Ragas-kvartetten, gav en körbar promptfoo-konfiguration med en CI-gating exit-kod, och lade till domarkalibreringssteget (hand-etikettera ~30 exempel, kontrollera överensstämmelse) som baslinjen aldrig nämnde.

Testad: 2026-07-15 · Claude Code 2.x (agent harness)

Installation

git clone https://github.com/ContextJet-ai/awesome-llm-observability
mkdir -p ~/.claude/skills
cp -r awesome-llm-observability/skills/add-llm-evals ~/.claude/skills/add-llm-evals

Kommandon och exempelprompter

  • /add-llm-evalsPlaybook för att koppla referensbaserade + LLM-som-domare evals till CI, med domarkalibreringssteg och namngivna anti-mönster.

Skills triggas av vanliga förfrågningar — inga kommandon att memorera. Efter installationen aktiverar prompter som dessa skillen (på engelska):

  • Help me add evals to my RAG chatbot to catch regressions in CI
  • Is my LLM app actually accurate? I want to test it before shipping
  • How do I catch prompt regressions before they hit production?