Add LLM Evals
Playbook för att koppla referensbaserade + LLM-som-domare evals till CI, med domarkalibreringssteg och namngivna anti-mönster.
Testad · Fungerar
Vad den gör
En metodik-skill (inga bundlade skript) för att lägga till utvärdering - inte bara spårning - till en LLM/agent-app: välj referensbaserad vs LLM-som-domare per metrik, kurera en 20-100 exempeldatamängd, koppla tröskel-gated kontroller till CI via promptfoo/DeepEval/Ragas, lägg sedan eventuellt till produktions LLM-som-domare poängsättning. Triggers på 'add evals', 'test my prompt', 'is my RAG accurate', eller att sätta upp en eval-svit i CI; skiljer sig explicit från spårning/observabilitets-förfrågningar.
Testrapport
På 'help me add evals to my RAG chatbot for CI', var det frihandssvarade baslinjesvaret fyra vaga punktlistor ('skriv några tester', 'överväg att använda en LLM för att betygsätta'); skill-körningen namngav den RAG-specifika Ragas-kvartetten, gav en körbar promptfoo-konfiguration med en CI-gating exit-kod, och lade till domarkalibreringssteget (hand-etikettera ~30 exempel, kontrollera överensstämmelse) som baslinjen aldrig nämnde.
Testad: 2026-07-15 · Claude Code 2.x (agent harness)
Installation
git clone https://github.com/ContextJet-ai/awesome-llm-observability mkdir -p ~/.claude/skills cp -r awesome-llm-observability/skills/add-llm-evals ~/.claude/skills/add-llm-evals
Kommandon och exempelprompter
/add-llm-evalsPlaybook för att koppla referensbaserade + LLM-som-domare evals till CI, med domarkalibreringssteg och namngivna anti-mönster.
Skills triggas av vanliga förfrågningar — inga kommandon att memorera. Efter installationen aktiverar prompter som dessa skillen (på engelska):
Help me add evals to my RAG chatbot to catch regressions in CIIs my LLM app actually accurate? I want to test it before shippingHow do I catch prompt regressions before they hit production?