Add LLM Evals
Playbook for å koble referanse-baserte + LLM-som-dommer evals inn i CI, med dommer-kalibreringstrinn og navngitte anti-mønstre.
Bestått
Hva den gjør
En metodikk-skill (ingen bundne skript) for å legge til evaluering - ikke bare sporing - til en LLM/agent-app: velg referanse-basert vs LLM-som-dommer per metrikk, kurater et 20-100 eksempel datasett, koble terskel-gatede sjekker inn i CI via promptfoo/DeepEval/Ragas, deretter valgfritt legge til produksjons LLM-som-dommer scoring. Utløses på 'add evals', 'test my prompt', 'is my RAG accurate', eller sette opp en eval-suite i CI; skiller seg eksplisitt fra sporings-/observabilitetsforespørsler.
Testrapport
På 'help me add evals to my RAG chatbot for CI', var det uguidede basislinje-svaret fire vage kulepunkter ('skriv noen tester', 'vurder å bruke en LLM til å gradere'); skill-kjøringen navnga den RAG-spesifikke Ragas-kvartetten, ga en kjørbar promptfoo-konfigurasjon med en CI-gating exit-kode, og la til dommer-kalibreringstrinnet (hånd-merke ~30 eksempler, sjekk enighet) som basislinjen aldri nevnte.
Testet på: 2026-07-15 · Claude Code 2.x (agent harness)
Installer
git clone https://github.com/ContextJet-ai/awesome-llm-observability mkdir -p ~/.claude/skills cp -r awesome-llm-observability/skills/add-llm-evals ~/.claude/skills/add-llm-evals
Kommandoer og eksempelprompter
/add-llm-evalsPlaybook for å koble referanse-baserte + LLM-som-dommer evals inn i CI, med dommer-kalibreringstrinn og navngitte anti-mønstre.
Skills utløses av vanlige forespørsler — ingen kommandoer å huske. Etter installasjonen aktiverer prompter som disse skillen (på engelsk):
Help me add evals to my RAG chatbot to catch regressions in CIIs my LLM app actually accurate? I want to test it before shippingHow do I catch prompt regressions before they hit production?