Cultivar
CLI, die misst, ob ein Agenten-Skill tatsächlich eine Baseline ohne Skill übertrifft
Funktioniert mit Setup
Was es kann
Steuert die cultivar CLI, um zu bewerten, ob ein Agenten-Skill das Verhalten verbessert: Gerüstet Aufgaben, führt jede mit Skill, ohne Skill und mit Docs über Claude/Copilot/Gemini lokal oder in Modal-Sandboxes aus, dann bewertet ein LLM-Grader die Läufe anhand einer Rubrik. Wird ausgelöst, wenn ein Benutzer cultivar Skill-Evals erstellen, ausführen oder interpretieren möchte.
Testbericht
Die CLI wurde mit uv installiert und ihre gebündelte 'cultivar hello' Smoke-Aufgabe lief End-to-End gegen den echten Claude-Runner, wobei pro Lauf JSON, Markdown und JSONL-Traces sowie ein Arbeitsverzeichnis genau wie dokumentiert geschrieben wurden. Das Harness selbst ist solide, aber der eigentliche Nutzen – ein bewerteter Vergleich mit Skill vs. ohne Skill – benötigt eine authentifizierte Agenten-CLI plus einen ANTHROPIC_API_KEY für den Grader; hier gab der Runner einen 401 zurück und die Bewertung wurde übersprungen, sodass das Hauptdelta ungemessen bleibt. Der Skill ist eine getreue, genaue Befehlsreferenz über ein wirklich funktionierendes Tool. Echte Einrichtungsreibung, ein bezahlter Schlüssel plus ein eingeloggter Runner, liegt zwischen Installation und jedem Ergebnis.
Getestet am: 2026-07-18 · Claude Code 2.x (agent harness)
Installation
git clone https://github.com/pinecone-io/cultivar mkdir -p ~/.claude/skills cd cultivar && cp -r skills/cultivar ~/.claude/skills/cultivar
Befehle & Beispiel-Prompts
/cultivarCLI, die misst, ob ein Agenten-Skill tatsächlich eine Baseline ohne Skill übertrifft
Skills reagieren auf normale Anfragen — keine Slash-Befehle nötig. Nach der Installation aktivieren Prompts wie diese den Skill (auf Englisch):
Does this skill I wrote actually help, can you eval it properly?Run this skill with and without it enabled, then grade the results.Help me interpret these eval results comparing skill performance.