Cultivar
CLI, der måler, om en agent-skill faktisk slår en no-skill baseline
Virker med opsætning
Hvad det gør
Driver cultivar CLI'en til at evaluere, om en agent-skill forbedrer adfærd: stilladser opgaver, kører hver med-skill, uden-skill og med-docs på tværs af Claude/Copilot/Gemini lokalt eller i Modal sandboxes, hvorefter en LLM-grader scorer kørsler mod en rubrik. Udløses, når en bruger ønsker at oprette, køre eller fortolke cultivar skill evals.
Testrapport
Installerede CLI'en med uv og dens pakkede 'cultivar hello' smoke-opgave kørte ende-til-ende mod den ægte Claude runner, skrev per-run JSON, Markdown og JSONL traces plus en workdir præcis som dokumenteret. Harness'en i sig selv er solid, men det faktiske udbytte (en bedømt med-skill vs uden-skill sammenligning) kræver en autoriseret agent CLI plus en ANTHROPIC_API_KEY til graderen; her returnerede runneren en 401, og bedømmelsen blev sprunget over, så den overordnede delta forbliver umålt. Skill'en er en trofast, nøjagtig kommandoreference over et ægte fungerende værktøj. Reel opsætningsfriktion, en betalt nøgle plus en logget-ind runner, ligger mellem installation og ethvert resultat.
Testet: 2026-07-18 · Claude Code 2.x (agent harness)
Installation
git clone https://github.com/pinecone-io/cultivar mkdir -p ~/.claude/skills cd cultivar && cp -r skills/cultivar ~/.claude/skills/cultivar
Kommandoer og eksempelprompter
/cultivarCLI, der måler, om en agent-skill faktisk slår en no-skill baseline
Skills udløses af almindelige forespørgsler — ingen kommandoer at huske. Efter installationen aktiverer prompter som disse skillen (på engelsk):
Does this skill I wrote actually help, can you eval it properly?Run this skill with and without it enabled, then grade the results.Help me interpret these eval results comparing skill performance.