Cultivar

CLI die meet of een agent skill daadwerkelijk een no-skill baseline verslaat

Door pinecone-io · pinecone-io/cultivar

Werkt met setup ★ 8.0/10

Cultivar — CLI die meet of een agent skill daadwerkelijk een no-skill baseline verslaat

Wat het doet

Stuurt de cultivar CLI aan om te evalueren of een agent skill gedrag verbetert: bouwt taken, voert elk uit met-skill, zonder-skill, en met-docs over Claude/Copilot/Gemini lokaal of in Modal sandboxes, waarna een LLM grader de runs scoort tegen een rubric. Activeert wanneer een gebruiker cultivar skill evals wil creëren, uitvoeren of interpreteren.

Testrapport

De CLI geïnstalleerd met uv en de meegeleverde 'cultivar hello' smoke taak werd end-to-end uitgevoerd tegen de echte Claude runner, waarbij per-run JSON, Markdown en JSONL traces plus een workdir precies zoals gedocumenteerd werden geschreven. De harness zelf is solide, maar de daadwerkelijke opbrengst (een beoordeelde met-skill versus zonder-skill vergelijking) vereist een geautoriseerde agent CLI plus een ANTHROPIC_API_KEY voor de grader; hier gaf de runner een 401 terug en werd de beoordeling overgeslagen, dus de headline delta blijft ongemeten. De skill is een getrouwe, accurate commandoreferentie over een echt werkend hulpmiddel. Echte setup-frictie, een betaalde sleutel plus een ingelogde runner, zit tussen installatie en enig resultaat.

Getest op: 2026-07-18 · Claude Code 2.x (agent harness)

Installatie

git clone https://github.com/pinecone-io/cultivar
mkdir -p ~/.claude/skills
cd cultivar && cp -r skills/cultivar ~/.claude/skills/cultivar

Commando's en voorbeeldprompts

  • /cultivarCLI die meet of een agent skill daadwerkelijk een no-skill baseline verslaat

Skills reageren op gewone verzoeken — geen commando's om te onthouden. Na installatie activeren prompts zoals deze de skill (in het Engels):

  • Does this skill I wrote actually help, can you eval it properly?
  • Run this skill with and without it enabled, then grade the results.
  • Help me interpret these eval results comparing skill performance.