Cultivar

CLI, der måler, om en agent-skill faktisk slår en no-skill baseline

Af pinecone-io · pinecone-io/cultivar

Virker med opsætning ★ 8.0/10

Cultivar — CLI, der måler, om en agent-skill faktisk slår en no-skill baseline

Hvad det gør

Driver cultivar CLI'en til at evaluere, om en agent-skill forbedrer adfærd: stilladser opgaver, kører hver med-skill, uden-skill og med-docs på tværs af Claude/Copilot/Gemini lokalt eller i Modal sandboxes, hvorefter en LLM-grader scorer kørsler mod en rubrik. Udløses, når en bruger ønsker at oprette, køre eller fortolke cultivar skill evals.

Testrapport

Installerede CLI'en med uv og dens pakkede 'cultivar hello' smoke-opgave kørte ende-til-ende mod den ægte Claude runner, skrev per-run JSON, Markdown og JSONL traces plus en workdir præcis som dokumenteret. Harness'en i sig selv er solid, men det faktiske udbytte (en bedømt med-skill vs uden-skill sammenligning) kræver en autoriseret agent CLI plus en ANTHROPIC_API_KEY til graderen; her returnerede runneren en 401, og bedømmelsen blev sprunget over, så den overordnede delta forbliver umålt. Skill'en er en trofast, nøjagtig kommandoreference over et ægte fungerende værktøj. Reel opsætningsfriktion, en betalt nøgle plus en logget-ind runner, ligger mellem installation og ethvert resultat.

Testet: 2026-07-18 · Claude Code 2.x (agent harness)

Installation

git clone https://github.com/pinecone-io/cultivar
mkdir -p ~/.claude/skills
cd cultivar && cp -r skills/cultivar ~/.claude/skills/cultivar

Kommandoer og eksempelprompter

  • /cultivarCLI, der måler, om en agent-skill faktisk slår en no-skill baseline

Skills udløses af almindelige forespørgsler — ingen kommandoer at huske. Efter installationen aktiverer prompter som disse skillen (på engelsk):

  • Does this skill I wrote actually help, can you eval it properly?
  • Run this skill with and without it enabled, then grade the results.
  • Help me interpret these eval results comparing skill performance.