Cultivar

CLI som måler om en agents ferdighet faktisk slår en baseline uten ferdigheter

av pinecone-io · pinecone-io/cultivar

Krever oppsett ★ 8.0/10

Cultivar — CLI som måler om en agents ferdighet faktisk slår en baseline uten ferdigheter

Hva den gjør

Driver cultivar CLI for å evaluere om en agents ferdighet forbedrer atferd: stillaser oppgaver, kjører hver med-ferdighet, uten-ferdighet, og med-dokumenter på tvers av Claude/Copilot/Gemini lokalt eller i Modal sandkasser, deretter scorer en LLM-grader kjøringer mot en rubrikk. Utløses når en bruker ønsker å opprette, kjøre eller tolke cultivar ferdighetsevalueringer.

Testrapport

Installerte CLI-en med uv og dens pakkede 'cultivar hello' smoke-oppgave kjørte ende-til-ende mot den virkelige Claude-runneren, og skrev JSON, Markdown og JSONL-spor per kjøring pluss en arbeidsmappe nøyaktig som dokumentert. Selve selen er solid, men det faktiske utbyttet (en gradert med-ferdighet vs uten-ferdighet sammenligning) krever en autentisert agent CLI pluss en ANTHROPIC_API_KEY for graderen; her returnerte runneren en 401 og gradering ble hoppet over, så hoveddeltaet forblir umålt. Ferdigheten er en trofast, nøyaktig kommandoreferanse over et genuint fungerende verktøy. Reell oppsettfriksjon, en betalt nøkkel pluss en pålogget runner, ligger mellom installasjon og ethvert resultat.

Testet på: 2026-07-18 · Claude Code 2.x (agent harness)

Installer

git clone https://github.com/pinecone-io/cultivar
mkdir -p ~/.claude/skills
cd cultivar && cp -r skills/cultivar ~/.claude/skills/cultivar

Kommandoer og eksempelprompter

  • /cultivarCLI som måler om en agents ferdighet faktisk slår en baseline uten ferdigheter

Skills utløses av vanlige forespørsler — ingen kommandoer å huske. Etter installasjonen aktiverer prompter som disse skillen (på engelsk):

  • Does this skill I wrote actually help, can you eval it properly?
  • Run this skill with and without it enabled, then grade the results.
  • Help me interpret these eval results comparing skill performance.