Cultivar
CLI som måler om en agents ferdighet faktisk slår en baseline uten ferdigheter
Krever oppsett
Hva den gjør
Driver cultivar CLI for å evaluere om en agents ferdighet forbedrer atferd: stillaser oppgaver, kjører hver med-ferdighet, uten-ferdighet, og med-dokumenter på tvers av Claude/Copilot/Gemini lokalt eller i Modal sandkasser, deretter scorer en LLM-grader kjøringer mot en rubrikk. Utløses når en bruker ønsker å opprette, kjøre eller tolke cultivar ferdighetsevalueringer.
Testrapport
Installerte CLI-en med uv og dens pakkede 'cultivar hello' smoke-oppgave kjørte ende-til-ende mot den virkelige Claude-runneren, og skrev JSON, Markdown og JSONL-spor per kjøring pluss en arbeidsmappe nøyaktig som dokumentert. Selve selen er solid, men det faktiske utbyttet (en gradert med-ferdighet vs uten-ferdighet sammenligning) krever en autentisert agent CLI pluss en ANTHROPIC_API_KEY for graderen; her returnerte runneren en 401 og gradering ble hoppet over, så hoveddeltaet forblir umålt. Ferdigheten er en trofast, nøyaktig kommandoreferanse over et genuint fungerende verktøy. Reell oppsettfriksjon, en betalt nøkkel pluss en pålogget runner, ligger mellom installasjon og ethvert resultat.
Testet på: 2026-07-18 · Claude Code 2.x (agent harness)
Installer
git clone https://github.com/pinecone-io/cultivar mkdir -p ~/.claude/skills cd cultivar && cp -r skills/cultivar ~/.claude/skills/cultivar
Kommandoer og eksempelprompter
/cultivarCLI som måler om en agents ferdighet faktisk slår en baseline uten ferdigheter
Skills utløses av vanlige forespørsler — ingen kommandoer å huske. Etter installasjonen aktiverer prompter som disse skillen (på engelsk):
Does this skill I wrote actually help, can you eval it properly?Run this skill with and without it enabled, then grade the results.Help me interpret these eval results comparing skill performance.