Cultivar

CLI som mäter om en agents färdighet faktiskt överträffar en baslinje utan färdighet

av pinecone-io · pinecone-io/cultivar

Fungerar med konfiguration ★ 8.0/10

Cultivar — CLI som mäter om en agents färdighet faktiskt överträffar en baslinje utan färdighet

Vad den gör

Driver cultivar CLI för att utvärdera om en agents färdighet förbättrar beteendet: stöder uppgifter, kör varje med-färdighet, utan-färdighet och med-dokumentation över Claude/Copilot/Gemini lokalt eller i Modal-sandlådor, sedan poängsätter en LLM-bedömare körningar mot en bedömningsmatris. Utlöses när en användare vill skapa, köra eller tolka cultivar-färdighetsutvärderingar.

Testrapport

Installerade CLI med uv och dess paketerade 'cultivar hello' smoke-uppgift kördes från början till slut mot den verkliga Claude-runnern, skrivande per-körning JSON, Markdown och JSONL-spår plus en arbetsmapp exakt som dokumenterat. Harnessen i sig är solid, men den verkliga utdelningen (en graderad med-färdighet vs utan-färdighet jämförelse) kräver en autentiserad agent CLI plus en ANTHROPIC_API_KEY för bedömaren; här returnerade runnern en 401 och gradering hoppades över, så den huvudsakliga skillnaden förblir omätt. Färdigheten är en trogen, korrekt kommandoreferens över ett genuint fungerande verktyg. Verklig installationsfriktion, en betald nyckel plus en inloggad runner, ligger mellan installation och eventuellt resultat.

Testad: 2026-07-18 · Claude Code 2.x (agent harness)

Installation

git clone https://github.com/pinecone-io/cultivar
mkdir -p ~/.claude/skills
cd cultivar && cp -r skills/cultivar ~/.claude/skills/cultivar

Kommandon och exempelprompter

  • /cultivarCLI som mäter om en agents färdighet faktiskt överträffar en baslinje utan färdighet

Skills triggas av vanliga förfrågningar — inga kommandon att memorera. Efter installationen aktiverar prompter som dessa skillen (på engelska):

  • Does this skill I wrote actually help, can you eval it properly?
  • Run this skill with and without it enabled, then grade the results.
  • Help me interpret these eval results comparing skill performance.