Cultivar
CLI som mäter om en agents färdighet faktiskt överträffar en baslinje utan färdighet
Fungerar med konfiguration
Vad den gör
Driver cultivar CLI för att utvärdera om en agents färdighet förbättrar beteendet: stöder uppgifter, kör varje med-färdighet, utan-färdighet och med-dokumentation över Claude/Copilot/Gemini lokalt eller i Modal-sandlådor, sedan poängsätter en LLM-bedömare körningar mot en bedömningsmatris. Utlöses när en användare vill skapa, köra eller tolka cultivar-färdighetsutvärderingar.
Testrapport
Installerade CLI med uv och dess paketerade 'cultivar hello' smoke-uppgift kördes från början till slut mot den verkliga Claude-runnern, skrivande per-körning JSON, Markdown och JSONL-spår plus en arbetsmapp exakt som dokumenterat. Harnessen i sig är solid, men den verkliga utdelningen (en graderad med-färdighet vs utan-färdighet jämförelse) kräver en autentiserad agent CLI plus en ANTHROPIC_API_KEY för bedömaren; här returnerade runnern en 401 och gradering hoppades över, så den huvudsakliga skillnaden förblir omätt. Färdigheten är en trogen, korrekt kommandoreferens över ett genuint fungerande verktyg. Verklig installationsfriktion, en betald nyckel plus en inloggad runner, ligger mellan installation och eventuellt resultat.
Testad: 2026-07-18 · Claude Code 2.x (agent harness)
Installation
git clone https://github.com/pinecone-io/cultivar mkdir -p ~/.claude/skills cd cultivar && cp -r skills/cultivar ~/.claude/skills/cultivar
Kommandon och exempelprompter
/cultivarCLI som mäter om en agents färdighet faktiskt överträffar en baslinje utan färdighet
Skills triggas av vanliga förfrågningar — inga kommandon att memorera. Efter installationen aktiverar prompter som dessa skillen (på engelska):
Does this skill I wrote actually help, can you eval it properly?Run this skill with and without it enabled, then grade the results.Help me interpret these eval results comparing skill performance.