Cultivar
CLI, které měří, zda dovednost agenta skutečně překonává základní linii bez dovedností
Funguje s nastavením
Co umí
Řídí CLI cultivar k vyhodnocení, zda dovednost agenta zlepšuje chování: připravuje úkoly, spouští každý s dovedností, bez dovednosti a s dokumentací napříč Claude/Copilot/Gemini lokálně nebo v Modal sandboxes, poté LLM hodnotitel boduje spuštění proti rubrice. Spouští se, když uživatel chce vytvořit, spustit nebo interpretovat hodnocení dovedností cultivar.
Testovací report
Nainstaloval jsem CLI s uv a jeho balený 'cultivar hello' smoke task běžel end-to-end proti skutečnému Claude runneru, zapisoval JSON, Markdown a JSONL stopy pro každé spuštění plus workdir přesně podle dokumentace. Samotný harness je solidní, ale skutečný přínos (hodnocené srovnání s dovedností vs. bez dovednosti) vyžaduje autorizované agent CLI plus ANTHROPIC_API_KEY pro hodnotitele; zde runner vrátil 401 a hodnocení bylo přeskočeno, takže hlavní rozdíl zůstal nezměřen. Dovednost je věrná a přesná reference příkazů pro skutečně fungující nástroj. Skutečné tření při nastavení, placený klíč plus přihlášený runner, stojí mezi instalací a jakýmkoli výsledkem.
Testováno: 2026-07-18 · Claude Code 2.x (agent harness)
Instalace
git clone https://github.com/pinecone-io/cultivar mkdir -p ~/.claude/skills cd cultivar && cp -r skills/cultivar ~/.claude/skills/cultivar
Příkazy a ukázkové prompty
/cultivarCLI, které měří, zda dovednost agenta skutečně překonává základní linii bez dovedností
Skilly se spouštějí běžnými požadavky — žádné příkazy k zapamatování. Po instalaci ho aktivují prompty jako tyto (anglicky):
Does this skill I wrote actually help, can you eval it properly?Run this skill with and without it enabled, then grade the results.Help me interpret these eval results comparing skill performance.