Cultivar
CLI che misura se una skill di agente batte effettivamente una baseline senza skill
Richiede configurazione
Cosa fa
Guida la CLI cultivar per valutare se una skill di agente migliora il comportamento: struttura i compiti, esegue ciascuno con-skill, senza-skill e con-docs attraverso Claude/Copilot/Gemini localmente o in sandbox Modal, quindi un LLM grader valuta le esecuzioni rispetto a una rubrica. Si attiva quando un utente vuole creare, eseguire o interpretare valutazioni di skill cultivar.
Rapporto di test
Installata la CLI con uv e il suo compito 'cultivar hello' incluso è stato eseguito end-to-end contro il vero runner Claude, scrivendo tracce JSON, Markdown e JSONL per ogni esecuzione più una workdir esattamente come documentato. L'harness stesso è solido, ma il vero beneficio (un confronto valutato con-skill vs senza-skill) richiede una CLI agente autenticata più una ANTHROPIC_API_KEY per il grader; qui il runner ha restituito un 401 e la valutazione è stata saltata, quindi il delta principale rimane non misurato. La skill è un riferimento fedele e accurato a un comando su uno strumento genuinamente funzionante. Una reale frizione di configurazione, una chiave a pagamento più un runner loggato, si frappone tra l'installazione e qualsiasi risultato.
Testato il: 2026-07-18 · Claude Code 2.x (agent harness)
Installazione
git clone https://github.com/pinecone-io/cultivar mkdir -p ~/.claude/skills cd cultivar && cp -r skills/cultivar ~/.claude/skills/cultivar
Comandi e prompt di esempio
/cultivarCLI che misura se una skill di agente batte effettivamente una baseline senza skill
Gli skill si attivano con richieste in linguaggio naturale, senza comandi da ricordare. Dopo l'installazione, prompt come questi lo attivano (in inglese):
Does this skill I wrote actually help, can you eval it properly?Run this skill with and without it enabled, then grade the results.Help me interpret these eval results comparing skill performance.