Cultivar

CLI che misura se una skill di agente batte effettivamente una baseline senza skill

di pinecone-io · pinecone-io/cultivar

Richiede configurazione ★ 8.0/10

Cultivar — CLI che misura se una skill di agente batte effettivamente una baseline senza skill

Cosa fa

Guida la CLI cultivar per valutare se una skill di agente migliora il comportamento: struttura i compiti, esegue ciascuno con-skill, senza-skill e con-docs attraverso Claude/Copilot/Gemini localmente o in sandbox Modal, quindi un LLM grader valuta le esecuzioni rispetto a una rubrica. Si attiva quando un utente vuole creare, eseguire o interpretare valutazioni di skill cultivar.

Rapporto di test

Installata la CLI con uv e il suo compito 'cultivar hello' incluso è stato eseguito end-to-end contro il vero runner Claude, scrivendo tracce JSON, Markdown e JSONL per ogni esecuzione più una workdir esattamente come documentato. L'harness stesso è solido, ma il vero beneficio (un confronto valutato con-skill vs senza-skill) richiede una CLI agente autenticata più una ANTHROPIC_API_KEY per il grader; qui il runner ha restituito un 401 e la valutazione è stata saltata, quindi il delta principale rimane non misurato. La skill è un riferimento fedele e accurato a un comando su uno strumento genuinamente funzionante. Una reale frizione di configurazione, una chiave a pagamento più un runner loggato, si frappone tra l'installazione e qualsiasi risultato.

Testato il: 2026-07-18 · Claude Code 2.x (agent harness)

Installazione

git clone https://github.com/pinecone-io/cultivar
mkdir -p ~/.claude/skills
cd cultivar && cp -r skills/cultivar ~/.claude/skills/cultivar

Comandi e prompt di esempio

  • /cultivarCLI che misura se una skill di agente batte effettivamente una baseline senza skill

Gli skill si attivano con richieste in linguaggio naturale, senza comandi da ricordare. Dopo l'installazione, prompt come questi lo attivano (in inglese):

  • Does this skill I wrote actually help, can you eval it properly?
  • Run this skill with and without it enabled, then grade the results.
  • Help me interpret these eval results comparing skill performance.