Cultivar
CLI qui mesure si une compétence d'agent surpasse réellement une base sans compétence
Fonctionne avec configuration
Ce que fait
Pilote la CLI cultivar pour évaluer si une compétence d'agent améliore le comportement : échafaude les tâches, exécute chacune avec compétence, sans compétence et avec documentation sur Claude/Copilot/Gemini localement ou dans des sandboxes Modal, puis un évaluateur LLM note les exécutions par rapport à une grille. Se déclenche lorsqu'un utilisateur souhaite créer, exécuter ou interpréter des évaluations de compétences cultivar.
Rapport de test
J'ai installé la CLI avec uv et sa tâche de fumée 'cultivar hello' empaquetée a fonctionné de bout en bout contre le vrai runner Claude, écrivant des traces JSON, Markdown et JSONL par exécution plus un workdir exactement comme documenté. Le harnais lui-même est solide, mais le véritable bénéfice (une comparaison notée avec/sans compétence) nécessite une CLI d'agent authentifiée plus une ANTHROPIC_API_KEY pour l'évaluateur ; ici, le runner a renvoyé une 401 et l'évaluation a été ignorée, donc le delta principal reste non mesuré. La compétence est une référence de commande fidèle et précise pour un outil réellement fonctionnel. Une réelle friction de configuration, une clé payante plus un runner connecté, se situe entre l'installation et tout résultat.
Testé le: 2026-07-18 · Claude Code 2.x (agent harness)
Installation
git clone https://github.com/pinecone-io/cultivar mkdir -p ~/.claude/skills cd cultivar && cp -r skills/cultivar ~/.claude/skills/cultivar
Commandes et exemples de prompts
/cultivarCLI qui mesure si une compétence d'agent surpasse réellement une base sans compétence
Les skills se déclenchent sur des demandes en langage courant — aucune commande à retenir. Après installation, des prompts comme ceux-ci l'activent (en anglais) :
Does this skill I wrote actually help, can you eval it properly?Run this skill with and without it enabled, then grade the results.Help me interpret these eval results comparing skill performance.