Cultivar

CLI qui mesure si une compétence d'agent surpasse réellement une base sans compétence

par pinecone-io · pinecone-io/cultivar

Fonctionne avec configuration ★ 8.0/10

Cultivar — CLI qui mesure si une compétence d'agent surpasse réellement une base sans compétence

Ce que fait

Pilote la CLI cultivar pour évaluer si une compétence d'agent améliore le comportement : échafaude les tâches, exécute chacune avec compétence, sans compétence et avec documentation sur Claude/Copilot/Gemini localement ou dans des sandboxes Modal, puis un évaluateur LLM note les exécutions par rapport à une grille. Se déclenche lorsqu'un utilisateur souhaite créer, exécuter ou interpréter des évaluations de compétences cultivar.

Rapport de test

J'ai installé la CLI avec uv et sa tâche de fumée 'cultivar hello' empaquetée a fonctionné de bout en bout contre le vrai runner Claude, écrivant des traces JSON, Markdown et JSONL par exécution plus un workdir exactement comme documenté. Le harnais lui-même est solide, mais le véritable bénéfice (une comparaison notée avec/sans compétence) nécessite une CLI d'agent authentifiée plus une ANTHROPIC_API_KEY pour l'évaluateur ; ici, le runner a renvoyé une 401 et l'évaluation a été ignorée, donc le delta principal reste non mesuré. La compétence est une référence de commande fidèle et précise pour un outil réellement fonctionnel. Une réelle friction de configuration, une clé payante plus un runner connecté, se situe entre l'installation et tout résultat.

Testé le: 2026-07-18 · Claude Code 2.x (agent harness)

Installation

git clone https://github.com/pinecone-io/cultivar
mkdir -p ~/.claude/skills
cd cultivar && cp -r skills/cultivar ~/.claude/skills/cultivar

Commandes et exemples de prompts

  • /cultivarCLI qui mesure si une compétence d'agent surpasse réellement une base sans compétence

Les skills se déclenchent sur des demandes en langage courant — aucune commande à retenir. Après installation, des prompts comme ceux-ci l'activent (en anglais) :

  • Does this skill I wrote actually help, can you eval it properly?
  • Run this skill with and without it enabled, then grade the results.
  • Help me interpret these eval results comparing skill performance.