Cultivar

CLI que mide si una habilidad de agente realmente supera una línea base sin habilidad

Por pinecone-io · pinecone-io/cultivar

Funciona con configuración ★ 8.0/10

Cultivar — CLI que mide si una habilidad de agente realmente supera una línea base sin habilidad

Qué hace

Impulsa el CLI cultivar para evaluar si una habilidad de agente mejora el comportamiento: estructura tareas, ejecuta cada una con habilidad, sin habilidad y con documentación a través de Claude/Copilot/Gemini localmente o en sandboxes de Modal, luego un evaluador LLM califica las ejecuciones contra una rúbrica. Se activa cuando un usuario quiere crear, ejecutar o interpretar evaluaciones de habilidad cultivar.

Informe de la prueba

Se instaló el CLI con uv y su tarea de humo 'cultivar hello' empaquetada se ejecutó de principio a fin contra el corredor real de Claude, escribiendo trazas JSON, Markdown y JSONL por ejecución más un directorio de trabajo exactamente como se documentó. El arnés en sí es sólido, pero el beneficio real (una comparación calificada con-habilidad vs sin-habilidad) necesita un CLI de agente autenticado más una ANTHROPIC_API_KEY para el calificador; aquí el corredor devolvió un 401 y la calificación se omitió, por lo que la diferencia principal permanece sin medir. La habilidad es una referencia de comando fiel y precisa sobre una herramienta genuinamente funcional. La fricción real de configuración, una clave de pago más un corredor con sesión iniciada, se interpone entre la instalación y cualquier resultado.

Probado el: 2026-07-18 · Claude Code 2.x (agent harness)

Instalación

git clone https://github.com/pinecone-io/cultivar
mkdir -p ~/.claude/skills
cd cultivar && cp -r skills/cultivar ~/.claude/skills/cultivar

Comandos y prompts de ejemplo

  • /cultivarCLI que mide si una habilidad de agente realmente supera una línea base sin habilidad

Los skills se activan con peticiones en lenguaje natural, sin comandos que memorizar. Tras instalarlo, prompts como estos lo activan (en inglés):

  • Does this skill I wrote actually help, can you eval it properly?
  • Run this skill with and without it enabled, then grade the results.
  • Help me interpret these eval results comparing skill performance.