Cultivar

CLI, który mierzy, czy umiejętność agenta faktycznie przewyższa linię bazową bez umiejętności

Autor: pinecone-io · pinecone-io/cultivar

Działa po konfiguracji ★ 8.0/10

Cultivar — CLI, który mierzy, czy umiejętność agenta faktycznie przewyższa linię bazową bez umiejętności

Co robi ten skill

Steruje CLI cultivar w celu oceny, czy umiejętność agenta poprawia zachowanie: tworzy szkielet zadań, uruchamia każde z umiejętnością, bez umiejętności i z dokumentacją w Claude/Copilot/Gemini lokalnie lub w piaskownicach Modal, a następnie ocenia przebiegi LLM w oparciu o rubrykę. Uruchamia się, gdy użytkownik chce stworzyć, uruchomić lub zinterpretować oceny umiejętności cultivar.

Raport z testu

Zainstalowano CLI za pomocą uv, a jego spakowane zadanie 'cultivar hello' uruchomiło się od początku do końca na prawdziwym runnerze Claude, zapisując ślady JSON, Markdown i JSONL dla każdego uruchomienia oraz katalog roboczy dokładnie tak, jak udokumentowano. Sama uprząż jest solidna, ale rzeczywista korzyść (porównanie z umiejętnością vs bez umiejętności) wymaga autoryzowanego CLI agenta plus ANTHROPIC_API_KEY dla oceniającego; tutaj runner zwrócił 401, a ocena została pominięta, więc główna różnica pozostaje niezmierzone. Umiejętność jest wiernym, dokładnym odniesieniem do poleceń dla prawdziwie działającego narzędzia. Prawdziwe tarcia związane z konfiguracją, płatny klucz plus zalogowany runner, stoją między instalacją a jakimkolwiek wynikiem.

Testowano: 2026-07-18 · Claude Code 2.x (agent harness)

Instalacja

git clone https://github.com/pinecone-io/cultivar
mkdir -p ~/.claude/skills
cd cultivar && cp -r skills/cultivar ~/.claude/skills/cultivar

Komendy i przykładowe prompty

  • /cultivarCLI, który mierzy, czy umiejętność agenta faktycznie przewyższa linię bazową bez umiejętności

Skille uruchamiają się na zwykłe polecenia — bez komend do zapamiętania. Po instalacji aktywują go prompty takie jak te (po angielsku):

  • Does this skill I wrote actually help, can you eval it properly?
  • Run this skill with and without it enabled, then grade the results.
  • Help me interpret these eval results comparing skill performance.