Cultivar
CLI, który mierzy, czy umiejętność agenta faktycznie przewyższa linię bazową bez umiejętności
Działa po konfiguracji
Co robi ten skill
Steruje CLI cultivar w celu oceny, czy umiejętność agenta poprawia zachowanie: tworzy szkielet zadań, uruchamia każde z umiejętnością, bez umiejętności i z dokumentacją w Claude/Copilot/Gemini lokalnie lub w piaskownicach Modal, a następnie ocenia przebiegi LLM w oparciu o rubrykę. Uruchamia się, gdy użytkownik chce stworzyć, uruchomić lub zinterpretować oceny umiejętności cultivar.
Raport z testu
Zainstalowano CLI za pomocą uv, a jego spakowane zadanie 'cultivar hello' uruchomiło się od początku do końca na prawdziwym runnerze Claude, zapisując ślady JSON, Markdown i JSONL dla każdego uruchomienia oraz katalog roboczy dokładnie tak, jak udokumentowano. Sama uprząż jest solidna, ale rzeczywista korzyść (porównanie z umiejętnością vs bez umiejętności) wymaga autoryzowanego CLI agenta plus ANTHROPIC_API_KEY dla oceniającego; tutaj runner zwrócił 401, a ocena została pominięta, więc główna różnica pozostaje niezmierzone. Umiejętność jest wiernym, dokładnym odniesieniem do poleceń dla prawdziwie działającego narzędzia. Prawdziwe tarcia związane z konfiguracją, płatny klucz plus zalogowany runner, stoją między instalacją a jakimkolwiek wynikiem.
Testowano: 2026-07-18 · Claude Code 2.x (agent harness)
Instalacja
git clone https://github.com/pinecone-io/cultivar mkdir -p ~/.claude/skills cd cultivar && cp -r skills/cultivar ~/.claude/skills/cultivar
Komendy i przykładowe prompty
/cultivarCLI, który mierzy, czy umiejętność agenta faktycznie przewyższa linię bazową bez umiejętności
Skille uruchamiają się na zwykłe polecenia — bez komend do zapamiętania. Po instalacji aktywują go prompty takie jak te (po angielsku):
Does this skill I wrote actually help, can you eval it properly?Run this skill with and without it enabled, then grade the results.Help me interpret these eval results comparing skill performance.