Token-discipline: poctivý benchmark skilu pro Claude Code

Token-discipline: poctivý benchmark skilu pro Claude Code

Trávíme dny měřením cizích Claude skillů a v telemetrii se pořád opakoval jeden vzorec: sezení nezdražovaly dlouhé odpovědi Clauda. Zdražovalo je to, co Claude četl. Celé soubory otevřené kvůli jedné funkci. Soubory znovu načtené hned po úspěšné úpravě, „jen pro jistotu". JSON o 16 000 záznamech vtažený do kontextu, jako by šlo o blogový příspěvek.

Tak jsme postavili skill, který jde po téhle straně účtu, vydali ho pod licencí MIT a udělali to, co žádáme od každého skilu v katalogu: otestovali jsme ho proti baseline v kontrolovaných bězích a zveřejnili čísla — i ta, která mu nelichotí.

Skill se jmenuje token-discipline. Je zdarma: github.com/Skillproofdev/token-discipline.

Mezera ve všech token skillech, které jsme prošli

Než jsme napsali první řádek, prošli jsme osm publikovaných skillů a protokolů na šetření tokenů — od pravidel pro stručnost výstupu s 5 800 hvězdami, které v této nice dominují, přes „nouzové" skilly spouštějící se při 40 % kontextu, až po protokoly slibující úsporu 76–93 % bez jakéhokoli mechanismu a bez telemetrie, kterou bychom dohledali.

Skoro všechny mají stejné slepé místo: optimalizují výstup. Zabít preambuli, zkrátit odpovědi, přestat opakovat plán. To je reálný efekt, ale je to menší polovina účtu. V agentních sezeních — kdy Claude Code dělá skutečnou práci v repozitáři — dominuje vstup: každé přečtení souboru, každý výsledek hledání, každý výstup nástroje přistane v kontextu a znovu se odešle s každým dalším požadavkem.

Tři techniky na straně vstupu se jako vynutitelná pravidla neobjevily v žádném z těch osmi:

  1. Nejdřív hledej, pak čti. Nejdřív najdi pomocí grep/glob, pak přečti jen odpovídající úsek. Nikdy neotvírej celý soubor kvůli hledání.
  2. Slučuj nezávislá volání nástrojů. Pokud na sobě tři čtení nezávisí, patří do jedné zprávy. Každý tah navíc znovu platí tokeny za přemýšlení a komentář mezi voláními.
  3. Věř stavu, který už máš. Po vlastní úspěšné úpravě soubor znovu nečti kvůli ověření — nástroj pro úpravy při selhání hlasitě nahlásí chybu. Opakované čtení je na externí změny, ne na ty vlastní.

Tyhle tři se staly jádrem skilu. Kolem nich stojí dalších šest pravidel: číst výřezy místo celých souborů, dotazovat velké JSONy/logy pomocí python nebo jq místo jejich otevírání, dlouhé výstupy shrnout a zahodit, širokou exploraci delegovat na subagenty, udržovat kontext přátelský ke keši (stabilní prefix nedotčený — vlastní inženýrský blog Anthropicu označuje prompt caching za jednotlivě nejvýnosnější nákladový faktor), a ano, i stručný výstup. Devět pravidel, každé formulované jako tvrdé pravidlo s uvedenou alternativou, takže jeho dodržování nikdy nestojí přesnost.

Jak jsme to benchmarkovali

Stejný protokol jako u naší série Skill Bench: stejný model, stejný prompt, jedna proměnná. Každá úloha běžela dvakrát — jeden agent Claude Sonnet bez skilu, druhý, který si nejdřív přečetl SKILL.md a měl instrukci ho striktně dodržovat. Součty agenta se skilem zahrnují i náklad na přečtení samotného skilu. Testovacím prostředím byl náš vlastní codebase: Astro web s asi 9 000 řádky šablon plus JSON datová sada o 16 682 záznamech — dost velká na to, aby nekázeň při čtení skutečně bolela.

Pět dvojic úloh, vybraných tak, aby pokryly spektrum od triviálních po opravdu víckrokové:

Úloha Baseline Se skilem Δ
Q&A nad codebase — 8 otázek napříč subsystémy 88 419 71 636 −19,0 %
Úprava více souborů — 4 koordinované změny 68 219 54 637 −19,9 %
Trasování kódu — jednorázová úloha 53 986 52 850 −2,1 %
Sweep auditu — jednorázová úloha 44 691 44 705 +0,0 %
Digest velkého JSONu — jednorázová úloha 42 726 45 164 +5,7 %

Co čísla doopravdy říkají

Na skutečné víckrokové práci skill ušetří zhruba 20 %. Osmiotázkové Q&A nad codebase je nejblíž běžnému pracovnímu sezení — vysledovat auth flow, vysvětlit webhook, najít logiku řazení. Baseline agent odpověděl správně, ale cestou četl velkoryse a zbytečně redundantně ověřoval. Disciplinovaný agent odpověděl na stejné otázky se stejnou přesností (ověřili jsme každý odkaz file:line u obou) za 16 783 tokenů méně.

Zajímavější výsledek je úprava více souborů. Čtyři koordinované změny napříč čtyřmi soubory. Baseline agent dokončil práci a pak — cituji jeho vlastní hlášení — „ověřil opětovným přečtením upravených úseků". Sám tenhle zvyk je pětina účtu. Agent se skilem provedl stejné čtyři změny, přeskočil rituální opakovaná čtení a nahlásil hotovo. Porovnali jsme diff obou pracovních stromů: úpravy byly v obou případech ekvivalentní a správné. Spolehnutím se na to, že nástroj při selhání nahlásí chybu, se nic neztratilo, protože přesně to nástroje dělají.

Na triviálních jednorázových úlohách je to remíza — a i to zveřejňujeme. Úloha s digestem JSONu stála se skilem ve skutečnosti o 5,7 % víc. Dva důvody, oba poučné. Zaprvé, přečtení samotného skilu stojí asi 1 400 tokenů a úloha dokončená na dvě volání nástroje nemá kde tuhle režii rozpustit. Zadruhé, model současné generace se na jednoduchých úlohách chová dobře i sám od sebe: baseline agent mrkl na JSON o 16 682 záznamech a sáhl po python místo jeho otevření. Skill nebyl potřeba. Kázeň se vyplácí tam, kde je nekázeň možná — dlouhá sezení, mnoho souborů, narůstající kontext — ne tam, kde není co plýtvat.

Pokud jsou vaše sezení většinou jednořádková, skill má vlastní odpověď: destilovaný blok o 60 tokenech, který vložíte do CLAUDE.md místo instalace celého skilu. Běží pořád, stojí zhruba jako tahle věta, a jediné vyhnuté čtení celého souboru se vám vrátí mnohonásobně. (Postavili jsme kalkulačku přesně na tuhle always-on daň — matematika u popisů spouštěčů platí i pro bloky pravidel.)

SKILLPROOF PACK

token-discipline se pojí s Optimizer Pack: osekaná šablona CLAUDE.md, checklist pro audit MCP a čtyři skilly na efektivitu, předkonfigurované. Strukturální opravy z našeho návodu na náklady na tokeny, jeden příkaz místo večera.

Získat Optimizer Pack — 10 $

Devět pravidel ve zkratce

Celý SKILL.md má ~1 400 tokenů a přečtete ho na jednu obrazovku; tady je jeho tvar:

  1. Nejdřív hledej, pak čti. Nejdřív grep; pak přečti nález ±30 řádků. Čtení víc než ~200 řádků vyžaduje důvod, který zformulujete jednou větou.
  2. Čti výřez, ne soubor. Offset+limit pro cokoli dlouhého; python/jq pro cokoli strukturovaného. Velký JSON je databáze, ne dokument.
  3. Slučuj nezávislá volání nástrojů. Jedna zpráva, víc volání, kdykoli výstupy nekrmí vstupy.
  4. Věř stavu, který už máš. Žádná ověřovací opakovaná čtení po vlastních úpravách; žádné opakované spouštění hledání, jehož výsledky už jsou v kontextu.
  5. Necituj kód zpátky. Odkazuj na file:line. Vlož jen to, co člověk musí vidět, aby se rozhodl.
  6. Shrň a zahoď. Po dlouhém výstupu nástroje si ponech 2–5 faktů, log si nikdy nevyžádej znovu.
  7. Deleguj náročnou exploraci. Široké sweepy patří subagentovi; náročná čtení umřou v jeho kontextu, ne ve vašem.
  8. Udržuj kontext přátelský ke keši. Stabilní prefix nedotčený; přidávej, nepřepisuj; hlídej si TTL keše.
  9. Kázeň výstupu. Nejdřív odpověď, žádná preambule, žádné esejistické diffy.

Plus kontrolní bod sebeauditu (tři otázky před jakýmkoli velkým opakovaným čtením) a explicitní seznam co nedělat, protože token skill, který agenta donutí přeskočit nutné ověření, nic nešetří — jen odkládá práci navíc. Pokud skutečný lov na bug potřebuje celý soubor, pravidlo říká ho přečíst, s uvedeným důvodem.

Kam to zapadá do většího obrázku nákladů

Pravidla jako tahle jsou proměnná polovina vašeho účtu. Fixní polovina — preambule o 30 000 tokenech z MCP serverů, nafouklé soubory CLAUDE.md a always-on popisy skilů, které se doslova znovu odesílají s každým požadavkem — je jiný problém s jinými opravami a obvykle větší výhrou pro náročné uživatele. Ten audit jsme sepsali v Jak snížit náklady na tokeny v Claude Code; obě části se doplňují: fixní náklady opravte jednou, pak nechte token-discipline držet proměnné náklady ploché celé sezení.

A pokud vás zajímá, jestli skilly obecně šetří tokeny: naše série Skill Bench změřila čtyři populární skilly a zjistila, že většinou nešetří — stojí extra tokeny a kupují místo toho kvalitu a kázeň. token-discipline byl postavený přesně jako výjimka, a i tak si vydělá na sebe jen u víckrokové práce. To je poctivá hranice a radši ji nakreslíme sami, než abyste ji našli na svém účtu.

Instalace

git clone https://github.com/Skillproofdev/token-discipline ~/.claude/skills/token-discipline

Restartujte Claude Code. Spouští se na fráze jako „snížit spotřebu tokenů", „pracovat token-efektivně", stížnosti na limit kontextu a otázky ohledně nákladů — nebo ho aplikujte na celé sezení pomocí bloku CLAUDE.md uvnitř.

FREE STARTER PACK

Chcete naše nejlépe hodnocené skilly plus instalační checklist, který procházíme před každým testem? Pošleme vám free starter pack e-mailem.

Získat free starter pack

FAQ

Nahrazuje to skilly na stručnost výstupu? Ne — obsahuje jejich jádro (pravidlo 9) a přidává stranu vstupu, kterou vynechávají. Pokud už používáte sadu pravidel na stručný výstup, token-discipline se s ní překrývá v jednom pravidle z devíti.

Udělá to Clauda ledabylejším? Benchmark říká ne: úprava více souborů vyšla na obou stranách ekvivalentní a správná a seznam „co nedělat" v skilu explicitně chrání ověření, které je skutečně nutné. Pravidla nahrazují rituální čtení, ne to nezbytné.

Proč je samotný skill tak krátký? Protože skill na šetření tokenů, jehož načtení stojí tisíce tokenů za sezení, by byl sebeparodie. SKILL.md má ~1 400 tokenů načítaných na vyžádání; always-on blok v CLAUDE.md má ~60.

Mám předplatné Pro/Max, ne API. Záleží na tom? Ano, jen v jiné měně: stejné tokeny, které se účtují uživatelům API, spotřebovávají vaše limity používání. O dvacet procent méně tokenů na pracovních sezeních znamená proporčně víc práce, než narazíte na strop.

Byl benchmark vybíraný na efekt? Pět úloh bylo navržených dřív, než běžela jakákoli varianta, a zveřejnili jsme i oba výsledky, kde skill prohrál. Syrová telemetrie — počty tokenů a volání nástrojů za běh — je v README repozitáře.

★ 9.6/10 × 3

Startovací balíček zdarma

3 skills s nejvyšším skóre z našich testů plus instalační checklist — sestava, kterou bychom nasadili na čistý stroj. Zdarma, e-mailem.

Jeden e-mail s balíčkem + krátký týdenní přehled nových výsledků testů. Odhlásit se můžete kdykoli.