
Snižte spotřebu tokenů v Claude: 6 oprav, které šetří
Nikdo si nedělá rozpočet na tokeny. Pak přijde náročný měsíc, faktura se zdvojnásobí a najednou je každý v týmu expert na kontextová okna. Auditovali jsme dost nastavení Claude Code na to, abychom znali ten vzorec: účet málokdy žene práce, o kterou jste požádali. Žene ho všechno, co jede s ní.
Tento návod je playbook, který sami používáme. Opravy jsou seřazené podle dopadu, což znamená, že nudné strukturální přijdou první a ta zábavná (routing modelů) poslední, protože peníze jsou právě tam. Ceny níže jsou API sazby k polovině roku 2026: zhruba 3 $ za milion vstupních tokenů na Sonnetu, 5 $ na Opusu, 1 $ na Haiku, přičemž výstupní tokeny stojí asi pětkrát víc. Pokud máte předplatné Pro nebo Max, platíte v rate limitech místo v dolarech, ale každá oprava tady vám kupuje totéž: víc práce za sezení, než narazíte na zeď.
Kam tokeny doopravdy mizí
Každý požadavek, který Claude Code pošle na API, nese celé vaše dosavadní sezení plus fixní preambuli: systémový prompt, váš CLAUDE.md, popis každého nainstalovaného skilu a kompletní schéma každého nástroje z každého připojeného MCP serveru. Tato preambule se účtuje při každém jednotlivém tahu, ať už z ní tah něco použije, nebo ne.
Ve vyzrálém setupu se to rychle sčítá. Čtyři největší žrouti, které vídáme, v pořadí:
První je opakované čtení kontextu. Agent, který včera přečetl váš konfigurační soubor o 2 000 řádcích, ho dnes čte znovu, protože sezení si nic nepamatují. Vynásobte to každým souborem, který „jen pro jistotu zkontroluje", a znovuobjevování se stane položkou na faktuře.
Druhý jsou schémata nástrojů MCP. Každý server, který jste připojili, vkládá definice svých nástrojů do každého požadavku. Ne při použití nástroje. Vždy. Pět serverů může znamenat 15 000 až 25 000 tokenů schémat sedících před vaší skutečnou otázkou, celý den, každý den.
Třetí je nafouklý CLAUDE.md. Paměťový soubor o 3 000 řádcích je zhruba 30 000 tokenů zdaněných na každém požadavku v každém sezení, navždy. Většina těch řádků se týká tak jednoho sezení z deseti.
Čtvrtý je opakované vysvětlování. „Používej conventional commits. Nesahej na legacy složku. Preferujeme pnpm." Pokud své preference píšete do chatu každé ráno, platíte za výuku stejné lekce denně — a lekce pak jede v historii sezení pro každý další tah.
Prompt caching to všechno zmírňuje. Opakovaný stabilní kontext se účtuje asi za desetinu běžné vstupní ceny. Ale zápisy do cache stojí přirážku, kešovaný obsah pořád zabírá vaše kontextové okno a jediný změněný bajt poblíž začátku promptu zneplatní všechno za ním. Kešování je sleva, ne řešení.
Měřte, než začnete optimalizovat
Hádání, kde se tokeny plýtvají, je plýtvání samo o sobě. Deset minut měření vám řekne, která ze šesti oprav níže je pro váš setup skutečně důležitá.
Uvnitř Claude Code ukáže /cost, kolik aktuální sezení utratilo, a /context ukáže, co právě teď okupuje okno, rozdělené podle systémového promptu, nástrojů, paměťových souborů a zpráv. Ten druhý je upřímné zrcadlo: pokud schémata nástrojů a CLAUDE.md zaberou 40 000 tokenů dřív, než cokoli napíšete, našli jste svůj problém.
Pro historii komunitní nástroj ccusage čte soubory přepisů, které si Claude Code už ukládá na disk, a dá vám rozpady po dnech a po modelech. Uživatelé API vidí totéž na stránce spotřeby v Anthropic Console, rozdělené po klíčích. A pokud chcete vědět, kolik stojí konkrétní soubor, endpoint API count_tokens dá přesné číslo; prohnat jím svůj CLAUDE.md je vystřízlivujících třicet vteřin.
Před jakoukoli změnou si udělejte baseline týden. Každé tvrzení o našich vlastních číslech níže vzniklo přesně takhle a skill Token Budget Auditor existuje, aby celé cvičení zautomatizoval (víc v opravě 6).
Oprava 1: nahraďte opakované prompty skilly
Pro většinu lidí je to změna s nejvyšší pákou a funguje díky jednomu designovému rozhodnutí: progresivnímu odkrývání. Kompletní instrukce skilu se načtou, jen když se skill spustí. Jediný náklad, který platíte při každém požadavku, je jeho spouštěcí popis, obvykle 30 až 60 tokenů. Pokud je pro vás formát nový, náš výklad o Claude skillech pokrývá mechaniku.
Spočítejte si prompt, který vkládáte denně. Řekněme 2 000 slov, asi 2 600 tokenů: pravidla stylu kódu, checklist na review, cokoli, co držíte v poznámce a každé ráno vkládáte. Jednou vložený sedí v historii sezení a přeposílá se při každém tahu. Při 30 tazích za sezení ten jeden blok vygeneruje zhruba 78 000 vstupních tokenů za sezení. Za 22 pracovních dní asi 1,7 milionu tokenů měsíčně. Na Sonnetu je to kolem 5 $ bez cache, řekněme 1 až 2 $ se slušnými cache hity.
Jako skill stojí tentýž obsah svůj popis o 50 tokenech na tah, asi 33 000 tokenů měsíčně, plus celé tělo o 2 600 tokenech jen v sezeních, kde se skutečně spustí. Počítejte s redukcí o 95 až 98 procent pro daný blok.
Pět dolarů měsíčně zní jako nic, dokud si nevzpomenete na dvě věci. Nikdo nemá jeden vkládaný prompt; setupy, které auditujeme, jich mají pět až deset. A dolarová cena není ani ta hlavní škoda: ty tokeny okupují kontext, což tlačí dlouhá sezení dřív do kompakce, což spouští opakovaná čtení, která stojí víc než ten prompt. Převod vkládaných promptů na skilly je jediná změna s nejlepším poměrem úsilí/úspora, jaký známe.
Oprava 2: dejte CLAUDE.md na dietu
CLAUDE.md je stále zapnutý kontext. To je celá jeho hodnota i celý jeho náklad. Test pro každý řádek je jednoduchý: platí to pro většinu sezení v tomto projektu?
Do CLAUDE.md patří: build a testovací příkazy, struktura repozitáře, tři nezřejmá omezení, jejichž porušení věci rozbíjí, tvrdá pravidla jako „nikdy necommituj přímo do main". Typicky je to 30 až 60 řádků.
Nepatří tam: workflow instrukce pro úkoly, které děláte jednou týdně (to je skill), style guidy pro občasnou práci jako psaní dokumentace nebo migrace (skill), dlouhá vysvětlení architektury, kterou si Claude může přečíst z kódu, a cokoli, co jste tam zkopírovali, „aby to tam bylo, kdyby bylo potřeba". Pokud se sekce týká méně než poloviny vašich sezení, platí trvalý nájem za práci na částečný úvazek. Přesuňte ji do skilu a nestojí nic až do dne, kdy je relevantní.
Pořád vídáme soubory CLAUDE.md přes 2 000 řádků a jejich majitelé jsou obvykle překvapeni dvakrát: nejdřív počtem tokenů (prožeňte ho přes count_tokens), pak zjištěním, že osekání udělalo Clauda poslušnějším, ne méně. Instrukce soupeří o pozornost. Čtyřicet ostrých řádků porazí dva tisíce rozbředlých.
Oprava 3: prořežte MCP servery, které nepoužíváte
MCP servery jsou nejtišší žrout, protože náklad je v denním provozu neviditelný. Připojení serveru znamená, že se jeho schémata nástrojů serializují do každého požadavku. Typický server vystavuje 10 až 30 nástrojů po několika stech tokenech schématu; velké oficiální servery jsou horší. Když jsme měřili vlastní setup, jeden populární server sám o sobě přidával kolem 20 000 tokenů na požadavek — a ten měsíc jsme ho použili dvakrát.
Spusťte claude mcp list a buďte nemilosrdní. U každého serveru se zeptejte, kdy jste ho naposledy skutečně použili. Naše pravidlo po tomto cvičení na vlastních strojích: dva servery na projekt bohatě stačí a měly by být scopované na projekty, které je potřebují, místo globální konfigurace. Databázový server nemá co zdaňovat vaše sezení nad psaním blogu.
Zvažte také, jestli má každý zbývající server vůbec být serverem. Spousta MCP připojení existuje jen proto, aby obalila CLI, které by Claude mohl prostě spustit přes bash s nulovým fixním nákladem. Kompletní rozhodovací rámec jsme sepsali ve skilly vs MCP, ale krátká verze: MCP si svou daň ze schémat zaslouží, když potřebujete živý autentizovaný přístup k externímu systému. Pro instrukce, workflow a cokoli souborového odvede práci skill bez nájmu za každý požadavek.
Prořezávání je také vzácná oprava, která je okamžitá. Žádný refactoring, žádná migrace. Odeberte tři nečinné servery a hned váš další požadavek je o 30 000 tokenů lehčí.
SKILLPROOF PACK
Opravy 2 a 3 jsou přesně to, co balí Optimizer Pack: osekaná šablona CLAUDE.md, checklist pro audit MCP a čtyři skilly na efektivitu z tohoto návodu, předkonfigurované. Jeden příkaz místo večera nastavování.
Získat Optimizer Pack — 10 $Oprava 4: návyky, které drží kontext malý
Struktura opravuje fixní náklady. Návyky ty variabilní.
Začínejte nové sezení pro každý úkol. Jedno nesmrtelné sezení, které se toulá od opravy bugu přes refactoring k „a ještě aktualizuj README", táhne celý kontext opravy bugu do každého tahu nad README. Historie se přeposílá s každým požadavkem, takže tahy dlouhého sezení jsou postupně čím dál dražší. Když se změní téma, /clear nebo nové sezení je téměř vždy levnější než pokračovat — a kvalita výstupu se obvykle zlepší také, protože zvětralý kontext víc mate, než pomáhá.
Používejte /compact na přirozených hranicích, ne až v nouzi. Claude Code kompaktuje automaticky, když se okno zaplní, ale to už hodinu platíte plnou sazbu za nafouklou historii. Kompakce hned po milníku („testy prošly, teď další feature") zmenší historii, dokud sami řídíte, co stojí za uchování. Kompakce stojí jeden sumarizační průchod; vláčení mrtvé váhy stojí každý tah.
Ohraničujte své požadavky. „Najdi, kde validujeme e-maily, a oprav ten regex" pošle Clauda na grep výpravu tuctem souborů, z nichž každý se načte do kontextu a účtuje po zbytek sezení. Pokud víte, že je to v src/lib/validators.ts, řekněte to. Deset vteřin konkrétnosti běžně ušetří 50 000 tokenů průzkumu. Stejná logika platí pro čtení: ukázat Claudovi rozsah řádků je lepší, než ho nechat spolknout soubor o 2 000 řádcích kvůli 40 z nich.
Nic z toho nevyžaduje disciplínu nad rámec všímavosti. Sledujte /context jeden den a plýtvavé vzorce se identifikují samy.
Oprava 5: routujte levné podúkoly na levnější modely
Ano, routing modelů šetří peníze. Uvádíme ho pátý, protože v každém auditu, který jsme dělali, po něm týmy sahaly, zatímco nafouklý CLAUDE.md a šest nečinných MCP serverů pálily třikrát víc. Nejdřív struktura, pak routing.
Nicméně ta aritmetika je reálná: Haiku stojí pětinu Sonnetu a ještě pětinu Opusu. Čistý způsob, jak to v Claude Code využít, jsou subagenti. Průzkum, shrnutí dlouhého souboru, generování boilerplate testů, první verze commit zpráv: delegujte to na Haiku subagenta, zatímco hlavní smyčka zůstává na vašem primárním modelu. Vlastní architektura Claude Code to pro některé vyhledávací úkoly dělá interně, což vám říká, že Anthropic ten vzorec považuje za zdravý.
Co nedoporučujeme, je přepínat model hlavního sezení tam a zpět uprostřed úkolu. Prompt cache je per model, takže každé přepnutí zahodí váš kešovaný prefix a znovu zaplatí plnou cenu za jeho obnovu. Vyberte model na sezení; routujte na hranici subagenta. A těžké uvažování nechte na silném modelu. Levný model, který vyprodukuje špatný plán, stojí víc než drahý, který je správně napoprvé. To jsme bohužel také naměřili.
Oprava 6: skilly na tokenovou efektivitu, které testujeme
Vedeme samostatnou kategorii Token Efficiency a držíme ji na přísnějším standardu než kteroukoli jinou: verdikt tam musí přijít s naměřeným účtem před/po, ne s vibem. Verdikty jsou tak pomalejší. Tady je upřímný aktuální stav.
Token Budget Auditor čte vaše přepisy a setup a pojmenuje vaše největší tokenové hříšníky: nafouklý systémový kontext, redundantní čtení souborů, ukecané smyčky nástrojů. Je to krok „nejdřív měř" zabalený jako skill. Verdikt čeká; na vlastních účtech provádíme srovnání fakturace před/po, než ho oskórujeme.
Context Compression balí disciplínu shrň-a-pokračuj z opravy 4, takže dlouhá sezení kompaktují do strukturovaných shrnutí místo vláčení syrové historie. V testovací frontě; měříme úsporu tokenů proti ztrátě informací napříč týdnem reálných sezení, protože komprese, která zapomene vaše omezení, je horší než žádná komprese.
Prompt Cache Optimizer restrukturuje kontext pro přívětivost k cache: stabilní obsah první, proměnlivý poslední. Nejčastější plýtvání, na které cílí, je timestamp interpolovaný poblíž začátku promptu, který potichu zneplatňuje cache při každém požadavku. Oprava na jeden řádek, dvouciferné úspory, když se uplatní. Před vydáním verdiktu měříme živé cache-hit rate.
Jeden sousední skill, který testováním prošel, je Memory Management, který v našem týdenním testu získal 9,2/10. Žije v naší kategorii produktivity, ale v jádru je to tokenová hra: perzistentní paměť převádí opakované znovuobjevování (nejdražší režim selhání z opravy 4) na jeden zápis a levná vybavení. Claude, který si pamatuje rozhodnutí vašeho projektu, je Claude, který nečte znovu dvanáct souborů, aby je zrekonstruoval.
Kompletní seznam s poznámkami z testů a existujícími verdikty je na nejlepší skilly na efektivitu. Radši vám ukážeme frontu s běžícími měřeními než stránku sebevědomých skóre, která neumíme podložit.
Optimizer Pack, pokud chcete zkratku
Jeden upřímný odstavec o našem vlastním produktu. Optimizer Pack je efektivní setup, který bychom si nainstalovali na vlastní stroje: tři skilly na efektivitu výše plus Memory Management, předkonfigurované, s osekanou šablonou CLAUDE.md a checklistem pro audit MCP, nainstalované jedním příkazem. Stojí 10 $, hlavně protože balení a údržba konfigurací zabírá reálný čas. Všechno v něm je dostupné i zdarma z jednotlivých stránek skilů; balíček vám ušetří večer nastavování, nic víc. Pokud vás bastlení baví, přeskočte ho.
Realistické před a po
Tady je náčrt založený na kompozitu náročných uživatelů, které jsme auditovali: vývojář používající Claude Code čtyři a více hodin denně na Sonnetu přes API, s CLAUDE.md o 2 500 řádcích, pěti MCP servery a maratonskými sezeními.
Před: zhruba 140 milionů vstupních a 4 miliony výstupních tokenů měsíčně. S průměrným výkonem cache (CLAUDE.md měl dynamickou hlavičku, takže kešování sotva fungovalo) je to v okolí 480 $ měsíčně.
Po aplikaci oprav 1 až 5: prořezání tří MCP serverů a osekání CLAUDE.md na 60 řádků snížilo preambuli na požadavek o asi 45 000 tokenů. Převod sedmi vkládaných promptů na skilly odstranil další kus historie z každého tahu. Čerstvá sezení a dřívější kompakce zkrátily průměrnou délku historie o třetinu. Oprava zneplatňovače cache znamenala, že zbývající stabilní kontext se konečně účtoval kešovanou sazbou. Routing průzkumných subagentů na Haiku ušetřil zbytek. Nový účet: kolem 210 $ měsíčně.
To je 55procentní redukce s nulovou změnou v tom, co se postavilo. Vaše čísla se budou lišit a s podezřením bychom brali každého, kdo slibuje přesné procento, včetně nás. Ale zhruba poloviční účet náročného uživatele skrz samotnou strukturu odpovídá tomu, co jsme viděli víckrát než jednou. Vzorec platí i pro předplatná: tentýž člověk přestal uprostřed odpoledne narážet na limity plánu Max.
STARTOVACÍ BALÍČEK ZDARMA
Chcete tu měřenou cestu bez auditní práce? Pošleme vám e-mailem naše 3 nejlépe hodnocené skilly plus instalační checklist, který procházíme před každým testem. Zdarma.
Získat startovací balíček zdarmaFAQ
Záleží na tom vůbec, když mám předplatné Pro nebo Max místo API? Ano, jen v jiné měně. Předplatná vás měří přes limity spotřeby a ty limity spotřebovávají tytéž tokeny, které uživatel API platí. Štíhlejší setup znamená víc skutečné práce, než narazíte na strop. Uživatelé, kteří „pořád narážejí na limity", obvykle nesou 40 000 tokenů preambule na požadavek, aniž o tom vědí.
Stojí nainstalované skilly tokeny, i když se nepoužívají? Jen spouštěcí popis, typicky 30 až 60 tokenů na skill a požadavek. Tělo se načte, když se skill spustí. Dvacet nainstalovaných skilů stojí asi 1 000 tokenů fixní režie, a proto je velká knihovna skilů levná, zatímco velký CLAUDE.md ne. Jediný režim selhání jsou skilly s nafouklými popisy; ty v našich recenzích označujeme.
Kolik kontextu MCP server skutečně spotřebuje?
Divoce se to liší, a proto byste měli měřit ty svoje: spusťte /context s připojeným serverem a pak s odpojeným. Malé zaměřené servery přidávají 1 000 až 3 000 tokenů schémat. Velké oficiální mohou přidat 15 000 až 25 000. Náklad platí pro každý požadavek bez ohledu na to, jestli nějaký nástroj zavoláte.
Je /compact lepší než začít nové sezení?
Jiné úlohy. /compact je pro pokračování související práce: shrne historii, takže kontext pokračuje menší. Nové sezení je pro změnu tématu, a tehdy je to levnější i lepší volba, protože nesouvisející historie není jen drahá, aktivně degraduje výstup. Pokud kompaktujete, abyste pokračovali v něčem nesouvisejícím, chtěli jste /clear.
Neřeší to prompt caching automaticky? Hodně pomáhá a v Claude Code je zapnutý ve výchozím stavu, ale plýtvání zlevňuje, místo aby ho odstranil. Kešované tokeny se pořád účtují asi za 10 procent, pořád plní vaše kontextové okno a pořád vás tlačí k dřívější kompakci. A kešování se rozbíjí potichu: jakákoli změna stabilního prefixu, třeba timestamp ve vašem setupu, a jste zpátky na plné ceně bez varování. Strukturujte kontext dobře a kešování úspory znásobí; strukturujte ho špatně a kešování problém schová až do faktury.
★ 9.6/10 × 3
Startovací balíček zdarma
3 skills s nejvyšším skóre z našich testů plus instalační checklist — sestava, kterou bychom nasadili na čistý stroj. Zdarma, e-mailem.