
Opravář promptů, který nejdřív diagnostikuje, pak přepíše
Vložte vadný prompt do skoro jakéhokoli „optimalizátoru promptů" a dostanete stejný tah: váš prompt projde kouzelnou šablonou — 4D framework! 27 vzorů! — a vrátí se delší, přestavěný od začátku do konce, bez záznamu, která změna byla důležitá nebo jestli pořád dělá stejný úkol. Čte se líp. Jestli funguje líp, je samostatná vlastnost, a nástroj to nikdy neověří.
Provozujeme katalog, který testuje Claude skilly na reálných datech, a chtěli jsme opak. Tak jsme postavili prompt-discipline, a ten zachází s promptem jako s bug reportem: nejdřív pojmenuje vzorec selhání, aplikuje nejmenší opravu, která ho řeší, a pak přesně řekne, jak to A/B otestovat. Je zdarma pod licencí MIT: github.com/Skillproofdev/prompt-discipline.
Propast: přepisovače nediagnostikují, diagnostici potřebují infrastrukturu
Než jsme napsali pravidlo, prošli jsme 43 skillů na prompt engineering v našem katalogu plus samostatné nástroje — vlastní vylepšovač promptů v Anthropic Console, PromptPerfect, DSPy, prompt-optimizer od getsentry. Obor se dělí na dva tábory, které se nikdy nepřekrývají.
Šablonoví přepisovače transformují každý vstup stejně. Není tam krok, který by se zeptal, co je tu vlastně špatně — vágní prompt a protiřečící si prompt dostanou stejné zacházení a výstup je spolehlivě delší. Není to slaměný panák: vlastní vylepšovač Anthropic Console otevřeně varuje, že jeho přepisy vycházejí delší a pomalejší. Delší je produkt.
Pipeline založené na evaluaci první — DSPy, optimalizátory řízené trasováním — mají správnou epistemologii. Skutečně měří. Ale potřebují infrastrukturu: produkční trasy, MCP server, worktree harness, označkovaný dataset, který si nejdřív sestavíte. Nesáhnete po nich, abyste opravili prompt, který zrovna upravujete.
Nikdo nenabízí tu prostřední věc: skill bez závislostí, který dělá diagnóza-první → minimální-diff → plán A/B testu, bez trasování a bez serveru k rozjetí. Tahle mezera je celý skill.
Devět pravidel, tři z nich jsou podstata
Skill je sada přísných pravidel aplikovaných v pořadí (celý SKILL.md). Známé části tu jsou — výstupní formát jako pozitivní smlouva (seznam klíčů s typy, ne „odpověz v JSON"), příklady místo přídavných jmen, seznamy zákazů přepsané na pozitivní instrukce, řazení role→data→instrukce→příklady→dotaz. Tři, které ho definují:
- Nejdřív diagnostikovat, pak sahat na cokoli. Zařadit, co je vlastně špatně — nejednoznačnost, chybějící kontext, žádná výstupní smlouva, protiřečící si instrukce, riziko odchylky formátu, přeprompting, nebo „vůbec to není problém promptu" — a u každého nálezu citovat problematickou pasáž. Bez diagnózy žádný přepis. „Tenhle prompt je v pořádku" je platný, kompletní výstup.
- Minimální diff, jedna změna na jedno selhání. Každá úprava se mapuje přesně na jedno diagnostikované selhání, ukázané jako
staré → novés jednořádkovým zdůvodněním. Fungující části zůstávají doslovně. Kde vylepšovač Console vycpává, tenhle obvykle vychází kratší — mrtvá zaklínadla („jsi nejlepší na světě…", „nadechni se zhluboka", zastaralé lešení „přemýšlej krok za krokem") se škrtají. - Testovací plán, ne slib. Každý přepis dodá 2–3 konkrétní testovací vstupy včetně edge case, jak vypadá úspěch a A/B postup: stejné vstupy, stejný model, 3–5 běhů na variantu, porovnat míru úspěchu. Pokud se změny navrstvily, pojmenuje, kterou vrátit zpátky jako první. Nikdy neslíbí „tohle to opraví" — změnili jste proměnné, rozhoduje test.
Benchmark — a výhrada, kterou potřebujete nejdřív
Deset skutečně vadných promptů, každý spárovaný s úkolem, který má mechanicky ověřitelnou odpověď: extrakce proti známému ground truth, formátování, které musí parsovat (json.loads / csv.reader), klasifikace proti označkovaným příkladům. Tři větve na případ — originální prompt, základní přepis (obyčejný Claude, kterému bylo řečeno „vylepši tenhle prompt"), a přepis se skillem (identické sezení s načteným tímhle SKILL.md). Všechny přepisy pak běží jako úkoly na stejném modelu.
Přečtěte si tohle před tabulkou: běh je n=1 na případ a větev, ne předregistrované n=5. Variabilita vzorkování je neměřená. Jakákoli mezera u jednoho případu (0,1) je uvnitř šumové hranice. Berte každé číslo tady jako předběžné do n=5 replikace — my taky.
| Větev | Úspěšnost úkolu | Shoda formátu | Medián Δ délky promptu |
|---|---|---|---|
| A — originální prompt | 0,70 (7/10) | 0,70 (7/10) | — |
| B — základní přepis („vylepši tenhle prompt") | 0,80 (8/10) | 0,70 (7/10) | +99,5 slov |
| C — přepis se skillem (tento SKILL.md) | 0,90 (9/10) | 0,80 (8/10) | +44,5 slov |
Proti předregistrovanému testu skill projde: remizuje nebo poráží základní přepis v úspěšnosti (0,90 ≥ 0,80) a shodě (0,80 ≥ 0,70), čistí hranici +15 p. b. nad originálem (+20 p. b.) a dělá to s méně než polovinou nadbytku promptu — medián +44,5 slov proti +99,5 u základního přepisu. To poslední číslo je nejrobustnější zjištění celého běhu: C je útlejší na všech deseti případech, a je to jediná větev, která se kdy dostane do záporu (případ 10, −10 slov, škrtnutí hromady zákazů ze systémového promptu). Naivní i disciplinovaný přepis nafukují stručné prompty; naivní zhruba zdvojnásobí cenu.
Kde je to tenké a kde to prohrálo
Hranice úspěšnosti a shody jsou reálné, ale křehké, a nebudeme to předstírat.
U 7 z 10 případů remizují všechny tři větve. Rozdíl v úspěšnosti stojí skoro celý na případu 6 (klasifikace ticketů), jediném případu, kde skill jasně vyhrává: C vyprodukovala správné, parsovatelné štítky po položkách (15/15), zatímco základní přepis dostal 13/15 ve formátu, který by neparsoval. Vytáhněte ten jeden případ a hlavní mezera skoro zmizí. Tak vypadá n=1 s hromadou remíz — poctivé, ne zdrcující, ale měli byste to vědět.
Případ 9 je pro skill prohra na jeho vlastní půdě. Prompt na opravu tónu s chybějícím publikem — přesně situace, na kterou existuje pravidlo 2 („uveďte předpoklad, když je záměr neurčitelný"). Pravidlo se nespustilo. Přepis skillu vypustil problém chybějícího publika a C selhala vedle A i B. Skill, který prohraje přesně u věci, na kterou je specificky navržený, je nejužitečnější druh negativního výsledku, takže zůstává v tabulce.
Shoda u případu 2 je 0 napříč všemi třemi větvemi. Prompt s protiřečícími si instrukcemi: každá větev vyřešila rozpor v obsahu (dostala správné číslo), ale žádná si nevynutila jednohodnotový výstup, takže všechny tři skórovaly 0 na formát. Ani jeden přepisovač — disciplinovaný nebo ne — nevynutil smlouvu. Sdílená slepá skvrna, reportovaná, ne schovaná.
Testujeme skilly jiných lidí na živobytí, a naše metodika vyžaduje ztráty vedle výher. Tohle jsou ty ztráty.
GET THE SKILL
prompt-discipline je zdarma a pod licencí MIT — repo je skill. Přečtěte si každé pravidlo, spusťte si benchmark sami, forkněte ho.
Získat prompt-discipline na GitHubuInstalace
git clone https://github.com/Skillproofdev/prompt-discipline ~/.claude/skills/prompt-discipline
Restartujte Claude Code. Spouští se na „vylepši tenhle prompt", „proč můj prompt selhává", „optimalizuj prompt" a když píšete nebo upravujete systémové prompty a instrukce pro agenty — a odmítá žádosti o jailbreak/obcházení bezpečnosti a prompty na generování obrázků/videí, které mají vlastní gramatiku. Patří do naší disciplinární série: token-discipline snižuje, co sezení stojí, research-discipline snižuje, co si výzkum splete, a tenhle stahuje přepisy promptů na změnu, na které skutečně záleželo.
FREE STARTER PACK
Chcete naše nejlépe hodnocené skilly plus instalační checklist, který používáme před každým testem? Pošleme vám ho e-mailem zdarma.
Získat free starter packFAQ
Čím se to liší od vylepšovače promptů v Anthropic Console? Vylepšovač Console je šablonový přepisovač — přestaví celý prompt a otevřeně varuje, že výsledek vychází delší a pomalejší. prompt-discipline nejdřív diagnostikuje konkrétní selhání, mění jen to, co se na něj mapuje, a v našem benchmarku přidal méně než polovinu délky a obvykle vyšel kratší. Jiný cíl: nástroj Console produkuje uhlazený prompt; tenhle produkuje nejmenší obhajitelný diff plus způsob, jak ho dokázat.
Proč zveřejnit benchmark, u kterého přiznáváte n=1? Protože alternativou v téhle nice je nezveřejnit čísla vůbec, což je norma, proti které se vymezujeme. n=1 s otevřeně přiznanou výhradou je poctivější než sebejisté tvrzení bez jakéhokoli měření za ním. Zjištění o mediánu délky je pevné napříč všemi deseti případy; hranice úspěšnosti a shody jsou předběžné a takhle označené, do n=5 replikace.
Přepíše to vždycky můj prompt? Ne. Pokud je prompt v pořádku, skill to řekne a zastaví se — „tenhle prompt nepotřebuje změny, tady je jedno riziko k otestování" je platný, kompletní výstup. Taky odmítá vycpávat diagnózu jen kvůli aplikaci šablony a rovnou odmítá žádosti o jailbreak, místo aby je „vylepšoval".
Opraví to můj prompt? Neslíbí to, a neměl by to slibovat žádný nástroj, který nespustil váš úkol. Skill mění proměnné a dá vám konkrétní A/B postup — stejné vstupy, stejný model, 3–5 běhů — takže rozhoduje test, ne dojem z hezčího promptu.
★ 9.6/10 × 3
Startovací balíček zdarma
3 skills s nejvyšším skóre z našich testů plus instalační checklist — sestava, kterou bychom nasadili na čistý stroj. Zdarma, e-mailem.