
De promptfixer die eerst diagnosticeert, dan herschrijft
Plak een gebrekkige prompt in bijna elke "prompt-optimizer" en je krijgt dezelfde beweging: je prompt gaat een magisch sjabloon in — 4D-framework! 27 patronen! — en komt terug langer, van boven tot onder herstructureerd, zonder vastlegging van welke wijziging ertoe deed of hij nog wel dezelfde taak doet. Hij leest beter. Of hij ook werkt beter is een aparte vraag, en de tool controleert dat nooit.
Wij runnen een directory die Claude-skills benchmarkt voor de kost, en we wilden het tegenovergestelde. Dus bouwden we prompt-discipline, en die behandelt een prompt zoals je een bugreport zou behandelen: benoem eerst het faalpatroon, pas dan de kleinst mogelijke fix toe die het aanpakt, en zeg dan precies hoe je de wijziging A/B-test. Gratis en MIT-licensed: github.com/Skillproofdev/prompt-discipline.
Het gat: herschrijvers diagnosticeren niet, diagnosticeerders hebben infrastructuur nodig
Voordat we een regel schreven, bekeken we 43 prompt-engineering-skills in onze catalogus plus de losstaande tools — Anthropics eigen Console-promptverbeteraar, PromptPerfect, DSPy, getsentry's prompt-optimizer. Het veld splitst zich in twee kampen die elkaar nooit overlappen.
Sjabloonherschrijvers transformeren elke input op dezelfde manier. Er is geen stap die vraagt wat hier eigenlijk mis is — een vage prompt en een tegenstrijdige prompt krijgen dezelfde behandeling, en de output is betrouwbaar langer. Dit is geen stroman: Anthropics eigen Console-verbeteraar waarschuwt zelf dat zijn herschrijvingen langer en trager uitpakken. Langer is het product.
Eval-eerst-pipelines — DSPy, trace-gedreven optimizers — hebben de juiste epistemologie. Ze meten écht. Maar ze vragen infrastructuur: productie-traces, een MCP-server, een worktree-harness, een gelabelde dataset die je eerst samenstelt. Je grijpt er niet naar om de prompt te fixen die je nu aan het bewerken bent.
Niemand levert het middending: een afhankelijkheidsvrije skill die eerst diagnosticeert → minimaal wijzigt → een A/B-testplan geeft, zonder traces en zonder server om op te zetten. Dat gat is de hele skill.
Negen regels, drie ervan zijn het punt
De skill is een set harde regels in volgorde toegepast (volledige SKILL.md). De bekende onderdelen zijn er — outputformat als een positief contract (een sleutellijst met types, niet "antwoord in JSON"), voorbeelden boven bijvoeglijke naamwoorden, verbodslijsten herschreven als doe-instructies, rol→data→instructies→voorbeelden→vraag-volgorde. De drie die hem definiëren:
- Diagnosticeer voordat je iets aanraakt. Classificeer wat er echt mis is — ambiguïteit, ontbrekende context, geen outputcontract, tegenstrijdige instructies, format-drift-risico, overprompten, of "helemaal geen promptprobleem" — en citeer de aanstootgevende passage bij elke bevinding. Geen diagnose, geen herschrijving. "Deze prompt is prima" is een geldige, complete output.
- Minimale wijziging, één aanpassing per faalpatroon. Elke wijziging koppelt aan precies één gediagnosticeerd faalpatroon, getoond als
oud → nieuwmet een rationale van één regel. Werkende delen blijven letterlijk staan. Waar de Console-verbeteraar opvult, komt deze meestal korter uit — dode bezweringen ("je bent 's werelds beste…", "haal diep adem", verouderde "denk stap voor stap"-scaffolding) worden geschrapt. - Een testplan, geen belofte. Elke herschrijving komt met 2-3 concrete testinputs inclusief een edge case, hoe een slaging eruitziet, en de A/B-procedure: dezelfde inputs, hetzelfde model, 3-5 runs elk, slagingspercentages vergelijken. Zijn er wijzigingen gestapeld, dan noemt hij welke je eerst moet terugdraaien. Hij belooft nooit "dit lost het op" — jij veranderde variabelen, de test beslist.
De benchmark — en een kanttekening die je eerst nodig hebt
Tien echt gebrekkige prompts, elk gekoppeld aan een taak met een mechanisch controleerbaar antwoord: extractie tegen bekende ground truth, formattering die moet parsen (json.loads / csv.reader), classificatie tegen gelabelde voorbeelden. Drie armen per casus — de originele prompt, een base-herschrijving (kale Claude gevraagd "verbeter deze prompt"), en een skill-herschrijving (identieke sessie met deze SKILL.md geladen). Alle herschrijvingen draaien vervolgens als taken op hetzelfde model.
Lees dit voor de tabel: de run is n=1 per casus per arm, niet de vooraf geregistreerde n=5. Steekproefvariantie is ongemeten. Elk verschil bij één casus (0,1) valt binnen de ruisvloer. Behandel elk cijfer hier als voorlopig in afwachting van een n=5-herhaling — dat doen wij ook.
| Arm | Taaksucces | Formatnaleving | Mediane promptlengte Δ |
|---|---|---|---|
| A — originele prompt | 0,70 (7/10) | 0,70 (7/10) | — |
| B — base-herschrijving ("verbeter deze prompt") | 0,80 (8/10) | 0,70 (7/10) | +99,5 woorden |
| C — skill-herschrijving (deze SKILL.md) | 0,90 (9/10) | 0,80 (8/10) | +44,5 woorden |
Tegen de vooraf geregistreerde test slaagt de skill: hij evenaart-of-verslaat de base-herschrijving op succes (0,90 ≥ 0,80) en naleving (0,80 ≥ 0,70), haalt de +15-pp-lat boven het origineel (+20 pp), en doet dat terwijl hij minder dan de helft van de promptopblazing toevoegt — mediaan +44,5 woorden tegen de +99,5 van de base-herschrijving. Dat laatste cijfer is de robuustste bevinding van de hele run: C is bij alle tien casussen zuiniger, en het is de enige arm die ooit negatief gaat (casus-10, −10 woorden, door een stapeling van verbodsbepalingen uit een systeemprompt te schrappen). Zowel naïef als gedisciplineerd herschrijven blaast beknopte prompts op; het naïeve verdubbelt de kosten ongeveer.
Waar het dun is, en waar hij verloor
De succes- en nalevingsvoorsprong zijn echt maar fragiel, en dat verbloemen we niet.
Bij 7 van de 10 casussen staan alle drie de armen gelijk. De succesmarge rust bijna volledig op casus-06 (ticketclassificatie), de enige casus die de skill ronduit wint: C produceerde correcte, per-item parseerbare labels (15/15) terwijl de base-herschrijving 13/15 haalde in een format dat niet parste. Trek die ene casus eruit en het hoofdverschil verdampt grotendeels. Dat is hoe n=1 met veel gelijke standen eruitziet — eerlijk, niet vernietigend, maar je moet het weten.
Casus-09 is een verlies voor de skill op zijn eigen voorwaarden. Een toon-fix-prompt met een ontbrekende doelgroep — precies de situatie waarvoor Regel 2 bestaat ("noem je aanname als de intentie onbeslisbaar is"). De regel vuurde niet af. De herschrijving van de skill liet het ontbrekende-doelgroep-probleem vallen, en C faalde naast A en B. Een skill die verliest op precies het ding waarvoor hij specifiek gebouwd is om te vangen, is het nuttigste type negatief resultaat, dus het blijft in de tabel staan.
Casus-02-naleving is 0 bij alle drie de armen. Een prompt met tegenstrijdige instructies: elke arm loste de tegenstrijdigheid op in inhoud (kreeg het juiste getal) maar geen enkele dwong een enkelvoudige output af, dus scoorden alle drie 0 op format. Geen van beide herschrijvers — gedisciplineerd of niet — dacht eraan het contract af te dwingen. Gedeelde blinde vlek, gerapporteerd, niet verborgen.
Wij testen andermans skills voor de kost, en onze methodologie eist dat de verliezen naast de winsten staan. Dit zijn de verliezen.
HAAL DE SKILL
prompt-discipline is gratis en MIT-licensed — de repo is de skill. Lees elke regel, draai de benchmark zelf, fork hem.
Haal prompt-discipline op GitHubInstallatie
git clone https://github.com/Skillproofdev/prompt-discipline ~/.claude/skills/prompt-discipline
Herstart Claude Code. Hij triggert op "verbeter deze prompt", "waarom faalt mijn prompt", "optimaliseer prompt", en wanneer je systeemprompts en agentinstructies schrijft of herziet — en hij weigert jailbreak-/safety-bypass-verzoeken en image-/videogeneratieprompts, die hun eigen grammatica hebben. Hij hoort bij onze discipline-reeks: token-discipline verlaagt wat een sessie kost, research-discipline verlaagt wat research fout heeft, en deze verlaagt promptherschrijvingen tot de wijziging die er echt toe deed.
GRATIS STARTERPACK
Wil je onze best scorende skills plus de installchecklist die we voor elke test draaien? We mailen je de gratis starterpack.
Haal de gratis starterpackFAQ
Hoe verschilt dit van Anthropics Console-promptverbeteraar? De Console-verbeteraar is een sjabloonherschrijver — hij herstructureert de hele prompt en waarschuwt zelf dat het resultaat langer en trager uitpakt. prompt-discipline diagnosticeert eerst het specifieke faalpatroon, wijzigt alleen wat aan dat patroon koppelt, en voegde in onze benchmark minder dan de helft van de lengte toe terwijl hij meestal korter uitkwam. Ander doel: de Console-tool levert een gepolijste prompt; deze levert de kleinst verdedigbare wijziging plus een manier om het te bewijzen.
Waarom een benchmark publiceren die je zelf n=1 noemt? Omdat het alternatief in deze niche is: geen cijfers publiceren, en dat is precies de norm waar we tegen reageren. n=1 met de kanttekening ronduit vermeld is eerlijker dan een zelfverzekerde claim zonder meting erachter. De mediane-lengtebevinding is solide over alle tien casussen; de succes- en nalevingsvoorsprong zijn voorlopig en als zodanig gelabeld, in afwachting van een n=5-herhaling.
Herschrijft hij altijd mijn prompt? Nee. Als de prompt prima is, zegt de skill dat en stopt hij — "deze prompt heeft geen wijzigingen nodig; hier is het ene risico om te testen" is een geldige, complete output. Hij weigert ook een diagnose op te vullen alleen om een sjabloon toe te passen, en hij weigert jailbreak-verzoeken ronduit in plaats van ze te "verbeteren".
Fixt dit mijn prompt? Dat belooft hij niet, en dat zou geen enkele tool moeten doen die jouw taak niet heeft gedraaid. De skill verandert variabelen en geeft je een concrete A/B-procedure — dezelfde inputs, hetzelfde model, 3-5 runs — zodat de test beslist, niet het gevoel van een prompt die er netter uitziet.
★ 9.6/10 × 3
Het gratis starterspakket
De 3 skills met onze hoogste testscores plus de installatiechecklist — de setup die wij op een verse machine zouden zetten. Gratis, per e-mail.