
Mails waar mensen echt op reageren: één doel, geen fluff
De meeste mails blijven niet onbeantwoord omdat ze onbeleefd zijn. Ze blijven onbeantwoord omdat de lezer in vijf seconden niet kan zien wat je wilt en wat hij ermee moet doen. Vraag Claude om een mail te schrijven en de baseline is beleefd — écht vrij van opvulzinnen, keurig, en te lang, met de eigenlijke vraag drie zinnen diep begraven en gedateerd op "wanneer het je uitkomt." Wij runnen een directory die Claude-skills benchmarkt voor de kost, dus we deden het voor de hand liggende: meten of een set afdwingbare regels die concepten kon veranderen in mail waar een druk iemand écht op reageert.
Het resultaat is email-discipline, en hij komt met de meting die we nergens anders in deze niche konden vinden: op een blinde "zou je nu reageren?"-test over 12 scenario's kreeg het baseline-model een reageer-nu op 3 van de 12 conceptmails; met de skill, 9 van de 12. Zelfde model, zelfde prompts, één variabele. Gratis en MIT-licensed: github.com/Skillproofdev/email-discipline.
Het gat: iedereen levert marketingmachinerie
Voordat we een regel schreven, bekeken we 87 mailschrijfskills (uit een dataset van 16.682 skills) plus het losstaande veld. Vrijwel alles zit in dezelfde baan: koude sequenties, drip-campagnes, onderwerpregel-A/B-tests, lifecycle-automatisering — marketingmachinerie voor verzending op schaal. De mail die écht je dag opeet is een ander type: de vraag aan een collega, de reactie met vier vragen, de follow-up na stilte, het beleefde nee. Dat type mail heeft nauwelijks skill-dekking, en wat er bestaat is óf stemimitatie die voorbeelden van je verstuurde mail nodig heeft om te werken, óf sjabloonstructuren die precies de warming-up-alinea's voorschrijven die lezers overslaan.
Niemand levert de discipline voor alledaagse mail: numerieke woordbudgetten per type, een mechanisch scanbare lijst met verboden opvulzinnen, antwoordvolgorde-regels, en een gepubliceerde benchmark om het te onderbouwen. Deze skill is acht controleerbare regels waar een concept aan voldoet of niet — voor mail van mens tot mens, geen campagnes. Hij staat naast research-discipline en token-discipline in onze reeks: regels die het model beperken in plaats van het vriendelijk aan te sturen.
Acht regels, vier ervan nieuw
De vier technieken die in geen enkele van de 87 skills als afdwingbare regel voorkwamen, vormen de kern:
- Eén doel, de vraag in de eerste twee regels. Benoem het ene ding dat de mail moet bereiken, en open ermee. Context komt erna, nooit ervoor. Twee losse vragen → twee mails.
- Woordbudgetten, numeriek. Koud ≤120 woorden, follow-up ≤60, reactie ≤150, interne update ≤150. Over budget betekent schrappen, niet excuseren voor de lengte.
- Reactiediscipline. Lees de hele thread, beantwoord dan elke binnenkomende vraag eerst, in de volgorde van de vrager, voordat je je eigen vraag toevoegt. Geen enkele skill die we vonden legt dit vast.
- De pass vanuit het perspectief van de ontvanger. Herlees koud alsof je de ontvanger bent: "wat moet ik doen nadat ik dit gelezen heb?" Is het antwoord niet één duidelijke, laagdrempelige actie, herschrijf dan.
Plus de rest: onderwerpregel = de vraag (≤50 tekens, deadline inbegrepen), een scanbare lijst met verboden opvulzinnen ("ik hoop dat deze mail je goed bereikt," "ik wilde even checken," en het AI-jargon — leverage, synergie, naadloos, uitdiepen), precies één call-to-action met een echte kalenderdatum, en een strikt outputcontract: onderwerp + body, verder niets, varianten alleen op verzoek.
De benchmark: 12 scenario's, drie meetlagen
Twee armen, zelfde model (Claude Sonnet), identieke prompts over 12 realistische scenario's — een koude vraag aan een professor, een klantreactie met vier verspreide vragen, een leverancierseskalatie, een achterstallige factuur van €3.800, een keynote-afwijzing, een post-incident-update. Elk is een volledig zelfstandige prompt met namen, belangen, data en ingebouwde valkuilen (vragen in vreemde volgorde, een verkeerde aanname om te corrigeren, uitlokking om te klagen, uitlokking om credentials te dumpen). Ground truth, woordbudgetten en de verboden-opvulzinnen-regexlijst waren bevroren voordat een van beide armen draaide. Gescoord op 2026-07-10.
| Metriek | Baseline (geen skill) | Met email-discipline |
|---|---|---|
| Mechanisch geslaagd — budget + onderwerp + opvulzinnen + format | 2/12 | 12/12 |
| Binnen woordbudget | 2/12 (gem. 163 woorden) | 12/12 (gem. 100) |
| Overtredingen onderwerpregel (>50 tekens / generiek) | 4 | 0 |
| Ground-truth-dekking (vragen, feiten, verzoeken) | 65/77 (84%) | 76/77 (99%) |
| Overtredingen ingebouwde valkuilen | 9 | 4 |
| CTA met een echte datum waar vereist | 11/12 | 12/12 |
| Blinde paarsgewijze voorkeur (win–gelijk–verlies) | 1–1–10 | 10–1–1 |
| "Zou nu reageren"-reacties | 3/12 | 9/12 |
De hoofdconclusie is dat Sonnets baseline-hygiëne al goed is — hij schreef bijna vrij van opvulzinnen (één cliché in 12 concepten). Zijn faalmodus is lengte en een verstopte vraag: over budget bij 10 van de 12 concepten, ergste geval 261 woorden tegen een budget van 120. De skill loste precies dat op. Elk concept bleef onder budget, elke vereiste CTA kreeg een datum, dekking klom van 84% naar 99%, en de blinde paarsgewijze rechter verkoos het skill-concept 10 van de 12 keer.
Waar de skill verloor — toch gepubliceerd
Onze methodologie eist dat de verliezen naast de winsten staan, en email-discipline heeft echte verliezen. Allebei landden ze op de scenario's waar de gevolgen zich opstapelen.
Hij verloor S12 ronduit — de post-incident-samenvatting. De baseline's gelabelde secties ("Impact," "Grondoorzaak," "Volgende stappen") scanden net iets beter dan het strakkere proza van de skill, en de blinde rechter koos de baseline. Een écht negatief resultaat. Hij eindigde gelijk bij S11, de wekelijkse migratiestatus: beide concepten waren netjes, bullets tegenover proza, geen winnaar.
En de dekkingsmisser van de skill was niet nul. Bij de koude B2B-mail (S02) stapelde hij twee haakjes en dumpte drie genoemde features — precies het oververkopen dat de discipline moet voorkomen. Bij de achterstallige-factuurherinnering (S08) stapelden beide armen twee consequenties in plaats van één helder standaardscenario te noemen, en ook daar verloor de skill een punt. Wat de skill niet verbeterde, omdat de baseline al perfect was: de twee ingebouwde valse aannames corrigeren (2/2 bij beide armen) en reactievragen in volgorde beantwoorden (4/4 bij beide). Als Sonnet iets al feilloos doet, kan een regel het niet perfecter maken.
Eén eerlijke kanttekening bij de blinde laag: het oordeel werd in-context geveld door de scoring-agent met een vooraf geregistreerde blinde muntworp (bench/runs/blind-key.json), niet door een onafhankelijke rechter in een verse instantie. Dat is zwakker dan een volledig onafhankelijk panel. Het staat als zodanig gelabeld in het verdict. We publiceren liever het cijfer met het sterretje dan zonder.
SKILLPROOF PACK
email-discipline is gratis en MIT. Lees de acht regels, de scores per scenario en de gescripte mechanische checker op GitHub — de repo is de skill.
Haal email-discipline op GitHubInstallatie
git clone https://github.com/Skillproofdev/email-discipline ~/.claude/skills/email-discipline
Herstart Claude Code. Hij triggert op "schrijf een mail," "reageer hierop," "volg dit op bij," koude-outreach-concepten, afwijzingen, escalaties, interne updates — of wanneer je een thread plakt en om een reactie vraagt. Hij blijft weg bij marketingcampagnes, nieuwsbrieven en drip-sequenties; toegewijde marketingskills hebben die banen.
GRATIS STARTERPACK
Wil je onze best scorende skills plus de installchecklist die we voor elke test draaien? We mailen je de gratis starterpack.
Haal de gratis starterpackFAQ
Schrijft dit koude outreach en marketingsequenties? Hij schrijft één koude vraag — de eenmalige mail aan een professor, een Head of Ops, een oprichter — met een budget van ≤120 woorden en één gedateerde CTA. Hij doet expliciet geen drip-campagnes, nieuwsbrieven of lifecycle-automatisering; dat zijn marketingbanen met hun eigen skills, en deze skill weigert erop te triggeren.
Sonnet schrijft al nette mail. Wat voegt de skill dan toe? Lengtecontrole en een vindbare vraag. In onze benchmark was de baseline al vrijwel vrij van opvulzinnen, maar overschreed hij het woordbudget bij 10 van de 12 concepten en verstopte hij de vraag bij meerdere. De skill bracht de gemiddelde bodylengte van 163 naar 100 woorden, gaf elke CTA een echte datum en tilde ground-truth-dekking van 84% naar 99% — gemeten, niet beweerd.
Is 9/12 "reageer nu" niet nog steeds een verlies op 3 ervan? Ja, en dat is de eerlijke lezing. De skill verdrievoudigde ruwweg het reageer-nu-percentage (3 → 9) maar maakte niet elk concept onweerstaanbaar, en hij verloor één blind oordeel en eindigde gelijk bij een ander. Het is een disciplinelaag, geen magie. Bij een mail met hoge inzet geeft de skill je in seconden een strak eerste concept — de laatste lezing doe je zelf nog steeds.
Waarom maar 12 scenario's? Omdat elk concept werd gescoord tegen ground truth die vastgelegd was voordat een van beide armen draaide — vragenlijsten, woordbudgetten, een gescripte mechanische checker, en per scenario ingebouwde valkuilen. We geven de voorkeur aan een kleine benchmark met echte, reproduceerbare checks boven een grote die op onderbuikgevoel wordt beoordeeld. Het volledige protocol en de scores per scenario staan in de repo.
★ 9.6/10 × 3
Het gratis starterspakket
De 3 skills met onze hoogste testscores plus de installatiechecklist — de setup die wij op een verse machine zouden zetten. Gratis, per e-mail.