
E-mails folk faktisk svarer på: ét mål, ingen AI-fyld
De fleste e-mails forbliver ikke ubesvarede, fordi de er uhøflige. De forbliver ubesvarede, fordi læseren ikke kan se, inden for fem sekunder, hvad du vil, og hvad de skal gøre ved det. Bed Claude om at skrive én, og baseline-resultatet er høfligt — reelt fyldfrit, velopdragent og for langt, med selve anmodningen begravet tre sætninger nede og dateret "når du får tid." Vi driver et katalog, der benchmark-tester Claude-skills til daglig, så vi gjorde det oplagte: målte om et sæt håndhævelige regler kunne forvandle de udkast til e-mails, en travl person rent faktisk svarer på.
Resultatet er email-discipline, og den leveres med den målte før/efter, vi ikke kunne finde andre steder i nichen: i en blind "ville du svare nu?"-test på tværs af 12 scenarier fik baseline-modellen et svar-nu på 3 af 12 udkast; med skillen, 9 af 12. Samme model, samme prompts, én variabel. Den er gratis og MIT-licenseret: github.com/Skillproofdev/email-discipline.
Hullet: alle leverer marketingmaskineri
Før vi skrev en eneste linje, gennemgik vi 87 e-mailskrivende skills (fra et datasæt på 16,682 skills) plus det selvstændige felt. Næsten det hele er samme spor: cold sekvenser, drip-kampagner, subject line-A/B-tests, livscyklusautomatisering — marketingmaskineri til at sende i stor skala. Den e-mail, der reelt æder din dag, er den anden slags: anmodningen til en kollega, fire-spørgsmåls-svaret, opfølgningen efter tavshed, det høflige nej. Den e-mail har næsten ingen skill-dækning, og det, der findes, er enten stemme-efterligning, der kræver eksempler på din sendte post for at virke, eller skabelonstrukturer, der påbyder præcis de opvarmningsafsnit, læsere springer over.
Ingen leverer den daglige e-maildisciplin: numeriske ordbudgetter per type, en mekanisk scanbar liste over forbudt fyld, svar-rækkefølge-regler og en offentliggjort benchmark til at bakke det op. Denne skill er otte kontrollerbare regler, et udkast enten består eller ikke består — for e-mail fra ét menneske til et andet, ikke kampagner. Den sidder side om side med research-discipline og token-discipline i vores serie: regler, der begrænser modellen i stedet for at bede den pænt.
Otte regler, fire af dem nye
De fire teknikker, der optrådte i ingen af de 87 skills som håndhævelige regler, er kernen:
- Ét mål, anmodningen i de første to linjer. Angiv den ene ting, e-mailen skal opnå, og indled med den. Konteksten kommer efter anmodningen, aldrig før. To ubeslægtede anmodninger → to e-mails.
- Ordbudgetter, numeriske. Cold ≤120 ord, opfølgning ≤60, svar ≤150, intern opdatering ≤150. Over budget betyder skær ned, ikke undskyld for længden.
- Svar-disciplin. Læs hele tråden, besvar derefter ethvert indkommende spørgsmål først, i den spørgendes rækkefølge, før du tilføjer din egen anmodning. Ingen skill, vi fandt, kodificerer det overhovedet.
- Modtager-perspektiv-gennemløbet. Genlæs koldt som modtageren: "hvad gør jeg, efter jeg har læst det her?" Hvis svaret ikke er én åbenlys lavindsats-handling, skriv om.
Plus resten: emnelinje = anmodningen (≤50 tegn, deadline inkluderet), en scanbar liste over forbudt fyld ("I hope this email finds you well," "just checking in," og AI-fyldordforrådet — leverage, synergy, seamless, delve), præcis én CTA med en reel kalenderdato, og en streng output-kontrakt: emnelinje + brødtekst, intet andet, varianter kun på forespørgsel.
Benchmarken: 12 scenarier, tre scoringslag
To arme, samme model (Claude Sonnet), identiske prompts på tværs af 12 realistiske scenarier — en cold henvendelse til en professor, et klientsvar med fire spredte spørgsmål, en leverandøreskalering, en €3,800-fakturarykker, et keynote-afslag, en post-hændelsesopdatering. Hvert er en fuld selvstændig prompt med navne, indsatser, datoer og plantede fælder (spørgsmål i mærkelig rækkefølge, en forkert præmis der skal rettes, ventile-lokkemad, credential-dump-lokkemad). Grundsandhed, ordbudgetter og listen over forbudt fyld (regex) blev fastfrosset, før nogen af armene kørte. Scoret 2026-07-10.
| Metrik | Baseline (uden skill) | Med email-discipline |
|---|---|---|
| Mekanisk bestået — budget + emnelinje + fyld + format | 2/12 | 12/12 |
| Inden for ordbudget | 2/12 (gennemsnit 163 ord) | 12/12 (gennemsnit 100) |
| Emnelinje-overtrædelser (>50 tegn / generisk) | 4 | 0 |
| Grundsandhedsdækning (spørgsmål, fakta, anmodninger) | 65/77 (84%) | 76/77 (99%) |
| Plantede-fælde-overtrædelser | 9 | 4 |
| CTA med reel dato, hvor krævet | 11/12 | 12/12 |
| Blind parret præference (sejre–uafgjort–tab) | 1–1–10 | 10–1–1 |
| "Ville svare nu"-reaktioner | 3/12 | 9/12 |
Overskriften er, at Sonnets baseline-hygiejne allerede er god — den skrev næsten fyldfri e-mail (én kliché-frase i 12 udkast). Dens fejlmåde er længde og en begravet anmodning: over budget på 10 af 12 udkast, værste tilfælde 261 ord mod et budget på 120. Skillen rettede præcis det. Hvert udkast kom ind under budget, hver krævet CTA fik en dato, dækningen steg 84% → 99%, og den blinde parrede dommer foretrak skill-udkastet 10 gange ud af 12.
Hvor skillen tabte — udgivet alligevel
Vores metode kræver, at tabene står ved siden af sejrene, og email-discipline har reelle tab. Begge landede i de scenarier, hvor konsekvenserne hober sig op.
Den tabte S12 klart — post-hændelsesopsummeringen. Baselinens mærkede afsnit ("Impact," "Root cause," "Next steps") scannede en anelse bedre end skillens strammere prosa, og den blinde dommer valgte baselinen. Et reelt negativt resultat. Den fik uafgjort på S11, den ugentlige migrationsstatus: begge udkast var rene, punktopstilling versus prosa, ingen vinder.
Og skillens dækningsmiss var ikke nul. På den kolde B2B-e-mail (S02) stablede den to kroge og dumpede tre navngivne funktioner — præcis det oversalg, disciplinen skal forhindre. På fakturarykkeren (S08) stablede begge arme to konsekvenser i stedet for at angive ét rent standardvalg, og skillen tabte det point også. Det, skillen ikke forbedrede, fordi baselinen allerede var perfekt: at rette de to plantede falske præmisser (2/2 begge arme) og besvare svar-spørgsmål i rækkefølge (4/4 begge). Hvis Sonnet allerede rammer noget perfekt, kan en regel ikke gøre det mere perfekt.
Ét ærligt forbehold om det blinde lag: bedømmelsen blev foretaget in-context af scoringsagenten med en forhåndsregistreret plat-eller-krone-blinding (bench/runs/blind-key.json), ikke af en uafhængig frisk-instans-dommer. Det er mærket som sådan i bedømmelsen, og det er svagere end et fuldt uafhængigt panel. Vi leverer tallet med asterisken frem for uden tallet.
SKILLPROOF PAKKE
email-discipline er gratis og MIT. Læs de otte regler, scorerne per scenarie og den scriptede mekaniske tjekker på GitHub — repoet er skillen.
Hent email-discipline på GitHubInstallation
git clone https://github.com/Skillproofdev/email-discipline ~/.claude/skills/email-discipline
Genstart Claude Code. Den udløses af "write an email," "reply to this," "follow up with," cold-outreach-udkast, afslag, eskaleringer, interne opdateringer — eller når du indsætter en tråd og beder om et svar. Den holder sig væk fra marketingkampagner, nyhedsbreve og drip-sekvenser; dedikerede marketing-skills ejer de spor.
GRATIS STARTERPAKKE
Vil du have vores højest scorede skills plus den installationstjekliste, vi kører før hver eneste test? Vi sender dig den gratis starterpakke på mail.
Få den gratis starterpakkeFAQ
Skriver den her cold outreach og marketingsekvenser? Den skriver én enkelt cold anmodning — engangs-e-mailen til en professor, en Head of Ops, en stifter — med et ≤120-ords-budget og én dateret CTA. Den udfører eksplicit ikke drip-kampagner, nyhedsbreve eller livscyklusautomatisering; det er marketingspor med deres egne skills, og skillen nægter at udløses på dem.
Sonnet skriver allerede ren e-mail. Hvad tilføjer skillen egentlig? Længdekontrol og en findbar anmodning. I vores benchmark var baselinen allerede næsten fyldfri, men sprængte ordbudgettet på 10 af 12 udkast og begravede anmodningen i flere. Skillen tog gennemsnitlig brødtekstlængde fra 163 ord til 100, satte en reel dato på hver CTA og løftede grundsandhedsdækningen fra 84% til 99% — målt, ikke påstået.
Er 9/12 "svar nu" ikke stadig et tab på 3 af dem? Jo, og det er den ærlige læsning. Skillen omtrent tredoblede svar-nu-raten (3 → 9), men gjorde ikke hvert udkast uimodståeligt, og den tabte én blind bedømmelse og fik uafgjort i en anden. Det er et disciplinlag, ikke magi. Hvis en e-mail har høj indsats, giver skillen dig et stramt førsteudkast på sekunder — du læser stadig selv til sidst.
Hvorfor kun 12 scenarier? Fordi hvert udkast blev scoret mod grundsandhed fastfrosset, før nogen af armene kørte — spørgsmålslister, ordbudgetter, en scriptet mekanisk tjekker og plantede fælder per scenarie. Vi foretrækker en lille benchmark, hvor tjekkene er reelle og reproducerbare, frem for en stor, der bedømmes på fornemmelse. Den fulde protokol og scorer per scenarie er i repoet.
★ 9.6/10 × 3
Den gratis startpakke
De 3 skills med vores højeste testscorer plus installations-tjeklisten — det setup, vi selv ville lægge på en frisk maskine. Gratis, på mail.