E-maile z Claude, na które ludzie faktycznie odpowiadają

E-maile z Claude, na które ludzie faktycznie odpowiadają

Większość maili nie zostaje bez odpowiedzi dlatego, że są niegrzeczne. Zostają bez odpowiedzi, bo czytelnik w pięć sekund nie potrafi rozpoznać, czego chcesz i co ma z tym zrobić. Poproś Claude o napisanie takiego maila, a wynik bazowy jest grzeczny — naprawdę bez lania wody, kulturalny i za długi, z właściwą prośbą zakopaną trzy zdania głębiej i podpisaną „jak znajdziesz chwilę”. Na co dzień prowadzimy katalog, w którym benchmarkujemy skille Claude, więc zrobiliśmy oczywistą rzecz: zmierzyliśmy, czy zestaw egzekwowalnych reguł potrafi zamienić te szkice w maile, na które zapracowana osoba faktycznie odpowie.

Efektem jest email-discipline, który przychodzi ze zmierzonym porównaniem przed/po, jakiego nie znaleźliśmy nigdzie indziej w tej niszy: w ślepym teście „czy odpowiedziałbyś od razu?” na 12 scenariuszach model bazowy zdobył ocenę odpowiem od razu na 3 z 12 szkiców; ze skillem — na 9 z 12. Ten sam model, te same prompty, jedna zmienna. Jest darmowy, na licencji MIT: github.com/Skillproofdev/email-discipline.

Luka: wszyscy dostarczają maszynerię marketingową

Zanim napisaliśmy pierwszą linijkę, przejrzeliśmy 87 skilli do pisania maili (z zestawu 16 682 skilli) plus samodzielne narzędzia z tej niszy. Niemal wszystko jest w tym samym pasie: sekwencje cold, kampanie kroplowe, testy A/B tematów, automatyzacja cyklu życia — maszyneria marketingowa do wysyłki na skalę. Mail, który faktycznie zjada ci dzień, jest innego rodzaju: prośba do kolegi, odpowiedź na cztery pytania, follow-up po ciszy, uprzejme „nie”. Ten rodzaj maila ma niemal zerowe pokrycie wśród skilli, a to, co istnieje, to albo naśladowanie głosu, które potrzebuje próbek twoich wysłanych maili, żeby działać, albo struktury szablonowe, które narzucają dokładnie te akapity rozgrzewające, które czytelnicy pomijają.

Nikt nie oferuje dyscypliny codziennego maila: liczbowych limitów słów wg typu, mechanicznie skanowalnej listy zakazanego lania wody, reguł kolejności odpowiedzi i opublikowanego benchmarku na poparcie. Ten skill to osiem sprawdzalnych reguł, które szkic albo spełnia, albo nie — dla maila od jednego człowieka do drugiego, nie dla kampanii. Stoi obok research-discipline i token-discipline w naszej serii: reguł, które ograniczają model, zamiast grzecznie go prosić.

Osiem reguł, cztery nowatorskie

Cztery techniki, które nie pojawiły się w żadnym z 87 skilli jako egzekwowalne reguły, są sednem:

  1. Jeden cel, prośba w pierwszych dwóch linijkach. Określ jedną rzecz, którą mail ma osiągnąć, i zacznij od niej. Kontekst przychodzi po prośbie, nigdy przed. Dwie niepowiązane prośby → dwa maile.
  2. Limity słów, liczbowe. Cold ≤120 słów, follow-up ≤60, odpowiedź ≤150, wewnętrzny update ≤150. Przekroczenie limitu oznacza cięcie, nie przepraszanie za długość.
  3. Dyscyplina odpowiadania. Przeczytaj cały wątek, potem odpowiedz na każde nadchodzące pytanie najpierw, w kolejności pytającego, zanim dodasz własną prośbę. Żaden skill, jaki znaleźliśmy, w ogóle tego nie kodyfikuje.
  4. Przebieg z perspektywy odbiorcy. Przeczytaj mail na chłodno jako odbiorca: „co robię po przeczytaniu tego?”. Jeśli odpowiedź to nie jedna oczywista, niewymagająca wysiłku czynność, przepisz.

Do tego reszta: temat = prośba (≤50 znaków, wliczając deadline), skanowalna lista zakazanego lania wody („mam nadzieję, że ten mail zastaje cię w dobrym zdrowiu”, „tylko sprawdzam, co słychać” i słownictwo zdradzające AI — leverage, synergy, seamless, delve), dokładnie jedno CTA z realną datą kalendarzową i ścisła umowa co do wyniku: temat + treść, nic więcej, warianty tylko na żądanie.

Benchmark: 12 scenariuszy, trzy warstwy oceny

Dwa warianty, ten sam model (Claude Sonnet), identyczne prompty w 12 realistycznych scenariuszach — cold ask do profesora, odpowiedź klientowi z czterema rozrzuconymi pytaniami, eskalacja do dostawcy, przypominajka o fakturze na 3800 €, odmowa wystąpienia na konferencji, update po incydencie. Każdy to pełny, samodzielny prompt z nazwiskami, stawką, datami i podrzuconymi pułapkami (pytania w dziwnej kolejności, błędna przesłanka do skorygowania, przynęta na wyładowanie emocji, przynęta na zrzut danych logowania). Stan faktyczny, limity słów i lista regexów lania wody zostały zamrożone przed uruchomieniem obu wariantów. Ocenione 2026-07-10.

Metryka Baseline (bez skilla) Z email-discipline
Zaliczenie mechaniczne — limit + temat + lanie wody + format 2/12 12/12
W limicie słów 2/12 (śr. 163 słowa) 12/12 (śr. 100)
Naruszenia tematu (>50 znaków / ogólnikowy) 4 0
Pokrycie stanu faktycznego (pytania, fakty, prośby) 65/77 (84%) 76/77 (99%)
Naruszenia podrzuconych pułapek 9 4
CTA z realną datą tam, gdzie wymagane 11/12 12/12
Ślepa preferencja parowa (wygrane–remisy–porażki) 1–1–10 10–1–1
Reakcje „odpowiem od razu” 3/12 9/12

Najważniejsze jest to, że bazowa higiena Sonnetu jest już dobra — napisał maile niemal bez lania wody (jedna wyświechtana fraza w 12 szkicach). Jego tryb awarii to długość i zakopana prośba: przekroczenie limitu w 10 z 12 szkiców, najgorszy przypadek 261 słów przy limicie 120. Skill naprawił dokładnie to. Każdy szkic zmieścił się w limicie, każde wymagane CTA dostało datę, pokrycie wzrosło z 84% do 99%, a ślepy sędzia parowy preferował szkic ze skillem 10 razy na 12.

Gdzie skill przegrał — i tak to publikujemy

Nasza metodologia wymaga pokazywania porażek obok zwycięstw, a email-discipline ma prawdziwe porażki. Obie trafiły na scenariusze, gdzie konsekwencje się piętrzą.

Przegrał wprost S12 — podsumowanie po incydencie. Nazwane sekcje baseline'u („Impact”, „Root cause”, „Next steps”) skanowały się nieznacznie lepiej niż zwięźlejsza proza skilla, a ślepy sędzia wybrał baseline. Prawdziwy wynik negatywny. Zremisował S11, cotygodniowy status migracji: oba szkice były czyste, punkty kontra proza, bez zwycięzcy.

I przeoczenie skilla w pokryciu nie było zerowe. W cold mailu B2B (S02) nałożył dwa hooki i wrzucił trzy nazwane funkcje — dokładnie tę przesadną sprzedaż, przed którą dyscyplina ma chronić. W przypominajce o zaległej fakturze (S08) oba warianty nałożyły dwie konsekwencje zamiast podać jeden czysty domyślny scenariusz, i skill przegrał też ten punkt. Czego skill nie poprawił, bo baseline już był idealny: korekta dwóch podrzuconych błędnych przesłanek (2/2 w obu wariantach) i odpowiadanie na pytania w kolejności (4/4 w obu). Jeśli Sonnet coś już robi bezbłędnie, reguła nie sprawi, że będzie to jeszcze bardziej bezbłędne.

Jedno uczciwe zastrzeżenie co do warstwy ślepej: ocena została zrobiona w kontekście przez agenta oceniającego z zaślepieniem na zasadzie z góry zarejestrowanego rzutu monetą (bench/runs/blind-key.json), nie przez niezależnego sędziego w świeżej instancji. Jest tak oznaczona w werdykcie i jest słabsza niż w pełni niezależny panel. Wolimy podać liczbę z gwiazdką, niż nie podawać jej wcale.

PAKIET SKILLPROOF

email-discipline jest darmowy i na licencji MIT. Przeczytaj osiem reguł, wyniki dla każdego scenariusza i skryptowy checker mechaniczny na GitHubie — repozytorium jest skillem.

Pobierz email-discipline na GitHub

Instalacja

git clone https://github.com/Skillproofdev/email-discipline ~/.claude/skills/email-discipline

Zrestartuj Claude Code. Uruchamia się na „write an email”, „reply to this”, „follow up with”, szkice cold outreach, odmowy, eskalacje, wewnętrzne update'y — albo gdy wklejasz wątek i prosisz o odpowiedź. Nie wtrąca się w kampanie marketingowe, newslettery i sekwencje kroplowe; te pasy należą do dedykowanych skilli marketingowych.

DARMOWY PAKIET STARTOWY

Chcesz nasze najwyżej oceniane skille plus checklistę instalacyjną, której używamy przed każdym testem? Wyślemy ci mailem darmowy starter pack.

Odbierz darmowy starter pack

FAQ

Czy to pisze cold outreach i sekwencje marketingowe? Pisze pojedynczą cold prośbę — jednorazowy mail do profesora, Head of Ops, foundera — z limitem ≤120 słów i jednym CTA z datą. Wyraźnie nie robi kampanii kroplowych, newsletterów ani automatyzacji cyklu życia; to pasy marketingowe z własnymi skillami, i ten skill odmawia się na nie uruchamiać.

Sonnet już pisze czysty mail. Co właściwie dodaje skill? Kontrolę długości i łatwą do znalezienia prośbę. W naszym benchmarku baseline był już niemal bez lania wody, ale przekroczył limit słów w 10 z 12 szkiców i zakopał prośbę w kilku z nich. Skill obniżył średnią długość treści z 163 do 100 słów, dał realną datę każdemu CTA i podniósł pokrycie stanu faktycznego z 84% do 99% — zmierzone, nie zadeklarowane.

Czy 9/12 „odpowiem od razu” to wciąż porażka na 3 z nich? Tak, i to jest uczciwe odczytanie. Skill mniej więcej potroił wskaźnik „odpowiem od razu” (3 → 9), ale nie sprawił, że każdy szkic jest nieodparty, przegrał jedną ślepą ocenę i zremisował drugą. To warstwa dyscypliny, nie magia. Jeśli mail ma wysoką stawkę, skill daje ci zwięzły pierwszy szkic w kilka sekund — ostatnie czytanie i tak robisz sam.

Czemu tylko 12 scenariuszy? Bo każdy szkic był oceniany względem stanu faktycznego zamrożonego przed uruchomieniem obu wariantów — list pytań, limitów słów, skryptowego checkera mechanicznego i podrzuconych pułapek dla każdego scenariusza. Wolimy mały benchmark z prawdziwymi, powtarzalnymi sprawdzeniami niż duży, oceniany na wyczucie. Pełny protokół i wyniki dla każdego scenariusza są w repozytorium.

★ 9.6/10 × 3

Darmowy pakiet startowy

3 skille z naszymi najwyższymi ocenami z testów plus checklista instalacji — zestaw, który sami wgralibyśmy na świeżą maszynę. Za darmo, na e-mail.

Jeden e-mail z pakietem + krótki cotygodniowy przegląd nowych wyników testów. Wypiszesz się, kiedy chcesz.