A/B Test Analysis
Ocenia wyniki testów A/B pod kątem istotności statystycznej, wielkości próby i rekomendacji ship/stop.
Działa po konfiguracji
Co robi ten skill
Analizuje wyniki testów A/B pod kątem istotności statystycznej, walidacji wielkości próby, przedziałów ufności i rekomendacji ship/extend/stop. Używaj przy ocenie wyników eksperymentu, sprawdzaniu, czy test osiągnął istotność statystyczną, interpretowaniu danych ze split testu albo decydowaniu, czy wdrożyć wariant.
Raport z testu
Dosłowna instalacja jest czysta, a zakres wyzwalaczy wąski, ale wzór na wielkość próby w SKILL.md, n=(Z^2*2*p*(1-p))/MDE^2, pomija człon mocy testu z-beta, więc zaniża wymagane n o mniej więcej 2x (~4780 vs ~10350 odwiedzających na ramię w tym przypadku) i przepuściłby test faktycznie niedostatecznie mocny. Na teście A/B dla CTA w koszyku (8,20% vs 9,30%, +13,4% względnie), zarówno skill, jak i zwykły agent bazowy niezależnie doszły do tej samej poprawnej oceny: p=0,0516 (na granicy, 95% CI od -0,01 pp do +2,21 pp ledwo przekracza zero), brak SRM, test niedostatecznie mocny dla własnego efektu, oraz spadek zabezpieczający AOV o -2,66% -> EXTEND, nie wdrażać jeszcze. Skill nie dodał dokładności statystycznej ani lepszej jakości decyzji względem bazy bez skilla.
Testowano: 2026-07-11 · Claude Code 2.x (agent harness)
Instalacja
git clone https://github.com/phuryn/pm-skills cd pm-skills mkdir -p ~/.claude/skills cp -r pm-data-analytics/skills/ab-test-analysis ~/.claude/skills/ab-test-analysis
Komendy i przykładowe prompty
/ab-test-analysisOcenia wyniki testów A/B pod kątem istotności statystycznej, wielkości próby i rekomendacji ship/stop.
Skille uruchamiają się na zwykłe polecenia — bez komend do zapamiętania. Po instalacji aktywują go prompty takie jak te (po angielsku):
Check if this A/B test reached statistical significanceAnalyze these split test results and recommend ship or stopValidate the sample size on our pricing experiment