A/B Test Analysis
Utvärderar A/B-testresultat för signifikans, stickprovsstorlek och ship/stop-rekommendationer.
Fungerar med konfiguration
Vad den gör
Analysera A/B-testresultat med statistisk signifikans, validering av stickprovsstorlek, konfidensintervall och ship/extend/stop-rekommendationer. Använd vid utvärdering av experimentresultat, kontroll av om ett test har nått signifikans, tolkning av split test-data, eller beslut om huruvida en variant ska lanseras.
Testrapport
Installation ord för ord är ren och triggeromfånget är snävt, men SKILL.md:s formel för stickprovsstorlek n=(Z^2*2*p*(1-p))/MDE^2 utelämnar z-beta-styrketermen, så den underskattar det nödvändiga n med ungefär hälften (~4 780 mot ~10 350 besökare/arm här) och skulle godkänna ett genuint underdimensionerat test. På CTA-A/B-testet i kassan (8,20 % mot 9,30 %, +13,4 % relativt) landade både skillen och en vanlig basagent oberoende av varandra i samma korrekta läsning: p=0,0516 (gränsfall, 95 % KI -0,01 pp till +2,21 pp som knappt korsar noll), ingen SRM, testet underdimensionerat för sin egen effekt, och en guardrail-AOV-nedgång på -2,66 % -> EXTEND, lansera inte ännu. Skillen tillförde ingen statistisk noggrannhet eller beslutskvalitet utöver den oassisterade baslinjen.
Testad: 2026-07-11 · Claude Code 2.x (agent harness)
Installation
git clone https://github.com/phuryn/pm-skills cd pm-skills mkdir -p ~/.claude/skills cp -r pm-data-analytics/skills/ab-test-analysis ~/.claude/skills/ab-test-analysis
Kommandon och exempelprompter
/ab-test-analysisUtvärderar A/B-testresultat för signifikans, stickprovsstorlek och ship/stop-rekommendationer.
Skills triggas av vanliga förfrågningar — inga kommandon att memorera. Efter installationen aktiverar prompter som dessa skillen (på engelska):
Check if this A/B test reached statistical significanceAnalyze these split test results and recommend ship or stopValidate the sample size on our pricing experiment