A/B Test Analysis
Evaluerer A/B-testresultater for signifikans, stikprøvestørrelse og ship/stop-anbefalinger.
Virker med opsætning
Hvad det gør
Analyserer A/B-testresultater med statistisk signifikans, validering af stikprøvestørrelse, konfidensintervaller og ship/extend/stop-anbefalinger. Brug det, når du evaluerer eksperimentresultater, tjekker om en test har opnået signifikans, fortolker split test-data eller beslutter, om en variant skal ship'es.
Testrapport
Verbatim-installation er ren, og trigger-omfanget er snævert, men SKILL.md's formel for stikprøvestørrelse n=(Z^2*2*p*(1-p))/MDE^2 udelader z-beta-power-leddet, så den undervurderer det krævede n med cirka det halve (~4.780 mod ~10.350 besøgende/arm her) og ville stemple en reelt underdimensioneret test som godkendt. På checkout-CTA A/B-testen (8,20 % mod 9,30 %, +13,4 % relativt) landede både skillet og en almindelig base-agent uafhængigt af hinanden på den samme korrekte konklusion: p=0,0516 (grænsetilfælde, 95 % KI -0,01pp til +2,21pp, der lige akkurat krydser nul), ingen SRM, testen er underdimensioneret i forhold til sin egen effekt, samt et guardrail-AOV-fald på -2,66 % -> EXTEND, ikke ship endnu. Skillet tilføjede ingen statistisk nøjagtighed eller beslutningskvalitet i forhold til baseline uden skill.
Testet: 2026-07-11 · Claude Code 2.x (agent harness)
Installation
git clone https://github.com/phuryn/pm-skills cd pm-skills mkdir -p ~/.claude/skills cp -r pm-data-analytics/skills/ab-test-analysis ~/.claude/skills/ab-test-analysis
Kommandoer og eksempelprompter
/ab-test-analysisEvaluerer A/B-testresultater for signifikans, stikprøvestørrelse og ship/stop-anbefalinger.
Skills udløses af almindelige forespørgsler — ingen kommandoer at huske. Efter installationen aktiverer prompter som disse skillen (på engelsk):
Check if this A/B test reached statistical significanceAnalyze these split test results and recommend ship or stopValidate the sample size on our pricing experiment