A/B Test Analysis
Evaluerer A/B-testresultater for signifikans, utvalgsstørrelse, og ship/stop-anbefalinger.
Krever oppsett
Hva den gjør
Analyserer A/B-testresultater med statistisk signifikans, validering av utvalgsstørrelse, konfidensintervaller, og ship/extend/stop-anbefalinger. Brukes ved evaluering av eksperimentresultater, sjekk av om en test har nådd signifikans, tolkning av split test-data, eller avgjørelse av om en variant skal shippes.
Testrapport
Verbatim-installasjon er ren, og triggeromfanget er stramt, men SKILL.md sin utvalgsstørrelse-formel n=(Z^2*2*p*(1-p))/MDE^2 utelater z-beta-styrkeleddet, så den underdriver nødvendig n med rundt 2x (~4,780 mot ~10,350 besøkende/arm her) og ville gitt godkjent-stempel til en reelt underdimensjonert test. På checkout-CTA-A/B-en (8.20% mot 9.30%, +13.4% relativ), landet både skillen og en ren base-agent uavhengig av hverandre på samme korrekte lesning: p=0.0516 (grensetilfelle, 95% CI -0.01pp til +2.21pp som så vidt krysser null), ingen SRM, test underdimensjonert for sin egen effekt, og et guardrail-AOV-fall på -2.66% -> EXTEND, ikke ship ennå. Skillen ga ingen statistisk nøyaktighet eller beslutningskvalitet utover den uskillede baselinen.
Testet på: 2026-07-11 · Claude Code 2.x (agent harness)
Installer
git clone https://github.com/phuryn/pm-skills cd pm-skills mkdir -p ~/.claude/skills cp -r pm-data-analytics/skills/ab-test-analysis ~/.claude/skills/ab-test-analysis
Kommandoer og eksempelprompter
/ab-test-analysisEvaluerer A/B-testresultater for signifikans, utvalgsstørrelse, og ship/stop-anbefalinger.
Skills utløses av vanlige forespørsler — ingen kommandoer å huske. Etter installasjonen aktiverer prompter som disse skillen (på engelsk):
Check if this A/B test reached statistical significanceAnalyze these split test results and recommend ship or stopValidate the sample size on our pricing experiment