A/B Test Analysis

Evaluerer A/B-testresultater for signifikans, stikprøvestørrelse og ship/stop-anbefalinger.

Af phuryn · phuryn/pm-skills

Virker med opsætning ★ 6.8/10

A/B Test Analysis — Evaluerer A/B-testresultater for signifikans, stikprøvestørrelse og ship/stop-anbefalinger.

Hvad det gør

Analyserer A/B-testresultater med statistisk signifikans, validering af stikprøvestørrelse, konfidensintervaller og ship/extend/stop-anbefalinger. Brug det, når du evaluerer eksperimentresultater, tjekker om en test har opnået signifikans, fortolker split test-data eller beslutter, om en variant skal ship'es.

Testrapport

Verbatim-installation er ren, og trigger-omfanget er snævert, men SKILL.md's formel for stikprøvestørrelse n=(Z^2*2*p*(1-p))/MDE^2 udelader z-beta-power-leddet, så den undervurderer det krævede n med cirka det halve (~4.780 mod ~10.350 besøgende/arm her) og ville stemple en reelt underdimensioneret test som godkendt. På checkout-CTA A/B-testen (8,20 % mod 9,30 %, +13,4 % relativt) landede både skillet og en almindelig base-agent uafhængigt af hinanden på den samme korrekte konklusion: p=0,0516 (grænsetilfælde, 95 % KI -0,01pp til +2,21pp, der lige akkurat krydser nul), ingen SRM, testen er underdimensioneret i forhold til sin egen effekt, samt et guardrail-AOV-fald på -2,66 % -> EXTEND, ikke ship endnu. Skillet tilføjede ingen statistisk nøjagtighed eller beslutningskvalitet i forhold til baseline uden skill.

Testet: 2026-07-11 · Claude Code 2.x (agent harness)

Installation

git clone https://github.com/phuryn/pm-skills
cd pm-skills
mkdir -p ~/.claude/skills
cp -r pm-data-analytics/skills/ab-test-analysis ~/.claude/skills/ab-test-analysis

Kommandoer og eksempelprompter

  • /ab-test-analysisEvaluerer A/B-testresultater for signifikans, stikprøvestørrelse og ship/stop-anbefalinger.

Skills udløses af almindelige forespørgsler — ingen kommandoer at huske. Efter installationen aktiverer prompter som disse skillen (på engelsk):

  • Check if this A/B test reached statistical significance
  • Analyze these split test results and recommend ship or stop
  • Validate the sample size on our pricing experiment