A/B Test Analysis

Evaluerer A/B-testresultater for signifikans, utvalgsstørrelse, og ship/stop-anbefalinger.

av phuryn · phuryn/pm-skills

Krever oppsett ★ 6.8/10

A/B Test Analysis — Evaluerer A/B-testresultater for signifikans, utvalgsstørrelse, og ship/stop-anbefalinger.

Hva den gjør

Analyserer A/B-testresultater med statistisk signifikans, validering av utvalgsstørrelse, konfidensintervaller, og ship/extend/stop-anbefalinger. Brukes ved evaluering av eksperimentresultater, sjekk av om en test har nådd signifikans, tolkning av split test-data, eller avgjørelse av om en variant skal shippes.

Testrapport

Verbatim-installasjon er ren, og triggeromfanget er stramt, men SKILL.md sin utvalgsstørrelse-formel n=(Z^2*2*p*(1-p))/MDE^2 utelater z-beta-styrkeleddet, så den underdriver nødvendig n med rundt 2x (~4,780 mot ~10,350 besøkende/arm her) og ville gitt godkjent-stempel til en reelt underdimensjonert test. På checkout-CTA-A/B-en (8.20% mot 9.30%, +13.4% relativ), landet både skillen og en ren base-agent uavhengig av hverandre på samme korrekte lesning: p=0.0516 (grensetilfelle, 95% CI -0.01pp til +2.21pp som så vidt krysser null), ingen SRM, test underdimensjonert for sin egen effekt, og et guardrail-AOV-fall på -2.66% -> EXTEND, ikke ship ennå. Skillen ga ingen statistisk nøyaktighet eller beslutningskvalitet utover den uskillede baselinen.

Testet på: 2026-07-11 · Claude Code 2.x (agent harness)

Installer

git clone https://github.com/phuryn/pm-skills
cd pm-skills
mkdir -p ~/.claude/skills
cp -r pm-data-analytics/skills/ab-test-analysis ~/.claude/skills/ab-test-analysis

Kommandoer og eksempelprompter

  • /ab-test-analysisEvaluerer A/B-testresultater for signifikans, utvalgsstørrelse, og ship/stop-anbefalinger.

Skills utløses av vanlige forespørsler — ingen kommandoer å huske. Etter installasjonen aktiverer prompter som disse skillen (på engelsk):

  • Check if this A/B test reached statistical significance
  • Analyze these split test results and recommend ship or stop
  • Validate the sample size on our pricing experiment