A/B Test Analysis

Utvärderar A/B-testresultat för signifikans, stickprovsstorlek och ship/stop-rekommendationer.

av phuryn · phuryn/pm-skills

Fungerar med konfiguration ★ 6.8/10

A/B Test Analysis — Utvärderar A/B-testresultat för signifikans, stickprovsstorlek och ship/stop-rekommendationer.

Vad den gör

Analysera A/B-testresultat med statistisk signifikans, validering av stickprovsstorlek, konfidensintervall och ship/extend/stop-rekommendationer. Använd vid utvärdering av experimentresultat, kontroll av om ett test har nått signifikans, tolkning av split test-data, eller beslut om huruvida en variant ska lanseras.

Testrapport

Installation ord för ord är ren och triggeromfånget är snävt, men SKILL.md:s formel för stickprovsstorlek n=(Z^2*2*p*(1-p))/MDE^2 utelämnar z-beta-styrketermen, så den underskattar det nödvändiga n med ungefär hälften (~4 780 mot ~10 350 besökare/arm här) och skulle godkänna ett genuint underdimensionerat test. På CTA-A/B-testet i kassan (8,20 % mot 9,30 %, +13,4 % relativt) landade både skillen och en vanlig basagent oberoende av varandra i samma korrekta läsning: p=0,0516 (gränsfall, 95 % KI -0,01 pp till +2,21 pp som knappt korsar noll), ingen SRM, testet underdimensionerat för sin egen effekt, och en guardrail-AOV-nedgång på -2,66 % -> EXTEND, lansera inte ännu. Skillen tillförde ingen statistisk noggrannhet eller beslutskvalitet utöver den oassisterade baslinjen.

Testad: 2026-07-11 · Claude Code 2.x (agent harness)

Installation

git clone https://github.com/phuryn/pm-skills
cd pm-skills
mkdir -p ~/.claude/skills
cp -r pm-data-analytics/skills/ab-test-analysis ~/.claude/skills/ab-test-analysis

Kommandon och exempelprompter

  • /ab-test-analysisUtvärderar A/B-testresultat för signifikans, stickprovsstorlek och ship/stop-rekommendationer.

Skills triggas av vanliga förfrågningar — inga kommandon att memorera. Efter installationen aktiverar prompter som dessa skillen (på engelska):

  • Check if this A/B test reached statistical significance
  • Analyze these split test results and recommend ship or stop
  • Validate the sample size on our pricing experiment