A/B Test Analysis

Evalueert A/B-testresultaten op significantie, steekproefgrootte en ship/stop-aanbevelingen.

Door phuryn · phuryn/pm-skills

Werkt met setup ★ 6.8/10

A/B Test Analysis — Evalueert A/B-testresultaten op significantie, steekproefgrootte en ship/stop-aanbevelingen.

Wat het doet

Analyseert A/B-testresultaten met statistische significantie, validatie van de steekproefgrootte, betrouwbaarheidsintervallen en ship/extend/stop-aanbevelingen. Gebruik dit bij het evalueren van experimentresultaten, het controleren of een test significantie heeft bereikt, het interpreteren van split-testdata, of het beslissen of een variant live moet.

Testrapport

Verbatim installatie is schoon en het triggerbereik is strak afgebakend, maar de steekproefgrootteformule n=(Z^2*2*p*(1-p))/MDE^2 in SKILL.md laat de z-bèta-powerterm weg, waardoor de vereiste n met ruwweg een factor 2 wordt onderschat (~4.780 versus ~10.350 bezoekers/arm hier) en een daadwerkelijk underpowered test zou goedkeuren. Bij de checkout-CTA-A/B (8,20% versus 9,30%, +13,4% relatief) kwamen zowel de skill als een kale base-agent onafhankelijk van elkaar tot dezelfde correcte conclusie: p=0,0516 (grensgeval, 95%-BI -0,01pp tot +2,21pp kruist nul nipt), geen SRM, test underpowered voor zijn eigen effect, en een guardrail-AOV-daling van -2,66% -> EXTEND, nog niet shippen. De skill leverde geen statistische nauwkeurigheid of betere beslissingskwaliteit op ten opzichte van de baseline zonder skill.

Getest op: 2026-07-11 · Claude Code 2.x (agent harness)

Installatie

git clone https://github.com/phuryn/pm-skills
cd pm-skills
mkdir -p ~/.claude/skills
cp -r pm-data-analytics/skills/ab-test-analysis ~/.claude/skills/ab-test-analysis

Commando's en voorbeeldprompts

  • /ab-test-analysisEvalueert A/B-testresultaten op significantie, steekproefgrootte en ship/stop-aanbevelingen.

Skills reageren op gewone verzoeken — geen commando's om te onthouden. Na installatie activeren prompts zoals deze de skill (in het Engels):

  • Check if this A/B test reached statistical significance
  • Analyze these split test results and recommend ship or stop
  • Validate the sample size on our pricing experiment