A/B Test Analysis
Evalueert A/B-testresultaten op significantie, steekproefgrootte en ship/stop-aanbevelingen.
Werkt met setup
Wat het doet
Analyseert A/B-testresultaten met statistische significantie, validatie van de steekproefgrootte, betrouwbaarheidsintervallen en ship/extend/stop-aanbevelingen. Gebruik dit bij het evalueren van experimentresultaten, het controleren of een test significantie heeft bereikt, het interpreteren van split-testdata, of het beslissen of een variant live moet.
Testrapport
Verbatim installatie is schoon en het triggerbereik is strak afgebakend, maar de steekproefgrootteformule n=(Z^2*2*p*(1-p))/MDE^2 in SKILL.md laat de z-bèta-powerterm weg, waardoor de vereiste n met ruwweg een factor 2 wordt onderschat (~4.780 versus ~10.350 bezoekers/arm hier) en een daadwerkelijk underpowered test zou goedkeuren. Bij de checkout-CTA-A/B (8,20% versus 9,30%, +13,4% relatief) kwamen zowel de skill als een kale base-agent onafhankelijk van elkaar tot dezelfde correcte conclusie: p=0,0516 (grensgeval, 95%-BI -0,01pp tot +2,21pp kruist nul nipt), geen SRM, test underpowered voor zijn eigen effect, en een guardrail-AOV-daling van -2,66% -> EXTEND, nog niet shippen. De skill leverde geen statistische nauwkeurigheid of betere beslissingskwaliteit op ten opzichte van de baseline zonder skill.
Getest op: 2026-07-11 · Claude Code 2.x (agent harness)
Installatie
git clone https://github.com/phuryn/pm-skills cd pm-skills mkdir -p ~/.claude/skills cp -r pm-data-analytics/skills/ab-test-analysis ~/.claude/skills/ab-test-analysis
Commando's en voorbeeldprompts
/ab-test-analysisEvalueert A/B-testresultaten op significantie, steekproefgrootte en ship/stop-aanbevelingen.
Skills reageren op gewone verzoeken — geen commando's om te onthouden. Na installatie activeren prompts zoals deze de skill (in het Engels):
Check if this A/B test reached statistical significanceAnalyze these split test results and recommend ship or stopValidate the sample size on our pricing experiment