A/B Test Analysis
Bewertet A/B-Testergebnisse auf Signifikanz, Stichprobengröße und Ship-/Stop-Empfehlungen.
Funktioniert mit Setup
Was es kann
Analysiert A/B-Testergebnisse hinsichtlich statistischer Signifikanz, Validierung der Stichprobengröße, Konfidenzintervallen und Ship-/Extend-/Stop-Empfehlungen. Einsetzen bei der Auswertung von Experimentergebnissen, beim Prüfen, ob ein Test Signifikanz erreicht hat, beim Interpretieren von Split-Test-Daten oder bei der Entscheidung, ob eine Variante ausgerollt werden soll.
Testbericht
Die wortgetreue Installation ist sauber, und der Trigger-Umfang ist eng gefasst, aber die Stichprobengrößen-Formel n=(Z^2*2*p*(1-p))/MDE^2 in der SKILL.md lässt den Z-Beta-Power-Term aus und unterschätzt damit die nötige Stichprobengröße n um etwa das Doppelte (~4.780 statt ~10.350 Besucher/Arm hier) — sie würde einen tatsächlich unterdimensionierten Test abnicken. Beim Checkout-CTA-A/B-Test (8,20 % vs. 9,30 %, +13,4 % relativ) kamen sowohl der Skill als auch ein einfacher Basis-Agent unabhängig voneinander zum selben korrekten Ergebnis: p=0,0516 (grenzwertig, 95-%-KI von -0,01 pp bis +2,21 pp, das die Null nur knapp überschreitet), kein SRM, der Test ist für seinen eigenen Effekt unterdimensioniert, plus ein Guardrail-AOV-Rückgang von -2,66 % -> EXTEND, noch nicht ausrollen. Der Skill brachte gegenüber der ungeführten Baseline keine bessere statistische Genauigkeit oder Entscheidungsqualität.
Getestet am: 2026-07-11 · Claude Code 2.x (agent harness)
Installation
git clone https://github.com/phuryn/pm-skills cd pm-skills mkdir -p ~/.claude/skills cp -r pm-data-analytics/skills/ab-test-analysis ~/.claude/skills/ab-test-analysis
Befehle & Beispiel-Prompts
/ab-test-analysisBewertet A/B-Testergebnisse auf Signifikanz, Stichprobengröße und Ship-/Stop-Empfehlungen.
Skills reagieren auf normale Anfragen — keine Slash-Befehle nötig. Nach der Installation aktivieren Prompts wie diese den Skill (auf Englisch):
Check if this A/B test reached statistical significanceAnalyze these split test results and recommend ship or stopValidate the sample size on our pricing experiment