A/B Test Analysis

Vyhodnocuje výsledky A/B testů z hlediska signifikance, velikosti vzorku a doporučení ship/stop.

od phuryn · phuryn/pm-skills

Funguje s nastavením ★ 6.8/10

A/B Test Analysis — Vyhodnocuje výsledky A/B testů z hlediska signifikance, velikosti vzorku a doporučení ship/stop.

Co umí

Analyzuje výsledky A/B testů se statistickou signifikancí, ověřením velikosti vzorku, intervaly spolehlivosti a doporučeními ship/extend/stop. Spouští se při vyhodnocování výsledků experimentu, kontrole, zda test dosáhl signifikance, interpretaci dat ze split testu, nebo rozhodování, zda nasadit variantu.

Testovací report

Doslovná instalace je čistá a spouštěcí rozsah je úzký, ale vzorec pro velikost vzorku v SKILL.md n=(Z^2*2*p*(1-p))/MDE^2 vynechává člen síly testu z_beta, takže podhodnocuje potřebné n zhruba 2x (~4 780 vs. ~10 350 návštěvníků na variantu v tomto případě) a razítkoval by jako v pořádku i skutečně podhodnocený test. Na A/B testu checkout CTA (8,20 % vs. 9,30 %, +13,4 % relativně) skill i holý základní agent nezávisle dospěli ke stejnému správnému čtení: p=0,0516 (na hraně, 95% CI -0,01pp až +2,21pp jen těsně přesahuje nulu), žádné SRM, test podhodnocený pro vlastní velikost efektu, a pokles guardrail metriky AOV o -2,66 % -> EXTEND, zatím nenasazovat. Skill nepřinesl žádnou statistickou přesnost ani lepší kvalitu rozhodnutí oproti základní variantě bez skillu.

Testováno: 2026-07-11 · Claude Code 2.x (agent harness)

Instalace

git clone https://github.com/phuryn/pm-skills
cd pm-skills
mkdir -p ~/.claude/skills
cp -r pm-data-analytics/skills/ab-test-analysis ~/.claude/skills/ab-test-analysis

Příkazy a ukázkové prompty

  • /ab-test-analysisVyhodnocuje výsledky A/B testů z hlediska signifikance, velikosti vzorku a doporučení ship/stop.

Skilly se spouštějí běžnými požadavky — žádné příkazy k zapamatování. Po instalaci ho aktivují prompty jako tyto (anglicky):

  • Check if this A/B test reached statistical significance
  • Analyze these split test results and recommend ship or stop
  • Validate the sample size on our pricing experiment