A/B Test Analysis

Valuta i risultati di test A/B per significatività, dimensione del campione e raccomandazioni ship/stop.

di phuryn · phuryn/pm-skills

Richiede configurazione ★ 6.8/10

A/B Test Analysis — Valuta i risultati di test A/B per significatività, dimensione del campione e raccomandazioni ship/stop.

Cosa fa

Analizza i risultati di test A/B con significatività statistica, validazione della dimensione del campione, intervalli di confidenza e raccomandazioni ship/extend/stop. Da usare quando si valutano risultati di esperimenti, si verifica se un test ha raggiunto la significatività, si interpretano dati di split test, o si decide se rilasciare una variante.

Rapporto di test

L'installazione verbatim è pulita e la portata del trigger è mirata, ma la formula per la dimensione del campione in SKILL.md n=(Z^2*2*p*(1-p))/MDE^2 omette il termine di potenza z-beta, quindi sottostima la n richiesta di circa 2 volte (~4.780 contro ~10.350 visitatori/braccio in questo caso) e avallerebbe senza problemi un test genuinamente sottodimensionato. Sul A/B del CTA di checkout (8,20% contro 9,30%, +13,4% relativo), sia lo skill sia un agente base semplice sono arrivati indipendentemente alla stessa lettura corretta: p=0,0516 (borderline, IC 95% da -0,01pp a +2,21pp che sfiora appena lo zero), nessun SRM, test sottodimensionato per il proprio effetto, e un calo guardrail dell'AOV di -2,66% -> EXTEND, non rilasciare ancora. Lo skill non ha aggiunto alcuna accuratezza statistica o qualità decisionale rispetto alla baseline senza skill.

Testato il: 2026-07-11 · Claude Code 2.x (agent harness)

Installazione

git clone https://github.com/phuryn/pm-skills
cd pm-skills
mkdir -p ~/.claude/skills
cp -r pm-data-analytics/skills/ab-test-analysis ~/.claude/skills/ab-test-analysis

Comandi e prompt di esempio

  • /ab-test-analysisValuta i risultati di test A/B per significatività, dimensione del campione e raccomandazioni ship/stop.

Gli skill si attivano con richieste in linguaggio naturale, senza comandi da ricordare. Dopo l'installazione, prompt come questi lo attivano (in inglese):

  • Check if this A/B test reached statistical significance
  • Analyze these split test results and recommend ship or stop
  • Validate the sample size on our pricing experiment