A/B Test Analysis
Valuta i risultati di test A/B per significatività, dimensione del campione e raccomandazioni ship/stop.
Richiede configurazione
Cosa fa
Analizza i risultati di test A/B con significatività statistica, validazione della dimensione del campione, intervalli di confidenza e raccomandazioni ship/extend/stop. Da usare quando si valutano risultati di esperimenti, si verifica se un test ha raggiunto la significatività, si interpretano dati di split test, o si decide se rilasciare una variante.
Rapporto di test
L'installazione verbatim è pulita e la portata del trigger è mirata, ma la formula per la dimensione del campione in SKILL.md n=(Z^2*2*p*(1-p))/MDE^2 omette il termine di potenza z-beta, quindi sottostima la n richiesta di circa 2 volte (~4.780 contro ~10.350 visitatori/braccio in questo caso) e avallerebbe senza problemi un test genuinamente sottodimensionato. Sul A/B del CTA di checkout (8,20% contro 9,30%, +13,4% relativo), sia lo skill sia un agente base semplice sono arrivati indipendentemente alla stessa lettura corretta: p=0,0516 (borderline, IC 95% da -0,01pp a +2,21pp che sfiora appena lo zero), nessun SRM, test sottodimensionato per il proprio effetto, e un calo guardrail dell'AOV di -2,66% -> EXTEND, non rilasciare ancora. Lo skill non ha aggiunto alcuna accuratezza statistica o qualità decisionale rispetto alla baseline senza skill.
Testato il: 2026-07-11 · Claude Code 2.x (agent harness)
Installazione
git clone https://github.com/phuryn/pm-skills cd pm-skills mkdir -p ~/.claude/skills cp -r pm-data-analytics/skills/ab-test-analysis ~/.claude/skills/ab-test-analysis
Comandi e prompt di esempio
/ab-test-analysisValuta i risultati di test A/B per significatività, dimensione del campione e raccomandazioni ship/stop.
Gli skill si attivano con richieste in linguaggio naturale, senza comandi da ricordare. Dopo l'installazione, prompt come questi lo attivano (in inglese):
Check if this A/B test reached statistical significanceAnalyze these split test results and recommend ship or stopValidate the sample size on our pricing experiment