A/B Test Analysis
Évalue les résultats de tests A/B en termes de significativité, taille d'échantillon, et recommandations de déploiement/arrêt.
Fonctionne avec configuration
Ce que fait
Analyse les résultats de tests A/B avec significativité statistique, validation de la taille d'échantillon, intervalles de confiance, et recommandations ship/extend/stop. À utiliser pour évaluer les résultats d'une expérience, vérifier si un test a atteint la significativité, interpréter des données de split test, ou décider s'il faut déployer une variante.
Rapport de test
L'installation telle quelle est propre et la portée de déclenchement est resserrée, mais la formule de taille d'échantillon du SKILL.md n=(Z^2*2*p*(1-p))/MDE^2 omet le terme de puissance z-bêta, donc elle sous-estime le n requis d'environ 2x (~4 780 vs ~10 350 visiteurs/bras ici) et validerait sans broncher un test réellement sous-dimensionné. Sur l'A/B du CTA de paiement (8,20 % vs 9,30 %, +13,4 % relatif), le skill et un agent de base sans skill sont arrivés indépendamment à la même lecture correcte : p=0,0516 (à la limite, IC à 95 % de -0,01pp à +2,21pp franchissant à peine zéro), pas de SRM, test sous-dimensionné pour son propre effet, et une baisse de garde-fou de l'AOV de -2,66 % -> EXTEND, ne pas déployer pour l'instant. Le skill n'a apporté aucune précision statistique ni qualité de décision supplémentaire par rapport à la baseline sans skill.
Testé le: 2026-07-11 · Claude Code 2.x (agent harness)
Installation
git clone https://github.com/phuryn/pm-skills cd pm-skills mkdir -p ~/.claude/skills cp -r pm-data-analytics/skills/ab-test-analysis ~/.claude/skills/ab-test-analysis
Commandes et exemples de prompts
/ab-test-analysisÉvalue les résultats de tests A/B en termes de significativité, taille d'échantillon, et recommandations de déploiement/arrêt.
Les skills se déclenchent sur des demandes en langage courant — aucune commande à retenir. Après installation, des prompts comme ceux-ci l'activent (en anglais) :
Check if this A/B test reached statistical significanceAnalyze these split test results and recommend ship or stopValidate the sample size on our pricing experiment