A/B Test Analysis

Évalue les résultats de tests A/B en termes de significativité, taille d'échantillon, et recommandations de déploiement/arrêt.

par phuryn · phuryn/pm-skills

Fonctionne avec configuration ★ 6.8/10

A/B Test Analysis — Évalue les résultats de tests A/B en termes de significativité, taille d'échantillon, et recommandations de déploiement/arrêt.

Ce que fait

Analyse les résultats de tests A/B avec significativité statistique, validation de la taille d'échantillon, intervalles de confiance, et recommandations ship/extend/stop. À utiliser pour évaluer les résultats d'une expérience, vérifier si un test a atteint la significativité, interpréter des données de split test, ou décider s'il faut déployer une variante.

Rapport de test

L'installation telle quelle est propre et la portée de déclenchement est resserrée, mais la formule de taille d'échantillon du SKILL.md n=(Z^2*2*p*(1-p))/MDE^2 omet le terme de puissance z-bêta, donc elle sous-estime le n requis d'environ 2x (~4 780 vs ~10 350 visiteurs/bras ici) et validerait sans broncher un test réellement sous-dimensionné. Sur l'A/B du CTA de paiement (8,20 % vs 9,30 %, +13,4 % relatif), le skill et un agent de base sans skill sont arrivés indépendamment à la même lecture correcte : p=0,0516 (à la limite, IC à 95 % de -0,01pp à +2,21pp franchissant à peine zéro), pas de SRM, test sous-dimensionné pour son propre effet, et une baisse de garde-fou de l'AOV de -2,66 % -> EXTEND, ne pas déployer pour l'instant. Le skill n'a apporté aucune précision statistique ni qualité de décision supplémentaire par rapport à la baseline sans skill.

Testé le: 2026-07-11 · Claude Code 2.x (agent harness)

Installation

git clone https://github.com/phuryn/pm-skills
cd pm-skills
mkdir -p ~/.claude/skills
cp -r pm-data-analytics/skills/ab-test-analysis ~/.claude/skills/ab-test-analysis

Commandes et exemples de prompts

  • /ab-test-analysisÉvalue les résultats de tests A/B en termes de significativité, taille d'échantillon, et recommandations de déploiement/arrêt.

Les skills se déclenchent sur des demandes en langage courant — aucune commande à retenir. Après installation, des prompts comme ceux-ci l'activent (en anglais) :

  • Check if this A/B test reached statistical significance
  • Analyze these split test results and recommend ship or stop
  • Validate the sample size on our pricing experiment