A/B Test Analysis

Evalúa resultados de tests A/B en cuanto a significancia, tamaño de muestra y recomendaciones de lanzar/detener.

Por phuryn · phuryn/pm-skills

Funciona con configuración ★ 6.8/10

A/B Test Analysis — Evalúa resultados de tests A/B en cuanto a significancia, tamaño de muestra y recomendaciones de lanzar/detener.

Qué hace

Analiza resultados de tests A/B con significancia estadística, validación del tamaño de muestra, intervalos de confianza y recomendaciones de lanzar/extender/detener. Úsala al evaluar resultados de experimentos, comprobar si un test alcanzó significancia, interpretar datos de split test, o decidir si lanzar una variante.

Informe de la prueba

La instalación literal es limpia y el alcance de activación es preciso, pero la fórmula de tamaño de muestra del SKILL.md, n=(Z^2*2*p*(1-p))/MDE^2, omite el término de potencia z-beta, por lo que subestima la n requerida en aproximadamente 2x (~4,780 frente a ~10,350 visitantes/brazo en este caso) y validaría sin más un test realmente infrapotenciado. En el A/B del CTA de checkout (8.20% frente a 9.30%, +13.4% relativo), tanto la skill como un agente base sin skill llegaron de forma independiente a la misma lectura correcta: p=0.0516 (límite, IC del 95% -0.01pp a +2.21pp que apenas cruza el cero), sin SRM, test infrapotenciado para su propio efecto, y una caída de AOV de guardarraíl de -2.66% -> EXTEND, no lanzar todavía. La skill no aportó mayor precisión estadística ni mejor calidad de decisión sobre la línea base sin skill.

Probado el: 2026-07-11 · Claude Code 2.x (agent harness)

Instalación

git clone https://github.com/phuryn/pm-skills
cd pm-skills
mkdir -p ~/.claude/skills
cp -r pm-data-analytics/skills/ab-test-analysis ~/.claude/skills/ab-test-analysis

Comandos y prompts de ejemplo

  • /ab-test-analysisEvalúa resultados de tests A/B en cuanto a significancia, tamaño de muestra y recomendaciones de lanzar/detener.

Los skills se activan con peticiones en lenguaje natural, sin comandos que memorizar. Tras instalarlo, prompts como estos lo activan (en inglés):

  • Check if this A/B test reached statistical significance
  • Analyze these split test results and recommend ship or stop
  • Validate the sample size on our pricing experiment