A/B Test Designer
Promet des statistiques de test A/B ; le corps est un modèle générique de 230 mots
Tested · Didn't pass
Ce que fait
Annoncée comme une compétence pour concevoir et analyser des tests A/B - tailles d'échantillon, tests de signification, comparaisons multiples et interprétation des résultats. En pratique, le corps de SKILL.md ne contient aucune procédure statistique, formule ou valeur par défaut, seulement du boilerplate partagé textuellement avec les 182 autres compétences du même dépôt. S'installe proprement mais n'ajoute rien à une question de test A/B.
Rapport de test
Lui a donné une expérience réelle - 603/12 050 contre 683/11 980 - et a demandé si c'était significatif et quelle taille d'échantillon un gain de 10% nécessiterait. Sans la compétence, la réponse était complète : z = 2,400, p = 0,0164, IC à 95% [+0,13pp, +1,27pp], environ 31 207 utilisateurs par bras pour une puissance de 80%, plus les mises en garde SRM, peeking et winner's-curse. Avec la compétence, les chiffres étaient identiques, car le corps ne fournit aucun test, aucune formule et aucune valeur par défaut alpha ou de puissance - ses instructions réelles sont 'comprendre le contexte complet', 'appliquer les meilleures pratiques' et 'valider les entrées avant le traitement'. Les 183 fichiers SKILL.md de ce dépôt partagent le même modèle de 230 mots, émis par un script generate_skills.py pointant toujours vers le bureau Windows de l'auteur. Les mots 'p-value', 'power', 'confidence' et 'Bonferroni' n'apparaissent nulle part dans le fichier.
Testé le: 2026-07-30 · Claude Code 2.x (agent harness)
Installation
git clone https://github.com/inbharatai/claude-skills.git mkdir -p ~/.claude/skills cd claude-skills && cp -r skills/ab-test-designer ~/.claude/skills/ab-test-designer
Commandes et exemples de prompts
/ab-test-designerPromet des statistiques de test A/B ; le corps est un modèle générique de 230 mots
Les skills se déclenchent sur des demandes en langage courant — aucune commande à retenir. Après installation, des prompts comme ceux-ci l'activent (en anglais) :
Is my A/B test result significant? Control 603/12050, variant 683/11980How many users per variant do I need for 80% power at a 10% lift?We ran 5 variants, how do I correct the p-values for multiple comparisons?