A/B Test Designer
Beloofd A/B-teststatistieken; inhoud is een generiek sjabloon van 230 woorden
Tested · Didn't pass
Wat het doet
Geadverteerd als een skill voor het ontwerpen en analyseren van A/B-tests - steekproefgroottes, significantietesten, meervoudige vergelijkingen en resultaatinterpretatie. In de praktijk bevat de SKILL.md body geen statistische procedure, formule of standaardwaarde, alleen boilerplate die woordelijk wordt gedeeld met de andere 182 skills in dezelfde repository. Installeert schoon maar voegt niets toe aan een A/B-testvraag.
Testrapport
Gaf het een echt experiment - 603/12.050 versus 683/11.980 - en vroeg of het significant was en welke steekproefgrootte een lift van 10% nodig zou hebben. Zonder de skill kwam het antwoord compleet: z = 2.400, p = 0.0164, 95% BI [+0.13pp, +1.27pp], ongeveer 31.207 gebruikers per arm voor 80% power, plus SRM, 'peeking' en 'winner's-curse' kanttekeningen. Met de skill waren de cijfers identiek, omdat de inhoud geen test, geen formule en geen alfa- of power-standaardwaarde levert - de feitelijke instructies zijn 'understand the full context', 'apply best practices' en 'validate inputs before processing'. Alle 183 SKILL.md-bestanden in deze repo delen hetzelfde 230-woord sjabloon, uitgegeven door een generate_skills.py-script dat nog steeds naar de Windows-desktop van de auteur wijst. De woorden 'p-value', 'power', 'confidence' en 'Bonferroni' komen nergens in het bestand voor.
Getest op: 2026-07-30 · Claude Code 2.x (agent harness)
Installatie
git clone https://github.com/inbharatai/claude-skills.git mkdir -p ~/.claude/skills cd claude-skills && cp -r skills/ab-test-designer ~/.claude/skills/ab-test-designer
Commando's en voorbeeldprompts
/ab-test-designerBeloofd A/B-teststatistieken; inhoud is een generiek sjabloon van 230 woorden
Skills reageren op gewone verzoeken — geen commando's om te onthouden. Na installatie activeren prompts zoals deze de skill (in het Engels):
Is my A/B test result significant? Control 603/12050, variant 683/11980How many users per variant do I need for 80% power at a 10% lift?We ran 5 variants, how do I correct the p-values for multiple comparisons?