A/B Test Designer

Lover A/B-teststatistikk; teksten er en 230-ords generisk mal

av inbharatai · inbharatai/claude-skills

Tested · Didn't pass

A/B Test Designer — Lover A/B-teststatistikk; teksten er en 230-ords generisk mal

Hva den gjør

Annonsert som en ferdighet for å designe og analysere A/B-tester – utvalgsstørrelser, signifikantstesting, multiple sammenligninger og resultatfortolkning. I praksis inneholder SKILL.md-teksten ingen statistisk prosedyre, formel eller standard, kun boilerplate delt ordrett med de andre 182 ferdighetene i samme repository. Installeres rent, men legger ingenting til et A/B-testspørsmål.

Testrapport

Ga den et ekte eksperiment – 603/12 050 versus 683/11 980 – og spurte om det var signifikant og hvilken utvalgsstørrelse en 10% økning ville kreve. Uten ferdigheten kom svaret ut komplett: z = 2.400, p = 0.0164, 95% KI [+0.13pp, +1.27pp], omtrent 31 207 brukere per arm for 80% styrke, pluss SRM, sniktitting og vinnerens forbannelse-forbehold. Med ferdigheten var tallene identiske, fordi teksten ikke leverer noen test, ingen formel og ingen alfa- eller standardstyrke – dens faktiske instruksjoner er 'forstå hele konteksten', 'anvend beste praksis' og 'validere inndata før behandling'. Alle 183 SKILL.md-filer i dette repoet deler den samme 230-ords malen, utstedt av et `generate_skills.py`-skript som fortsatt peker til forfatterens Windows-skrivebord. Ordene 'p-value', 'power', 'confidence' og 'Bonferroni' vises ingen steder i filen.

Testet på: 2026-07-30 · Claude Code 2.x (agent harness)

Installer

git clone https://github.com/inbharatai/claude-skills.git
mkdir -p ~/.claude/skills
cd claude-skills && cp -r skills/ab-test-designer ~/.claude/skills/ab-test-designer

Kommandoer og eksempelprompter

  • /ab-test-designerLover A/B-teststatistikk; teksten er en 230-ords generisk mal

Skills utløses av vanlige forespørsler — ingen kommandoer å huske. Etter installasjonen aktiverer prompter som disse skillen (på engelsk):

  • Is my A/B test result significant? Control 603/12050, variant 683/11980
  • How many users per variant do I need for 80% power at a 10% lift?
  • We ran 5 variants, how do I correct the p-values for multiple comparisons?