Walk-Forward Leakage Auditor

Controleert tijdreeks-backtests op 'leakage' voordat u de Sharpe vertrouwt

Door mospira · mospira/walkforward-audit

Getest · Werkt ★ 9.6/10

Walk-Forward Leakage Auditor — Controleert tijdreeks-backtests op 'leakage' voordat u de Sharpe vertrouwt

Wat het doet

Een gestructureerde audit-checklist voor tijdgebaseerde machine learning-evaluaties: walk-forward backtests, rolling retraining, forecasting pipelines en elke chronologische train/test-split. Het laat de agent het voorspellingstijdcontract opstellen, gegevens traceren van ruwe inputs via features, labels, splits en gefitte transformaties, en vervolgens benoemde 'red-flag'-lijsten doorlopen voor split-logica, feature-timing, transform-scope, labelconstructie, simulatierealisme en experimentvergelijkbaarheid. Activeert wanneer u vraagt om backtest-, rolling-CV- of forecasting-code te beoordelen of te wijzigen.

Testrapport

Voerde de audit 'head to head' uit op een 140-regelige 'walk-forward equity backtest' gebouwd op een 'seeded random walk', dus het eerlijke antwoord was van tevoren bekend: er zit geen signaal in de data. Het niet-geauditeerde script rapporteerde een out-of-sample AUC van 0.636 en Sharpe van 2.00 en concludeerde 'ship it'; een normale review zonder checklist ving de 'forward-return' kolom in de feature matrix, de 'full-sample z-score' en de scaler die vóór de split was gefit, wat het naar AUC 0.531 en Sharpe 1.05 bracht — nog steeds een 'ship'-beslissing. Het sectie voor sectie doorlopen van de SKILL.md checklist ving bovendien de ontbrekende vijfdaagse embargo tussen train en test, een merge_asof met direction=forward op een macroserie die drie weken na het einde van de periode werd gepubliceerd, een instapdrempel afgestemd op de test Sharpe, en een benchmark berekend over een ander datumbereik en kapitaalbasis; na die fixes daalde de AUC naar 0.511 en verloor de strategie van 'buy-and-hold' op het gematchte venster, wat de go/no-go conclusie omkeerde. Een faalbare guard geschreven per de skill's step 4 faalt op zowel het originele als het baseline-gefixte bestand en slaagt alleen op het volledig geauditeerde bestand. De repo's eigen uitgewerkte voorbeelden reproduceren precies — 428.6 vs 873.7 MAE, overeenkomend met de nummers afgedrukt in EXAMPLE.md.

Getest op: 2026-07-30 · Claude Code 2.x (agent harness)

Installatie

git clone https://github.com/mospira/walkforward-audit.git
mkdir -p ~/.claude/skills/walk-forward-leakage-auditor
cd walkforward-audit && cp SKILL.md ~/.claude/skills/walk-forward-leakage-auditor/SKILL.md

Commando's en voorbeeldprompts

  • /walk-forward-leakage-auditorControleert tijdreeks-backtests op 'leakage' voordat u de Sharpe vertrouwt

Skills reageren op gewone verzoeken — geen commando's om te onthouden. Na installatie activeren prompts zoals deze de skill (in het Engels):

  • Review my walk-forward backtest before I trust this Sharpe ratio
  • My forecasting model scores 0.95 AUC in backtest but fails live, what's wrong
  • I'm adding rolling retraining to this pipeline, check the split logic