Backtesting Without Fooling Yourself
A step-by-step path from what your backtest really optimizes to proving an edge survives overfitting, multiple testing, and live execution. Read top to bottom — each part builds on the last.
- 01
Jun 28, 2026 #algotradingDesign der Zielfunktion: Die Metrik, die Sie optimieren, wählt heimlich Ihre Strategie
Um die 'beste' Strategie zu suchen, müssen Sie zuerst 'beste' definieren — und dieser Skalar wählt still den Gewinner. Auf synthetischen Daten mit bekanntem Edge (600 Seeds, T=2000, 80 Schwellenwerte) krönt ein naiver Per-Trade-Sharpe eine Lotterie: Er wählt in 56% der Seeds einen Gewinner mit unter 5% Exposure und entartet in 57% — beim extremsten Seed liefern 8 Trades einen In-Sample-Sharpe von 21.09, der Out-of-Sample auf 0.13 zusammenbricht. Die ehrliche Reparatur ist fast langweilig: Messung über die gesamte Zeitreihe, die nie entartet (Out-of-Sample 1.71). Ein Trade-Count-Shrinkage (conf_k) und ein Exposure-Floor können eine Per-Trade-Metrik nachrüsten, aber selbst vollständig repariert erreichen sie nur den vollständigen Zeitreihen-Sharpe (1.70 vs. 1.71) — nie darüber hinaus. Goodharts Gesetz, in einem Backtest, mit kontrollierter Ground Truth.
- 02
Jul 8, 2026 #AlgotradingDer Beweis gegen Look-Ahead in Multi-Timeframe-Backtests: Die Zukunft stören, um zu beweisen, dass die Vergangenheit sie nicht sehen kann
Multi-Timeframe-Backtests lassen die Zukunft durch eine sich noch bildende Bar eines höheren Zeitrahmens durchsickern, deren endgültiger Schlusskurs noch gar nicht existiert. Man kann sich Vertrauen nicht durch Code-Review erarbeiten — man muss es testen. Wir reproduzieren die Closed-Bar-Regel des Live-Bots exakt und beweisen dann die Abwesenheit von Leckage mit einer Shifted-Future-Probe: Wir stören jede zukünftige Bar und weisen nach, dass jedes vergangene Signal und jeder vergangene Trade bitgenau unverändert bleibt. 25 von 25 Paritäts-Checks bestanden, und die Probe hat Biss.
- 03
Mar 15, 2026 #algotradingWalk-Forward Optimization: The Only Honest Strategy Test
Why a single train/test split does not protect against overfitting, how walk-forward optimization systematically verifies parameter robustness, and why a strategy with +3342% PnL@ML on 21 parameters is a ticking time bomb without WFO.
- 04
Mar 12, 2026 #algotradingPlateau-Analyse: Wie man ein robustes Optimum von Overfitting unterscheidet
Warum das Finden der besten Strategieparameter nur die halbe Arbeit ist. Wie man visuell und quantitativ ein stabiles Plateau von einer fragilen Spitze unterscheidet, und warum Optuna-Konturdiagramme ein Pflichtschritt vor dem Produktivstart einer optimierten Strategie sind.
- 05
Mar 6, 2026 #algotradingMonte-Carlo-Bootstrap: Wie man in 10 Codezeilen Konfidenzintervalle für einen Backtest erhält
Warum eine Einzelpunktschätzung aus einem Backtest eine gefährliche Illusion ist. Wie Monte-Carlo-Bootstrap in 2 Sekunden Rechenzeit ein 95%-Konfidenzintervall für PnL und MaxDD liefert, und warum dies ein Pflichtschritt vor dem Livegang einer Strategie ist.
- 06
Jul 1, 2026 #algotradingDie Probability of Backtest Overfitting: Hat Ihre Suche einen Münzwurf geschlagen?
Der Deflated Sharpe Ratio bewertet die Gewinnerstrategie; PBO bewertet die Suche, die sie ausgewählt hat. Combinatorially Symmetric Cross-Validation führt C(16,8) = 12.870 Train/Test-Splits über eine 1000x200-Performance-Matrix durch und fragt: landet der In-Sample-Gewinner Out-of-Sample in der unteren Hälfte? Die Falle, die fast jeder übersieht — der Nullwert von PBO ist 0.5, nicht 1. Bei 200 Strategien ohne Edge bricht der beste In-Sample-annualisierte Sharpe von 1.98 Out-of-Sample auf 0.06 ein, und PBO = 0.476: ein Münzwurf, vollständig überangepasst. Pflanzen Sie einen echten Edge (annualisierter Sharpe 2.38), fällt PBO auf 0.001, und der In-Sample-Wert 3.73 übersteht Out-of-Sample als 2.34. Ein Moving-Average-Raster auf einem reinen Random Walk hat ebenfalls kein Out-of-Sample-Können — PBO 0.463 gemittelt über 60 Matrizen, statistisch nicht vom Nullwert unterscheidbar — und an einer repräsentativen Matrix ist die Illusion deutlich sichtbar: ein bester In-Sample-Sharpe von 2.33 bricht auf einen medianen Out-of-Sample-Wert von -0.22 ein, PBO 0.573, eine 63%ige Verlustwahrscheinlichkeit.
- 07
Jun 29, 2026 #algotradingDer Deflated Sharpe Ratio: Wie viele Ihrer Backtest-'Gewinner' überleben Multiple Testing?
Eine Parametersuche ist eine Maschine zur Herstellung von Glück. Auf reinem Rauschen — 1.000 Strategien ohne echten Edge — liegt der beste annualisierte Sharpe im Schnitt bei 1,63, und der naive Signifikanztest meldet in 100 % der Fälle eine Entdeckung. Wir bauen eine kontrollierte Ground Truth und zeigen, dass der Deflated Sharpe Ratio, der Harvey-Liu-Haircut und White's Reality Check Ehrlichkeit wiederherstellen: Falschentdeckungen sinken von 1,000 auf 0,001-0,057, echte Edges oberhalb der Rausch-Obergrenze werden mit einer Power von ~1 erkannt — und es gibt eine echte Falle (korrelierte Grids), bei der der rohe DSR über-deflatiert und das Urteil über ein ganzes Band von Schätzungen der effektiven Trials gelesen werden muss, nicht über eine einzige Zahl.
- 08
Mar 7, 2026 #algotradingBacktest-Live-Parität: warum dein Bot anders handelt als im Backtest
Vollständige Taxonomie der Abweichungen zwischen Backtesting und Live-Trading: von Slippage und Teilausführungen bis zur Desynchronisierung der Codebasis. Architekturmuster zur Erreichung von Parität, Python-Beispiele für ein gemeinsames Core-Modul und eine Checkliste für Produktions-Monitoring.
- 09
Jul 9, 2026 #algotradingDas ehrliche Negativergebnis: Zehntausende Backtests, fünf Majors, kein robuster Edge
Der Höhepunkt des Such-und-Overfit-Bogens, und er endet mit einem Negativergebnis — dem korrekten. Eine Einzelsymbol-Suche über zwei Zeitfenster auf ETHUSDT fand eine Konfiguration mit +16,35% out-of-sample und +2,62% auf einem unberührten Holdout; die Deflated Sharpe Ratio, die ~37.000 Trials berücksichtigt, deflationierte sie auf 0,00. Ein instrumentenübergreifender Durchlauf über fünf Majors (ETH/BTC/SOL/BNB/XRP, je ~1,18 Mio. 1m-Bars), ausgewählt nach dem Median out-of-sample, erledigt sie endgültig: Dual DSR 0,24 / PBO 0,264, Triple DSR 0,14 / PBO 0,327 — beide scheitern an den Gates. Der Champion ist auf 1 von 5 Symbolen profitabel und auf dem Rest negativ. Genau dafür ist der Anti-Overfit-Apparat da: um zu verhindern, dass man das Beste aus dem Rauschen als Alpha ausliefert.