Ein Backtest ist die überzeugendste Lüge im Trading. Die Equity-Kurve verläuft schön nach oben rechts, die Trefferquote wirkt gesund, und die Drawdowns fühlen sich überschaubar an. Dann handelt man live, und der Edge verschwindet unauffällig. Das ist kein Pech. Backtests überschätzen die Live-Performance auf systematische, vorhersehbare Weise, und sobald man die Fehlerquellen kennt, wird man von ihnen nicht mehr überrascht.
Dieser Beitrag setzt voraus, dass Sie bereits wissen, wie man einen Backtest durchführt. Falls nicht, beginnen Sie mit dem begleitenden Leitfaden wie man eine Handelsstrategie backtestet, der die Mechanik, die Stichprobengröße und das Forward-Testing behandelt. Hier gehen wir einer schwierigeren Frage tiefer nach: warum die Zahl, die ein Backtest liefert, fast immer besser ist als die Zahl, die man tatsächlich erzielen wird.
Ein Backtest ist ein bester Fall, keine Schätzung
Das Kernproblem ist, dass ein Backtest keine neutrale Messung ist. Er ist das Ergebnis eines Prozesses, bei dem Sie Dutzende kleine Entscheidungen getroffen haben, und jede dieser Entscheidungen hatte die Gelegenheit, Optimismus in das Ergebnis einfließen zu lassen. Sie haben den Markt, den Zeitraum, den Indikator, die Parameter, den Ausstieg gewählt. Jede Entscheidung wurde mit einem gewissen Wissen darüber getroffen, was funktioniert hat. Dieses Wissen ist die Kontamination.
Statistisch gesehen ist das Ergebnis, das Sie behalten, keine zufällige Stichprobe aus der Verteilung möglicher Ergebnisse. Es ist das Maximum vieler verrauschter Stichproben. Wenn Sie das Beste von hundert Dingen auswählen, messen Sie nicht Können, sondern das obere Ende der Glücksverteilung. Was folgt, ist ein Katalog der Mechanismen, die diese Aufwärtsverzerrung erzeugen.
Fünf Wege, wie ein Backtest die Live-Performance überschätzt
| Verzerrung | Wie sie das Ergebnis aufbläht | Wie man sie erkennt | Lösung |
|---|---|---|---|
| Survivorship | Testet nur Assets, die bis heute überlebt haben | Prüfen, ob das Universum zeitpunktgenau (point-in-time) ist | Datensatz mit Delisting-Einbeziehung verwenden |
| Look-Ahead | Verwendet Daten, die zum Handelszeitpunkt noch nicht bekannt waren | Jedes Signal bis zu seinem Zeitstempel zurückverfolgen | Daten verzögern; auf der nächsten Kerze ausführen |
| Overfitting | Bestes von vielen optimierten Läufen sieht nur durch Glück gut aus | Parameter und Testläufe zählen | Weniger Parameter; Out-of-Sample-Test |
| Kostenblindheit | Ignoriert Spread, Slippage, Kommission | Alles unter Berücksichtigung realer Kosten neu berechnen | Roundtrip-Kosten pro Trade modellieren |
| Regimeabhängigkeit | Kodiert eine Marktära als Marktgesetz | Beachten Sie das getestete Zins- und Volatilitätsregime | Über Bullen-, Bären- und Hochvolatilitätsphasen testen |
Die fünf Arten, wie die Zahl lügt
1. Survivorship-Bias: Sie haben nur die Gewinner getestet
Angenommen, Sie backtesten eine einfache Idee: Kaufen Sie den Dip bei S&P-500-Aktien. Sie ziehen die heutigen Indexmitglieder, laden deren Kurshistorie herunter und simulieren den Kauf bei jedem 10%-Drawdown. Die Ergebnisse sind hervorragend, weil die Strategie so aussieht, als würde sie sich immer erholen. Das stimmt nicht. Es sieht nur so aus, weil jedes Unternehmen in Ihrem Test bis heute überlebt hat, um im Index zu sein.
Der S&P 500 tauscht pro Jahr etwa 20 bis 25 Unternehmen aus. Über einen 20-jährigen Backtest sind das mehrere hundert Änderungen der Indexbestandteile, die Sie nie sehen. Ihr Test hat nie den Dip bei Lehman Brothers, Bear Stearns, Enron oder Washington Mutual gekauft, weil diese abstürzten und weiter fielen, bis sie delistet und aus dem Index entfernt wurden. Die Strategie wurde nie den Verlierern ausgesetzt. Die Schlussfolgerung, dass "Dips sich immer erholen", wurde durch die Konstruktion des Universums vorgegeben, nicht in den Daten entdeckt. Zeitpunktgenaue Daten, die delistete Namen einschließen, sind die einzige ehrliche Lösung.
2. Look-Ahead-Bias: Verwendung von Informationen, die Sie nicht hatten
Look-Ahead-Bias bedeutet, dass Ihre Simulation Informationen verwendet hat, die zum Zeitpunkt des Trades nicht verfügbar waren. Die subtile, häufige Variante ist ein Timing-Fehler. Angenommen, Ihre Regel lautet "kaufe, wenn der Tagesschlusskurs über den 50-Tage-gleitenden Durchschnitt kreuzt", und Ihr Backtest führt diesen Kauf zum Schlusskurs desselben Tages aus. In der Realität können Sie den Schlusskurs erst kennen, wenn die Sitzung vorbei ist, und bis dahin ist der einzige Kurs, zu dem Sie handeln können, die nächste Eröffnung, die gegen Sie klaffen könnte. Die Ausführung zum Signalkurs statt zum nächsten verfügbaren Kurs kann einen Edge erzeugen, der nicht existiert.
Die andere klassische Variante sind neu ausgewiesene Daten. Unternehmensgewinne werden revidiert. Wenn Ihr Backtest die endgültige, revidierte EPS-Zahl verwendet, die heute in der Datenbank steht, handelt er mit Zahlen, die am Handelstag nicht bekannt waren, als nur die erstmals gemeldete Zahl existierte. Die Regel ist einfach zu formulieren und leicht zu verletzen: Jeder Input muss auf das verzögert werden, was zu diesem Zeitstempel bekannt sein konnte.
3. Overfitting und die Falle der multiplen Vergleiche
Der Mechanik-Leitfaden behandelt grundlegendes Curve-Fitting. Das tiefere Problem ist statistischer Natur. Wenn Sie 200 Parameterkombinationen testen und jede an einer 5%-Signifikanzschwelle beurteilen, werden etwa 10 davon rein durch Zufall "signifikant" aussehen, selbst wenn keine einen echten Edge hat. Den am besten aussehenden Lauf auszuwählen bedeutet nicht, den guten zu finden. Es bedeutet, den glücklichsten zu finden.
Eine Strategie mit 12 optimierten Parametern hat genug Freiheitsgrade, um sich fast jeder vergangenen Kursreihe anzupassen. Sie hat keine Regel über Märkte gelernt, sondern das spezifische Rauschen Ihrer Stichprobe auswendig gelernt. Die ehrliche Faustregel folgt direkt daraus: Je mehr Parameter Sie optimiert haben und je mehr Kombinationen Sie ausprobiert haben, desto größer sollte der Abschlag sein, den Sie auf das Ergebnis anwenden. Ein sauberes Drei-Parameter-System, das einmal getestet wurde, verdient mehr Vertrauen als ein Zwölf-Parameter-System, das der Gewinner einer Tausend-Läufe-Optimierung war.
4. Transaktionskostenblindheit
Spreads, Slippage und Kommissionen werden pro Trade berechnet, sodass sie sich mit der Häufigkeit summieren. Ein Backtest, der von null Kosten ausgeht, modelliert nicht Ihre Strategie, sondern eine Fantasieversion, die kostenlos handelt. Betrachten Sie ein kurzfristiges System mit einem dünnen Brutto-Edge von 0,10% pro Round-Trip-Trade und realistischen Round-Trip-Kosten von 0,12%, sobald Sie Spread, Slippage und Kommission hinzurechnen. Das Diagramm unten zeigt die Bruttorendite im Vergleich zur Nettorendite bei steigender Anzahl von Trades, unter Verwendung einfacher summierter Renditen zur Verdeutlichung.
Gleiche Strategie, brutto vs. netto: ein dünner Edge, den Kosten auffressen
Sehen Sie, was passiert. Bei 1.000 Trades pro Jahr zeigt der Brutto-Backtest eine spektakuläre Rendite von 100%, während das reale, kostenbereinigte Ergebnis bei minus 20% liegt. Je mehr diese Strategie handelt, desto besser sieht der Backtest aus und desto mehr echtes Geld verliert sie, weil der Edge pro Trade die Kosten pro Trade nie überlebt hat. Deshalb kann dasselbe verführerische Hochfrequenzsystem mit 40% Brutto netto deutlich negativ sein. Kosten verzerren auch unauffällig die Risiko-Rendite-Verhältnisse, die ein Backtest ausweist, da jeder gezahlte Spread die reale Rendite bei jedem Gewinner schmälert.
5. Regimeabhängigkeit
Eine von 2010 bis 2021 zurückgetestete Strategie wurde fast ausschließlich innerhalb eines einzigen Marktregimes getestet: Nullzinsen, quantitative Lockerung, niedrige Volatilität und der längste Bullenmarkt der Geschichte. In dieser Welt erholten sich Dips und Trends hielten an, sodass ein Mean-Reversion- oder Trendfolge-System, das diese Verhaltensweisen "gelernt" hat, in Wirklichkeit nur das Regime kodiert, als wäre es ein dauerhaftes Marktgesetz. Dann kam 2022 mit Zinserhöhungen, einem Bärenmarkt und erhöhter Volatilität, und die Strategie traf auf Bedingungen, die sie nie zuvor gesehen hatte. Ein auf eine Ära beschränkter Backtest sagt Ihnen, wie eine Strategie in dieser Ära abgeschnitten hat, und fast nichts darüber, wie sie mit der nächsten umgeht.
Wie stark sollten Sie einen Backtest abwerten?
Sie können diese Verzerrung nicht vollständig beseitigen, aber Sie können sie einpreisen. Behandeln Sie die Hauptzahl als Obergrenze und ziehen Sie einen Abschlag entsprechend ab, wie der Test konstruiert wurde. Je unsauberer der Prozess, desto tiefer der Abschlag.
Wie stark man einen Backtest abwerten sollte, bevor man ihm glaubt
| Backtest-Merkmal | Realistische Einschätzung | Warum |
|---|---|---|
| Nur In-Sample, ein Marktregime | Starker Abschlag oder Verwerfen | Hat noch nie eine andere Welt gesehen |
| 10+ optimierte Parameter | Starker Abschlag | Hat wahrscheinlich die Stichprobe auswendig gelernt |
| Kosten als null angenommen oder ignoriert | Könnte das Vorzeichen umkehren | Netto ist die einzige Zahl, die zählt |
| Survivorship-bereinigtes Universum | Moderater Abschlag | Die Verlierer wurden still entfernt |
| Out-of-Sample, Walk-Forward, realistische Kosten | Leichter Abschlag, trotzdem live verifizieren | Kommt der Ehrlichkeit am nächsten |
Was tatsächlich hilft
Nichts davon bedeutet, dass Backtesting nutzlos ist. Es bedeutet, dass ein Backtest ein Filter ist, der schlechte Ideen aussortiert, kein Versprechen über gute. Einige Praktiken verringern die Lücke zwischen Backtest und Realität spürbar. Reservieren Sie Out-of-Sample-Daten, die das Modell nie berührt hat, und nutzen Sie Walk-Forward-Tests. Ziehen Sie aggressiv nach Parameteranzahl ab. Testen Sie bewusst über verschiedene Regime hinweg, einschließlich der hässlichen. Und bestätigen Sie, dass die Live-Ausführung tatsächlich die Fills und Positionsgrößen erreichen kann, die der Backtest angenommen hat, denn ein System, das sich unauffällig auf perfekte Einstiege verlässt oder Ihre Regeln zur Positionsgrößenbestimmung ignoriert, wird sich mit echtem Geld auf dem Spiel ganz anders verhalten.
Der letzte Filter ist Paper-Trading, dann kleines Live-Trading. Ein Backtest lebt in einer Welt ohne verpasste Fills, ohne Emotionen und ohne Überraschungen. Echte Ausführung ist der einzige Test, der alle drei enthält.
Wichtigste Erkenntnisse
- Ein Backtest ist das Beste von vielen verrauschten Versuchen, also ist er nach oben verzerrt, noch bevor Sie ihn lesen.
- Survivorship-Bias testet nur die Assets, die überlebt haben; Look-Ahead-Bias handelt mit Informationen, die Sie nicht hatten.
- Overfitting skaliert mit der Anzahl der Parameter und der Anzahl der ausprobierten Kombinationen, also entsprechend abwerten.
- Kosten werden pro Trade berechnet und können eine große Bruttorendite netto deutlich ins Negative drehen.
- Ein Backtest mit nur einem Regime kodiert dieses Regime als Gesetz und bricht zusammen, wenn sich das Regime ändert.
Ein Backtest sagt Ihnen, dass eine Strategie funktioniert hätte. Er sagt Ihnen nie, dass sie funktionieren wird. In der Lücke zwischen diesen beiden Sätzen sterben die meisten Handelskonten.
Haftungsausschluss: Dieser Inhalt dient ausschließlich Bildungszwecken und stellt keine Finanzberatung dar. Trading birgt ein erhebliches Verlustrisiko. Vergangene Wertentwicklungen sind keine Garantie für zukünftige Ergebnisse.