Datenbasis: DAX, FTSE, Dow, NQ, SPX, Gold, EURUSD, USDJPY; Dukascopy-CFD-Minutendaten (BID), Entscheidungszeitpunkte alle 15 Minuten. Regel = Bedingung (ein Baustein oder zwei aus verschiedenen Familien, insgesamt 136 Bausteine aus Uhrzeit, Wochentag, Kalender, VIX, Dollar-Index, Zinsen, Stimmungsindizes, Terminen, Kursverlauf und Nachbarmärkten) plus Ausstieg (15, 30, 60, 120 Minuten oder Handelsschluss) plus Richtung: 732.000 Regeln nominell, 681.882 ausgewertet. Suche 2015–2019, Bestätigung 2020–2022, Holdout 2023 bis Juni 2026 nur für die eine markierte Regel. Kosten: Spread plus Slippage je Markt, Round-Trip 1,2 bis 3,4 bps. Benchmark: dieselbe Suche auf 20 Zufallsmärkten (jede Minutenkerze zufällig gespiegelt: gleiche Volatilität, keine Richtung). Keine Handelsempfehlung.
„Such lange genug, dann findest du etwas“ ist der Reflex vieler Backtests, und er funktioniert: Irgendeine Kombination aus Uhrzeit, Volatilität und Wochentag zeigt immer einen schönen t-Wert. Die Frage ist nicht, ob eine Suche etwas findet. Die Frage ist, ob der Fund besser ist als das, was dieselbe Suche auf einem Markt ohne Muster findet. Das ist die Idee des Reality Checks von White (2000) und des SPA-Tests von Hansen (2005).
Wir haben sie ausgeführt: 136 Bausteine, acht Märkte, rund 682.000 Regeln, und dieselbe Suche noch einmal auf 20 Zufallsmärkten.

Die eine Regel, die wir aus der Suche als Beobachtung markiert haben: FTSE, Kurs über dem Overnight-Hoch, aber im unteren Drittel der bisherigen Tagesrange, dann 60 Minuten long. 23. Juli 2019, Entscheidung um 08:45, Ergebnis nach Kosten +22,5 bps.

Dieselbe Regel am 1. Juni 2018, Entscheidung um 14:45, Ergebnis nach Kosten −14,3 bps. Beide Beispiele stammen aus der Suchperiode 2015–2022 und wurden mit festem Seed zufällig aus allen Signalen der Regel gezogen, nicht ausgesucht.
1. Der beste Fund gegen die Zufallsmärkte
Die Zufallsmärkte behalten Volatilität, Volatilitäts-Cluster und die Gleichzeitigkeit der Märkte, aber jede Minutenkerze ist zufällig gespiegelt, sodass keine Richtungsstruktur bleibt. Dieselbe Suche lief auf 20 solchen Märkten, zusammen rund 13,6 Millionen Nullregeln. Zur Null zählt der echte Uhrzeit-Drift, damit reine Drift-Regeln den echten Markt nicht bevorzugen. So sehen wir, wie gut der beste Fund von 682.000 Regeln ohne jedes Muster wird.

Jeder Punkt ist ein Zufallsmarkt und zeigt den besten Netto-t-Wert, den dieselbe Suche dort findet. Orange Linie: bester echter Fund (3,65). Gestrichelt: Median der 20 Zufallsmärkte (3,81), gepunktet: 95. Perzentil (4,27). 14 von 20 Zufallsmärkten liegen über dem echten Markt.
| Kennzahl | echter Markt | Zufallsmärkte, Median oder Mittel | Zufallsmärkte, Maximum |
|---|---|---|---|
| bester t-Wert (netto) | 3,65 | 3,81 (Median) | 4,42 |
| 10.-bester t-Wert | 3,10 | 3,19 (Mittel) | 3,70 |
| bester |t| des Überschusses über den Uhrzeit-Drift | 4,55 | 4,65 (Median) | 5,09 |
| Regeln mit t ≥ 3 | 12 | 25,5 (Mittel) | 72 |
| Regeln mit t ≥ 4 | 0 | 0,5 (Mittel) | 3 |
| Top-50-Regeln, 2020–2022 bestätigt | 0 von 50 | 0,55 (Mittel) | 3 |
Bestätigt heißt: netto positiv und t ≥ 2 in 2020–2022, einem Zeitraum, den die Suche nicht gesehen hat. Der Rang-p-Wert des Reality Checks liegt bei 0,71, der echte Markt ist von einem Markt ohne Muster nicht zu unterscheiden. Kein einzelner Markt liegt über dem 95. Perzentil seiner eigenen Zufallsversion. Die Mehrfachtest-Korrektur (BH-FDR, q = 0,10, exakt über alle 681.882 Regeln) liefert 0 Treffer.
2. Was aus den besten Regeln wird

Die neun besten Regeln der Suche nach t-Wert, Nettoergebnis pro Trade in der Suchperiode (orange) und in der Bestätigung (grau). Fünf werden negativ, keine bestätigt sich mit t ≥ 2.
Die beste Regel: EURUSD long bis Handelsschluss, wenn die Dollar-Index-Änderung und der SKEW-Index (Stand vor dem Handelstag) beide im oberen Drittel ihrer Historie lagen. Sie verdiente in der Suche +5,97 bps netto (t 3,65) und 2020–2022 −0,52 bps (t −0,29). 2015–2018 war sie in jedem Jahr positiv, 2019 lag sie bei −6,9 bps, danach bei +0,4, −1,2 und −4,3 bps: ein Regime-Artefakt.
Von den 500 besten Regeln enden 88 % zum Handelsschluss, weil die Kosten dann nur einmal anfallen. In 2020–2022 verdienen sie im Mittel −1,74 bps netto, nur 38 % sind positiv. Das ist das typische Bild einer ausgewählten Rausch-Spitze: in der Suche positiv per Konstruktion, danach Münzwurf mit Kostenabzug.
Echte Struktur gibt es, nur winzig: 15-Minuten-Fades in EURUSD nach starkem Anstieg haben einen Überschuss über den Drift von +0,18 bps (t 3,7), in allen Jahren gleich. Brutto sind das 0,20 bps gegen 1,16 bps Kosten, netto −0,96 bps (t −19,7), rund sechsmal zu klein.
3. Die eine Regel, die übrig blieb
Aus 682.000 Regeln blieb eine, die wir als Beobachtung markierten, kein Kandidat nach unserem Protokoll: die FTSE-Regel aus den Beispielen oben.

Nettoergebnis pro Trade der markierten Regel: Suchperiode 2015–2022 (orange), darin die Bestätigung 2020–2022, und Holdout 2023 bis Juni 2026 (grau, ein Lauf).
In der Suchperiode: 228 Trades an 81 Tagen, brutto 6,65 bps, netto +4,53 bps (t 3,48), sieben von acht Jahren positiv, Zufallsmarkt +1,3 bps (t 0,38). Sie hing an wenigen Tagen (ohne die 5 besten t 2,5) und an einem Ausreißerjahr (2019: +21,4 bps). Ihr Such-t von 3,11 lag unter dem Median des Zufallsmaximums (3,81), die Bestätigung 2020–2022 bei t 1,62.
Im Holdout, ein Lauf: 89 Trades an 30 Tagen, −1,76 bps netto (t −0,59), brutto +0,09 bps. Gegenüber „zur selben Uhrzeit einfach long“ bringt die Bedingung nichts (Überschuss t −0,05). Der Holdout hat nur 30 Signaltage und kann einen kleinen Effekt nicht ausschließen, aber er zeigt keinen.
Was das heißt
Ein t-Wert von 3,65 klingt nach einem Befund. In einer Suche über 682.000 Regeln ist er der Normalfall: Ein Markt ohne jedes Muster liefert im Median 3,81. Der beste Fund sagt nichts, solange man nicht weiß, wie gut der beste Fund ohne Muster wird. Ein Backtest ohne diesen Vergleich kann Fund und Rauschen nicht trennen. Wer sucht, bis er etwas findet, findet immer etwas, und die besten Regeln bestätigen sich danach so selten wie Zufallsregeln.
Das heißt nicht, dass es keine echten Effekte gibt. Es gibt sie, aber sie sind kleiner als die Kosten.
Grenzen
- CFD-Minutendaten (BID), festes Kostenmodell. Round-Trip 1,2 bis 3,4 bps, reale Kosten sind eher höher. Tick-Volumen (VWAP-Baustein) ist kein Börsenumsatz.
- Einfache Grammatik. Eine oder zwei Bedingungen (Tertil oder Quintil), feste Ausstiege, keine Stops oder Ziele, keine Schwellenoptimierung. Sequenzen, Wechselwirkungen (siehe ML-Studie) und Brackets sind nicht abgedeckt.
- Zufallsmärkte. Sie zerstören jede Richtungsstruktur außer dem Uhrzeit-Drift, erhalten aber keine Crash-Schiefe, und die Tagesdaten-Bausteine (VIX, Dollar-Index) bleiben echt. Am Befund ändert das nichts: Der echte Markt liegt unter der Null, nicht knapp darüber.
- Korrelierte Regeln. Die Zahl unabhängiger Tests ist viel kleiner als 682.000. Deshalb kalibrieren wir gegen das Maximum der Zufallsmärkte statt nur mit einer Korrektur.
- Ein Holdout für eine Regel. 30 Signaltage sind nicht belastbar. Kandidaten gab es keine.
Alle Musterfamilien des Scans im Überblick. Verwandt: Random-Walk-Lineal, Fehler bei KI-Handelsstrategien, Validierungs-Gate.
Disclaimer: Historische Statistiken sind keine Garantie für zukünftiges Marktverhalten. Diese Studie ist keine Anlageberatung. Trading birgt Verlustrisiken bis hin zum Totalverlust.