Strategievalidationbacktestingtransparencywalk-forwardbootstrap

Wir haben unsere eigene Strategy Library durch einen Validierungs-Gauntlet gejagt — das hat überlebt

1. August 2026·8 Min. Lesezeit
Wir haben unsere eigene Strategy Library durch einen Validierungs-Gauntlet gejagt — das hat überlebt

Die meisten Trading-Plattformen zeigen dir den gewinnenden Backtest. Die Chart geht nach oben rechts, die Sharpe Ratio schmeichelt, und die tausend Varianten, die auf dem Weg zu diesem Screenshot gestorben sind, existieren nirgendwo.

Dieser Artikel handelt vom Friedhof. Nicht weil Scheitern an sich interessant wäre, sondern weil der Friedhof der einzige Ort ist, an dem man überprüfen kann, ob ein Validierungsprozess tatsächlich etwas ablehnt — einschließlich, wenn die Tests besser werden, der eigenen veröffentlichten Arbeit der Plattform selbst.

Über zehn vollständig rekonstruierbare wöchentliche Discovery-Runs hat meine Engine 8.610 Strategy-Kandidaten ausgewertet. 36 haben den vollständigen Validierungs-Gauntlet bestanden — 0,42 %. Davon wurden 8 tatsächlich in der Library veröffentlicht. Dann habe ich einen Satz härterer Tests gebaut, ihn auf meine bereits veröffentlichten Strategien gerichtet — und 10 von 15 Strategien in meiner Live-Library wurden markiert.

Ich veröffentliche alles davon — einschließlich des Teils, in dem ich entdeckte, dass meine eigene Engine einen Bug hatte, der dazu führte, dass sie ein Drittel der Strategy-Familien, die sie zu durchsuchen behauptete, nie durchsucht hat.

Der Gauntlet, in einfachen Worten

Jede Kandidatenstrategie — ein Regelwerk, auf einer Coin, auf einem Timeframe — muss eine Abfolge von Filtern überstehen. Wenn eine Strategie scheitert, scheitert sie an einem benannten Filter, und jeder Filter existiert, um dich vor einer bestimmten Art zu schützen, wie Backtests lügen:

Sanity Gates. Genug Trades, um überhaupt etwas zu bedeuten (Minimum 30), ein Drawdown-Cap von 35 % und eine Mindestrendite risikoadjustiert. Langweilig — und verantwortlich für den Großteil der Ablehnungen. Mehr dazu gleich.

Walk-Forward. Ein Backtest kann die Vergangenheit auswendig lernen. Walk-Forward verbirgt einen Teil der History vor der Strategie und prüft dann, wie sie auf dem Teil performt, den sie nie gesehen hat. Ich verlange, dass sie mindestens 50 % ihrer Performance auf ungesehenen Daten behält — wenn nicht, war die hübsche Backtest-Zahl Glück, und ich sage es so.

Trade-Sequence Bootstrap. Dein Backtest zeigt eine Version der Geschichte. Ich spiele die Trades einer Strategie in 500 zufällig geordneten Abfolgen durch — 500 alternative Universen — und schaue, was im schlimmsten plausiblen Fall hätte passieren können. Wenn 1 von 20 Universen einen Drawdown produziert, der dich zum Aufhören bringen würde, solltest du das wissen, bevor echtes Geld im Spiel ist. Derselbe Test fängt auch das Gegenteil: eine Strategie, deren reale History glücklicher war als fast alle ihre eigenen Reshuffles.

Plausibility Cap und Divergence Bound. Wenn eine Strategie zu perfekt abschneidet, lehne ich sie ab — in meiner Erfahrung sind „unglaubliche" Ergebnisse fast immer ein Datenfehler oder Glück, keine Entdeckung. Und wenn ihr Practice-Run-Score und ihr Unseen-Data-Score in beide Richtungen wild auseinandergehen, markiere ich sie: Keiner der beiden Werte ist vertrauenswürdig.

Breadth. Eine Strategie, die jemals nur auf einer Coin funktioniert hat, ist wahrscheinlich eine Geschichte über diese Coin, keine Strategie. Wenn dieselben Regeln unabhängig voneinander auf vielen Assets überleben, ist das ein Hinweis, dass der Edge real ist.

Der Funnel — mit den unangenehmen Teilen drin

Der Validierungs-Funnel — 5.370 geloggte Kandidaten rein, 33 durch den vollständigen Gauntlet, 7 gespeichert. Rekonstruiert aus per-run Gate-Logs; das vollständige rekonstruierte Bild ist 8.610 → 36 → 8.
Der Validierungs-Funnel — 5.370 geloggte Kandidaten rein, 33 durch den vollständigen Gauntlet, 7 gespeichert. Rekonstruiert aus per-run Gate-Logs; das vollständige rekonstruierte Bild ist 8.610 → 36 → 8.

Über die zehn rekonstruierten Runs: 8.610 Kandidaten, 36 vollständige Gauntlet-Bestehende (0,42 %), 8 veröffentlicht. Zählt man nur das, was tatsächlich in der Library gelandet ist, liegt das Überleben bei 0,09 %.

Zum Vergleich: Ein bekannter öffentlicher Strategy-Validierungs-Funnel — die Art „wir haben tausende Backtests getestet"-Analyse, die auf YouTube kursiert — lässt rund 5,7 % seiner Kandidaten durch. Je nachdem, ob man meine Gauntlet-Bestehenden oder meine tatsächlichen Veröffentlichungen vergleicht, ist mein Funnel 8 bis 60 Mal strenger. Ich behaupte nicht, dass mich das klüger macht. Es macht mich wählerischer — und es bedeutet, dass die Strategien, die tatsächlich mein Validierungs-Badge tragen, es gegen einen Filter verdient haben, dem das meiste survivorship-biased Marketing nie begegnet.

Zwei unangenehme Befunde in diesem Funnel:

Fast alles stirbt an der Tür. 5.243 der 5.370 Kandidaten mit detaillierten Logs — 97,6 % — wurden durch die beiden grundlegendsten Gates eliminiert (zu wenige Trades, Win Rate unter Schwellenwert), bevor die ausgefeilte Out-of-Sample-Maschinerie sie je gesehen hat. Eines meiner Out-of-Sample-Gates hat bis heute kein einziges Mal ausgelöst. Ein Gauntlet, in dem die ausgefeilten Gates unterausgelastet sind, ist ein Gauntlet, dessen Form überarbeitet werden muss — und genau das ist Thema des nächsten Abschnitts.

Drei Wochen History sind verschwunden. Meine Runs vom 12., 19. und 26. Juli gingen durch Log-Rotation verloren, bevor ich daran gedacht hatte, per-candidate-Ergebnisse zu sichern — für abgelehnte Kandidaten wurden nirgendwo Metriken gespeichert. Alles oben Genannte ist aus den Runs rekonstruiert, die ich wiederherstellen konnte. Seitdem habe ich Persistenz implementiert, sodass die Zahlen jedes zukünftigen Kandidaten erhalten bleiben — egal ob er besteht oder nicht. Wenn ich „rekonstruiert" sage, behandle die Zahlen genau als das.

Das Geständnis: Wir haben ein Drittel der Karte nie durchsucht

Überleben nach Strategy-Familie — Volume und Pattern zeigen null Kandidaten: ein verdecktes Config-Flag hat beide Familien komplett aus der Suche ausgeschlossen.
Überleben nach Strategy-Familie — Volume und Pattern zeigen null Kandidaten: ein verdecktes Config-Flag hat beide Familien komplett aus der Suche ausgeschlossen.

Als ich das Überleben nach Strategy-Familie aggregiert habe, zeigten zwei Familien — Volume und Patternnull Kandidaten. Jemals.

Das war nicht das Urteil des Marktes. Es war ein Bug: Ein Konfigurations-Flag, das während eines früheren Engine-Rewrites eingeführt wurde, verwarf still meinen erweiterten Strategy-Katalog, sodass der wöchentliche Discovery-Cron weiterhin eine alte, fest codierte Liste durchsuchte. Zwei meiner sechs Strategy-Familien wurden nie in das Rennen eingetragen — und nichts in meinem Monitoring hat das angezeigt. Ich habe es gefunden, weil die Family-Survival-Tabelle das Loch unmöglich zu übersehen machte — was ein gutes Argument dafür ist, die Tabelle zu bauen. Die Verdrahtung ist gefixt; der erweiterte Katalog fügt jedem wöchentlichen Run rund 7.000 Backtests hinzu.

(Eine Pattern-Family-Strategie ist derzeit veröffentlicht. Sie wurde am 26. Juli entdeckt — einer der Wochen, deren Logs verloren gegangen sind — sodass ich den Funnel, durch den sie gelaufen ist, nicht rekonstruieren kann. Dieser Vorbehalt bleibt an ihr haften.)

Der Rest der Family-Tabelle ist auf die gewöhnliche Art ernüchternd: Mixed Confluence — die „kombiniere mehrere Indikatoren"-Familie, die am ausgefeiltesten klingt — ging 0 von 460. Momentum hatte die beste Überlebensrate mit 1,44 %. Nichts hat 2 % überschritten.

Dann habe ich die neuen Gates auf uns selbst gerichtet

Die härtere Frage: Überleben meine eigenen veröffentlichten Strategien die Tests, die ich gerade gebaut habe? Ich habe die vollständige 15-Strategie-Library durch die drei neuen Gates gespielt. 10 von 15 wurden markiert.

  • Walk-Forward Floor: 1 Fehler. Eine Strategie behielt nur 42,5 % ihrer Performance auf ungesehenen Daten — unter meiner 50 %-Untergrenze und deutlich unter dem nächstniedrigsten Wert der Library mit 81,3 %. Sie ist zur Prüfung markiert.
  • Bootstrap: 6 markiert. Vier hatten einen 1-von-20-Reshuffled-Drawdown schlechter als mein 35 %-Cap (bis zu 38,1 %). Vier hatten das umgekehrte Problem — Lucky Tails: Die reale History einer Strategie war flacher als 98 von 100 ihrer eigenen Reshuffles (Perzentile 1,9), was bedeutet, dass ihr Live-Ergebnis das schmeichelt, was dieselben Trades typischerweise liefern würden. Zwei Strategien haben beide Flags ausgelöst.
  • Divergence Bound: 4 markiert — allesamt Short-Direction-Strategien, deren Unseen-Data-Scores rund doppelt so hoch waren wie ihre Practice-Scores (z. B. 2,72 vs. 1,24). Auch zu gut ist ein Flag: Diese Out-of-Sample-Fenster lagen in der Altcoin-Schwäche der ersten Hälfte 2026, sodass ein Regime-Geschenk Arbeit leistet, die die Strategie nicht auf Abruf wiederholen wird.

Nennenswert: Die drei Gates haben unterschiedliche Strategien gefunden — der Walk-Forward-Fehler ist Bootstrap-sauber, und die Bootstrap-Fehler bestehen Walk-Forward. Kein einzelner Test hätte alle gefunden.

Keine davon wurde still aus der Veröffentlichung genommen. Jedes Flag geht an ein menschliches Audit mit den beigefügten Belegen — und Nutzer, die Bots auf etwas laufen lassen, das delistet wird, werden direkt benachrichtigt. Das ist Politik, keine Stimmungssache.

Was die Reshuffles über Verlustserien gelehrt haben

Während ich die Gates neu ausbalanciert habe, habe ich eine neue Forward-Simulation durchgeführt — 1.620 Backtests über mein Discovery-Universum — um zu testen, ob das grobe Win-Rate-Gate durch das Bootstrap-Band ersetzt werden könnte. Zwei Befunde, die deine Zeit wert sind:

Das Bootstrap-Band ist das schärfere Instrument. Von den Kandidaten, die nur das Win-Rate-Gate blockierte, hat das Bootstrap-Band 8 von 9 unabhängig abgetötet — und es schlägt auch 5 der 9 Strategien fehl, die den heutigen vollständigen Gauntlet bestehen. Das Durchsetzen verkleinert die Library, bevor irgendetwas wächst. Ich tue es trotzdem, sequenziert durch das Audit, weil eine kleinere ehrliche Library einer größeren fragilen überlegen ist.

Verlustserien sind ein Merkmal der Mathematik, keine Fehlfunktion. Unter den Überlebenden mit Win Rates von 39,6–43,1 % lagen die maximalen Verlustserien bei 6, 6, 6, 7 und 11 aufeinanderfolgenden Verlusten. Wenn du eine Strategie mit ~40 % Win Rate ausführst, ist eine 6-bis-11-Loss-Streak die erwartete Erfahrung. Ich werde diese Zahl neben Strategien mit niedrigen Win Rates anzeigen — und Runtime-Circuit-Breaker (aufeinanderfolgende Verluste und zeitfensterbasierte Verlustlimits) sind für sie standardmäßig aktiviert. Die ehrliche Alternative dazu, dich die Streak mit echtem Geld entdecken zu lassen.

Umfangs-Ehrlichkeit: Diese Simulation ist ein einziges Zeitfenster, zwei von drei Timeframes, nur die Legacy-Strategy-Liste. Die Headline-Zahlen tragen breite Unsicherheit; die Richtungsschlüsse wurden gegen den historischen Funnel geprüft und halten stand.

Was als nächstes passiert

  • Das Audit. Die 10 markierten Strategien durchlaufen mein monatliches Library-Audit — menschliche Entscheidung pro Strategie, Belege auf dem Tisch, keine stillen Entfernungen. Wenn eine Strategie aus dem Regal genommen wird, hört es jeder, der einen Bot darauf laufen hat, direkt von mir — bevor er es in der Oberfläche bemerkt.
  • Monatlicher Re-Gauntlet. Der vollständige Library-Replay ist jetzt fester Bestandteil dieses Audits. Ein im Juni verdientes Badge muss im August neu verdient werden; Marktregimes ändern sich, und Validierung hat ein Verfallsdatum.
  • Ein breiterer Katalog. Mit dem behobenen Config-Bug treten Volume- und Pattern-Strategien endlich in das Rennen ein — und die Funnel- und Family-Charts in diesem Artikel werden aus den gesicherten Daten neu generiert, nicht aus Logs rekonstruiert.

Was das für dich bedeutet

Wenn eine Strategie in meiner Library das Validierungs-Badge trägt, bedeutet das: Sie hat einen Funnel überlebt, der mehr als 99 % der Kandidaten ablehnt. Sie hat mindestens die Hälfte ihrer Performance auf Daten behalten, die sie nie gesehen hat. Ihre 500 alternativen Histories enthalten keinen ruinösen Drawdown. Und ihre Ergebnisse waren weder zu schlecht noch zu gut, um vertrauenswürdig zu sein. Es bedeutet auch, dass das Badge widerrufbar ist — durch meine eigenen Tests, öffentlich, nach einem Zeitplan.

Ich kann dir kein Alpha versprechen. Das kann niemand ehrlich. Was ich versprechen kann: Alles, was ich veröffentliche, wurde gegen dieselbe Maschinerie getestet, die ich gerade auf mich selbst angewendet habe — und wenn die Maschinerie etwas Peinliches findet, liest du es zuerst hier.


Alle Zahlen in diesem Artikel stammen aus committed Run-Artefakten und Replay-Jobs — keine wurde manuell zusammengestellt. Drei Discovery-Runs vom Juli 2026 gingen durch Log-Rotation verloren, bevor per-candidate-Persistenz implementiert wurde; Zahlen für die rekonstruierten Runs sind aus Run-Logs rekonstruiert und oben entsprechend gekennzeichnet.