On a fait passer notre propre bibliothèque de stratégies par un gauntlet de validation — voici ce qui a survécu

La plupart des plateformes de trading te montrent le backtest gagnant. La courbe monte vers la droite, le ratio de Sharpe est flatteur, et les milliers de variantes mortes avant cette capture d'écran sont invisibles.
Cet article parle du cimetière. Non pas parce que l'échec est intéressant en soi, mais parce que le cimetière est le seul endroit où l'on peut vérifier si un processus de validation rejette vraiment quelque chose — y compris, quand les tests deviennent plus exigeants, les publications de la plateforme elle-même.
Sur dix runs hebdomadaires de découverte que je peux entièrement reconstituer, mon moteur a évalué 8 610 stratégies candidates. 36 ont passé le gauntlet complet — 0,42 %. Sur ces 36, 8 ont été effectivement publiées dans la bibliothèque. J'ai ensuite construit des tests plus exigeants, je les ai appliqués à mes propres stratégies déjà publiées, et 10 des 15 stratégies de ma bibliothèque live ont été signalées.
Je publie tout — y compris la partie où j'ai découvert que mon propre moteur avait un bug qui l'empêchait de chercher dans un tiers des familles de stratégies qu'il prétendait couvrir.
Le gauntlet, en langage clair
Chaque stratégie candidate — un ensemble de règles, sur une crypto, sur un timeframe — doit survivre à une séquence de filtres. Quand une stratégie échoue, elle échoue sur un filtre nommé, et chaque filtre existe pour te protéger d'une façon spécifique dont les backtests mentent :
Portes de contrôle de base. Suffisamment de trades pour que les résultats aient un sens (minimum 30), un plafond de drawdown à 35 %, et un rendement ajusté au risque minimum. Basique, et responsable de la majorité des éliminations — j'y reviens plus bas.
Walk-forward. Un backtest peut mémoriser le passé. Le walk-forward cache une partie de l'historique à la stratégie, puis vérifie ses performances sur la partie qu'elle n'a jamais vue. Je lui impose de conserver au moins 50 % de sa performance sur des données inédites — si elle n'y arrive pas, le joli chiffre du backtest, c'est de la chance, et je le dis.
Bootstrap par séquence de trades. Ton backtest montre une version de l'histoire. Je rejoue les trades d'une stratégie dans 500 ordres mélangés — 500 univers alternatifs — et j'observe le pire scénario plausible. Si 1 univers sur 20 produit un drawdown qui te ferait tout arrêter, tu dois le savoir avant d'engager de l'argent réel. Ce même test détecte aussi l'inverse : une stratégie dont l'historique réel a été plus chanceux que la quasi-totalité de ses propres reshuffles.
Plafond de plausibilité et borne de divergence. Si une stratégie obtient un score trop parfait, je la rejette — d'après mon expérience, les résultats "incroyables" sont presque toujours une erreur de données ou de la chance, pas une découverte. Et si son score en période d'entraînement et son score sur données inédites divergent trop fortement dans un sens comme dans l'autre, je la signale : on ne peut faire confiance à aucun des deux chiffres.
Amplitude. Une stratégie qui n'a fonctionné que sur une seule crypto, c'est probablement l'histoire de cette crypto, pas une stratégie. Quand les mêmes règles survivent indépendamment sur de nombreux actifs, c'est la preuve que l'edge est réel.
L'entonnoir, avec les passages gênants laissés dedans

Sur les dix runs récupérés : 8 610 candidats, 36 ayant passé le gauntlet complet (0,42 %), 8 publiés. En ne comptant que ce qui a réellement atteint la bibliothèque, le taux de survie est de 0,09 %.
Pour contextualiser : un entonnoir de validation de stratégies public bien connu — le genre d'analyse "on a testé des milliers de backtests" qui circule sur YouTube — passe environ 5,7 % de ses candidats. Selon qu'on compare les passants de notre gauntlet ou nos publications effectives, notre entonnoir est 8 à 60 fois plus strict. Je ne prétends pas que ça nous rend plus intelligents. Ça nous rend plus sélectifs, et ça signifie que les stratégies qui portent notre badge de validation l'ont gagné contre un filtre que la plupart des discours marketing biaisés par le survivorship ne rencontrent jamais.
Deux constats gênants dans cet entonnoir :
Presque tout meurt à la porte. 5 243 des 5 370 candidats avec des logs détaillés — 97,6 % — ont été éliminés par les deux portes les plus basiques (trop peu de trades, win rate en dessous du seuil) avant que la machinerie out-of-sample sophistiquée les voie. L'une de mes portes out-of-sample n'a, à ce jour, jamais déclenché une seule fois. Un gauntlet où les portes sophistiquées sont sous-employées est un gauntlet dont la forme demande à être retravaillée — et c'est précisément l'objet de la prochaine section.
Trois semaines d'historique ont disparu. Mes runs du 12, 19 et 26 juillet ont été perdus par rotation des logs avant que je pense à conserver les résultats par candidat — pour les candidats rejetés, aucune métrique n'était stockée nulle part. Tout ce qui précède est reconstitué à partir des runs que j'ai pu récupérer, et j'ai depuis mis en place la persistance pour que les chiffres de chaque futur candidat survivent, qu'il passe ou non. Quand je dis "reconstitué", traite ces chiffres comme exactement ça.
La confession : je ne cherchais même pas dans un tiers de la carte

Quand j'ai agrégé la survie par famille de stratégies, deux familles — volume et pattern — affichaient zéro candidat. Jamais.
Ce n'était pas le verdict du marché. C'était un bug : un flag de configuration introduit lors d'une réécriture précédente du moteur écartait silencieusement mon catalogue de stratégies étendu, si bien que le cron de découverte hebdomadaire continuait à chercher sur une vieille liste codée en dur. Deux de mes six familles de stratégies n'ont jamais été inscrites dans la course, et rien dans mon monitoring ne le signalait. Je l'ai découvert parce que le tableau de survie par famille rendait le vide impossible à ignorer — ce qui est un bon argument pour construire ce tableau. Le câblage est corrigé ; le catalogue étendu ajoute environ 7 000 backtests à chaque run hebdomadaire.
(Une stratégie de la famille pattern est actuellement publiée. Elle a été découverte le 26 juillet — l'une des semaines dont les logs ont été perdus — donc je ne peux pas reconstituer l'entonnoir qu'elle a traversé. Cette réserve lui reste attachée.)
Le reste du tableau par famille est humiliant de façon ordinaire : mixed confluence — la famille "combiner plusieurs indicateurs" qui semble la plus sophistiquée — affiche 0 sur 460. Momentum a le meilleur taux de survie avec 1,44 %. Rien n'a dépassé 2 %.
Ensuite, j'ai pointé les nouveaux tests sur moi-même
La question plus difficile : nos propres stratégies publiées survivent-elles aux tests qu'on vient de construire ? J'ai rejoué la bibliothèque complète de 15 stratégies à travers les trois nouvelles portes. 10 sur 15 ont été signalées.
- Plancher walk-forward : 1 échec. Une stratégie n'a conservé que 42,5 % de sa performance sur données inédites, en dessous de mon plancher de 50 % — et bien en dessous de la deuxième plus basse de la bibliothèque à 81,3 %. Elle est signalée pour audit.
- Bootstrap : 6 signalées. Quatre avaient un drawdown remanié 1-sur-20 pire que notre plafond de 35 % (jusqu'à 38,1 %). Quatre représentaient le problème inverse — des queues chanceuseuses : l'historique réel d'une stratégie était moins profond que 98 reshuffles sur 100 des siens (percentile 1,9), ce qui signifie que son palmarès live flatte ce que les mêmes trades délivreraient typiquement. Deux stratégies ont déclenché les deux flags.
- Borne de divergence : 4 signalées — toutes des stratégies en direction short dont les scores out-of-sample étaient environ le double de leurs scores en entraînement (ex. : 2,72 vs 1,24). Trop bon est aussi un flag : ces fenêtres out-of-sample se trouvaient dans la faiblesse des altcoins du premier semestre 2026, donc un cadeau de régime fait un travail que la stratégie ne répétera pas sur commande.
Les trois portes ont signalé des stratégies différentes — l'échec walk-forward est clean en bootstrap, et les échecs bootstrap passent le walk-forward. Aucun test unique n'aurait trouvé tous les problèmes.
Aucune de ces stratégies n'a été dépubliée silencieusement. Chaque signal est transmis à un audit humain avec les preuves à l'appui, et les utilisateurs faisant tourner des bots sur tout ce qui sera dépublié seront notifiés directement. C'est une politique, pas une humeur.
Ce que les reshuffles nous ont appris sur les séries perdantes
En rééquilibrant les portes, j'ai lancé une nouvelle simulation forward — 1 620 backtests sur mon univers de découverte — pour tester si la porte brute sur le win rate pouvait être remplacée par la bande bootstrap. Deux constats qui méritent ton attention :
La bande bootstrap est l'instrument le plus précis. Parmi les candidats bloqués uniquement par la porte sur le win rate, la bande bootstrap en a indépendamment éliminé 8 sur 9 — et elle échoue aussi 5 des 9 stratégies qui passent le gauntlet actuel complet. L'appliquer réduit la bibliothèque avant qu'elle ne grandisse. Je le fais quand même, en séquençant via l'audit, parce qu'une bibliothèque petite et honnête vaut mieux qu'une bibliothèque grande et fragile.
Les séries perdantes sont une caractéristique des mathématiques, pas un dysfonctionnement. Parmi les survivants avec des win rates de 39,6–43,1 %, les séries de défaites consécutives maximales étaient de 6, 6, 6, 7 et 11 pertes d'affilée. Si tu utilises une stratégie avec un win rate de ~40 %, une série de 6 à 11 pertes est l'expérience attendue. J'afficherai ce chiffre à côté des stratégies à faible win rate, et les circuit breakers à l'exécution (limites sur les pertes consécutives et les pertes sur fenêtre temporelle) sont activés par défaut pour elles — l'alternative honnête à te laisser découvrir la série avec de l'argent réel.
Note de périmètre : cette simulation couvre une fenêtre temporelle, deux timeframes sur trois, et la liste de stratégies héritée uniquement. Ses chiffres globaux portent une large incertitude ; ses conclusions directionnelles ont été vérifiées par rapport à l'entonnoir historique et tiennent.
La suite
- L'audit. Les 10 stratégies signalées passent par notre audit mensuel de bibliothèque — décision humaine par stratégie, preuves sur la table, aucune suppression silencieuse. Si une stratégie quitte le catalogue, quiconque fait tourner un bot dessus en est informé directement, avant de le remarquer dans l'interface.
- Re-gauntlet mensuel. Le replay complet de la bibliothèque fait maintenant partie intégrante de cet audit. Un badge obtenu en juin doit être re-gagné en août ; les régimes de marché changent et la validation a une date de péremption.
- Un catalogue plus large. Avec le bug de configuration corrigé, les stratégies volume et pattern entrent enfin dans la course — et l'entonnoir et les graphiques par famille dans cet article seront régénérés à partir des données persistées, non reconstitués à partir des logs.
Ce que ça signifie pour toi
Quand une stratégie de ma bibliothèque porte le badge de validation, ça signifie : elle a survécu à un entonnoir qui rejette plus de 99 % des candidats, elle a conservé au moins la moitié de sa performance sur des données qu'elle n'avait jamais vues, ses 500 historiques alternatifs ne contiennent pas de drawdown ruineux, et ses résultats n'étaient ni trop mauvais ni trop bons pour être fiables. Ça signifie aussi que le badge est révocable — par mes propres tests, publiquement, sur un calendrier défini.
Je ne peux pas te promettre de l'alpha. Personne ne le peut honnêtement. Ce que je peux promettre, c'est que tout ce que je publie a été soumis à la même machinerie que je viens d'utiliser sur moi-même — et que quand cette machinerie trouve quelque chose d'embarrassant, tu le liras ici en premier.
Tous les chiffres de cet article proviennent d'artefacts de runs commités et de jobs de replay — aucun n'est assemblé à la main. Trois runs de découverte de juillet 2026 ont été perdus par rotation des logs avant que la persistance par candidat soit mise en place ; les chiffres des runs récupérés sont reconstitués à partir des logs de runs et sont identifiés comme tels ci-dessus.
Envie que l'IA d'Anny analyse votre portefeuille ? Essayez la Anny Line ou voir les tarifs.


