Abbiamo Messo la Nostra Libreria di Strategie Attraverso un Gauntlet di Validazione — Ecco Cosa È Sopravvissuto

La maggior parte delle piattaforme di trading ti mostra il backtest vincente. Il grafico sale verso destra, lo Sharpe ratio è lusinghiero, e le migliaia di varianti morte lungo la strada non compaiono da nessuna parte.
Questo articolo parla del cimitero. Non perché il fallimento sia interessante di per sé, ma perché il cimitero è l'unico posto dove puoi verificare se un processo di validazione rifiuta davvero qualcosa — incluso, quando i test diventano più severi, il lavoro pubblicato dalla piattaforma stessa.
Su dieci run settimanali che possiamo ricostruire completamente, il nostro motore ha valutato 8.610 candidati. 36 hanno superato il gauntlet completo — 0,42%. Di questi, 8 sono stati effettivamente pubblicati nella libreria. Poi abbiamo costruito una serie di test più severi, li abbiamo puntati sulle nostre strategie già pubblicate, e 10 delle 15 strategie nella nostra libreria live sono state segnalate.
Pubblichiamo tutto — inclusa la parte in cui abbiamo scoperto che il nostro motore aveva un bug che gli impediva di cercare un terzo delle famiglie di strategie che dichiarava di esaminare.
Il gauntlet, in parole semplici
Ogni strategia candidata — un insieme di regole, su una coin, su un timeframe — deve sopravvivere a una sequenza di filtri. Quando una strategia fallisce, fallisce un filtro con un nome specifico, e ogni filtro esiste per proteggerti da un modo preciso in cui i backtest mentono:
Gate di sanità. Un numero sufficiente di trade per avere significato statistico (minimo 30), un cap al drawdown del 35%, e un rendimento minimo corretto per il rischio. Noioso, e responsabile della maggior parte delle eliminazioni — ne parliamo più avanti.
Walk-forward. Un backtest può memorizzare il passato. Il walk-forward nasconde parte della storia alla strategia, poi verifica come si comporta sulla parte che non ha mai visto. Richiediamo che mantenga almeno il 50% della sua performance su dati non visti — se non ci riesce, il bel numero del backtest era fortuna, e lo diciamo chiaramente.
Trade-sequence bootstrap. Il tuo backtest mostra una versione della storia. Replichiamo i trade di una strategia in 500 ordini casuali — 500 universi alternativi — e osserviamo il peggio che avrebbe potuto plausibilmente accadere. Se 1 universo su 20 produce un drawdown che ti farebbe abbandonare tutto, dovresti saperlo prima di mettere soldi veri. Lo stesso test intercetta anche il contrario: una strategia la cui storia reale è stata più fortunata di quasi tutti i suoi stessi rimescolamenti.
Cap di plausibilità e limite di divergenza. Se una strategia ottiene un punteggio troppo perfetto, la rifiutiamo — nella nostra esperienza, i risultati "incredibili" sono quasi sempre un errore nei dati o fortuna, non una scoperta. E se il punteggio della fase di pratica e quello sui dati non visti divergono enormemente in qualsiasi direzione, la segnaliamo: non puoi fidarti di nessuno dei due numeri.
Ampiezza. Una strategia che ha funzionato solo su una coin racconta probabilmente la storia di quella coin, non di una strategia. Quando le stesse regole sopravvivono indipendentemente su molti asset, è la prova che il vantaggio è reale.
Il funnel, con le parti scomode lasciate dentro

Attraverso i dieci run recuperati: 8.610 candidati, 36 che hanno superato il gauntlet completo (0,42%), 8 pubblicati. Contando solo ciò che è effettivamente arrivato nella libreria, la sopravvivenza è dello 0,09%.
Per contestualizzare: un funnel di validazione delle strategie pubblico e noto — il tipo di analisi "abbiamo testato migliaia di backtest" che circola su YouTube — fa passare circa il 5,7% dei suoi candidati. A seconda che si confrontino i superatori del nostro gauntlet o le nostre pubblicazioni effettive, il nostro funnel è da 8 a 60 volte più severo. Non stiamo dicendo che questo ci rende più intelligenti. Ci rende più selettivi, e significa che le strategie che portano il nostro badge di validazione lo hanno guadagnato contro un filtro che il marketing viziato dal survivorship bias non affronta mai.
Due risultati scomodi all'interno di quel funnel:
Quasi tutto muore alla porta. 5.243 dei 5.370 candidati con log dettagliati — il 97,6% — sono stati eliminati dai due gate più elementari (troppo pochi trade, win rate sotto la soglia) prima che i sofisticati meccanismi out-of-sample li vedessero mai. Uno dei nostri gate out-of-sample non ha, ad oggi, mai sparato una volta. Un gauntlet dove i gate sofisticati sono sotto-utilizzati è un gauntlet la cui forma necessita di lavoro, e ribilanciarlo è esattamente l'oggetto della sezione successiva.
Tre settimane di storia sono andate perdute. I nostri run del 12, 19 e 26 luglio sono stati persi per via della rotazione dei log prima che pensassimo di preservare i risultati per ogni candidato — per i candidati rifiutati, nessuna metrica veniva archiviata da nessuna parte. Tutto ciò che è riportato sopra è ricostruito dai run che siamo riusciti a recuperare, e da allora abbiamo implementato la persistenza affinché i numeri di ogni futuro candidato sopravvivano sia che passi o meno. Quando diciamo "ricostruito," tratta le cifre esattamente come tali.
La confessione: non stavamo nemmeno esplorando un terzo della mappa

Quando abbiamo aggregato la sopravvivenza per famiglia di strategia, due famiglie — volume e pattern — mostravano zero candidati. Mai.
Non era il verdetto del mercato. Era un bug: un flag di configurazione introdotto durante una precedente riscrittura del motore scartava silenziosamente il nostro catalogo di strategie espanso, così il cron di discovery settimanale continuava a cercare su una vecchia lista hardcoded. Due delle nostre sei famiglie di strategie non erano mai state inserite nella gara, e nulla nel nostro monitoraggio lo segnalava. Lo abbiamo scoperto perché la tabella della sopravvivenza per famiglia rendeva il vuoto impossibile da ignorare — il che è un buon argomento per costruire la tabella. Il collegamento è stato corretto; il catalogo espanso aggiunge circa 7.000 backtest a ogni run settimanale.
(Una strategia della famiglia pattern è attualmente pubblicata. È stata scoperta il 26 luglio — una delle settimane i cui log abbiamo perso — quindi non possiamo ricostruire il funnel attraverso cui è passata. Quella riserva resta allegata ad essa.)
Il resto della tabella delle famiglie è umiliante nel senso ordinario: mixed confluence — la famiglia "combina diversi indicatori" che suona più sofisticata — ha fatto 0 su 460. Momentum ha avuto il tasso di sopravvivenza migliore all'1,44%. Nulla ha superato il 2%.
Poi abbiamo puntato i nuovi gate su noi stessi
La domanda più difficile: le nostre strategie pubblicate sopravvivono ai test che abbiamo appena costruito? Abbiamo replicato l'intera libreria di 15 strategie attraverso i tre nuovi gate. 10 su 15 sono state segnalate.
- Walk-forward floor: 1 fallimento. Una strategia ha mantenuto solo il 42,5% della sua performance su dati non visti, sotto il nostro floor del 50% — e ben al di sotto del secondo peggior risultato nella libreria all'81,3%. È segnalata per audit.
- Bootstrap: 6 segnalate. Quattro avevano un drawdown rimescolato 1 su 20 peggiore del nostro cap del 35% (fino al 38,1%). Quattro rappresentavano il problema opposto — code fortunate: la storia reale di una strategia era meno profonda di 98 su 100 dei suoi stessi rimescolamenti (percentile 1,9), il che significa che il suo record live lusinga ciò che gli stessi trade avrebbero tipicamente prodotto. Due strategie hanno colpito entrambi i flag.
- Limite di divergenza: 4 segnalate — tutte strategie in direzione short i cui punteggi su dati non visti erano circa il doppio dei punteggi di pratica (es. 2,72 vs 1,24). Anche "troppo buono" è un flag: quelle finestre out-of-sample si trovavano nella debolezza degli altcoin della prima metà del 2026, quindi un regalo di regime sta facendo un lavoro che la strategia non replicherà su richiesta.
È degno di nota che i tre gate abbiano intercettato strategie diverse — il fallimento del walk-forward è pulito nel bootstrap, e i fallimenti del bootstrap superano il walk-forward. Nessun singolo test li avrebbe trovati tutti.
Nessuno di questi è stato silenziosamente rimosso dalla pubblicazione. Ogni segnalazione va a un audit umano con le prove allegate, e gli utenti che gestiscono bot su qualsiasi cosa venga ritirata saranno notificati direttamente. È una policy, non un'umore.
Cosa ci hanno insegnato i rimescolamenti sulle serie di perdite
Mentre ribilanciavamo i gate, abbiamo eseguito una nuova simulazione forward — 1.620 backtest attraverso il nostro universo di discovery — per testare se il gate grezzo del win rate potesse essere sostituito dalla banda bootstrap. Due risultati che meritano la tua attenzione:
La banda bootstrap è lo strumento più preciso. Tra i candidati che solo il gate del win rate stava bloccando, la banda bootstrap ha eliminato indipendentemente 8 su 9 — e fallisce anche 5 delle 9 strategie che superano il gauntlet attuale. Applicarla riduce la libreria prima che cresca. Lo stiamo facendo comunque, sequenziato attraverso l'audit, perché una libreria onesta più piccola batte una libreria fragile più grande.
Le serie di perdite sono una caratteristica della matematica, non un malfunzionamento. Tra i sopravvissuti con win rate tra il 39,6% e il 43,1%, le serie di perdite consecutive massime erano 6, 6, 6, 7 e 11 perdite consecutive. Se esegui una strategia con un win rate di circa il 40%, una serie di 6-11 perdite è l'esperienza attesa. Mostreremo quel numero accanto alle strategie con basso win rate, e i circuit breaker runtime (limiti di perdite consecutive e di perdite in finestre temporali) sono attivi per default — l'alternativa onesta al lasciarti scoprire la serie con soldi veri.
Nota sull'ambito: quella simulazione copre una finestra temporale, due dei tre timeframe, solo la lista di strategie legacy. I conteggi principali portano un'ampia incertezza; le conclusioni direzionali sono state verificate rispetto al funnel storico e reggono.
Cosa succede dopo
- L'audit. Le 10 strategie segnalate passano attraverso il nostro audit mensile della libreria — una decisione umana per ogni strategia, prove sul tavolo, nessuna rimozione silenziosa. Se una strategia viene ritirata, chiunque stia gestendo un bot su di essa lo sapprende direttamente da noi, prima di notarlo nell'interfaccia.
- Re-gauntlet mensile. Il replay completo della libreria è ora una parte fissa di quell'audit. Un badge guadagnato a giugno deve essere guadagnato di nuovo ad agosto; i regimi di mercato cambiano e la validazione ha una scadenza.
- Un catalogo più ampio. Con il flag nascosto corretto, le strategie volume e pattern entrano finalmente nella gara — e i grafici del funnel e delle famiglie in questo articolo saranno rigenerati dai dati persistiti, non ricostruiti dai log.
Cosa significa per te
Quando una strategia nella nostra libreria porta il badge di validazione, significa: ha superato un funnel che rifiuta più del 99% dei candidati, ha mantenuto almeno la metà della sua performance su dati che non aveva mai visto, le sue 500 storie alternative non contengono un drawdown rovinoso, e i suoi risultati non erano né troppo brutti né troppo buoni per essere credibili. Significa anche che il badge è revocabile — dai nostri stessi test, in pubblico, su un calendario.
Non possiamo prometterti alpha. Nessuno può farlo onestamente. Quello che possiamo promettere è che tutto ciò che pubblichiamo è stato testato contro la stessa macchina che abbiamo appena usato su noi stessi — e che quando la macchina trova qualcosa di imbarazzante, lo leggerai qui per primo.
Tutte le cifre in questo articolo provengono da artefatti di run committati e job di replay — nessuna è assemblata a mano. Tre run di discovery del luglio 2026 sono stati persi per via della rotazione dei log prima che la persistenza per candidato venisse implementata; le cifre per i run recuperati sono ricostruite dai log di run e contrassegnate come tali sopra.
Vuoi che l'IA di Anny analizzi il tuo portafoglio? Prova la Anny Line o vedi i prezzi.


