Submetemos Nossa Própria Biblioteca de Estratégias a um Gauntlet de Validação — Veja O Que Sobreviveu

A maioria das plataformas de trading só mostra o backtest vencedor. O gráfico sobe e vai para a direita, o Sharpe ratio é lisonjeiro, e os milhares de variantes que morreram no caminho até aquela screenshot não aparecem em lugar nenhum.
Este artigo é sobre o cemitério. Não porque fracasso seja interessante por si só, mas porque o cemitério é o único lugar onde você pode verificar se um processo de validação rejeita alguma coisa de verdade — inclusive, quando os testes ficam mais rigorosos, o próprio trabalho publicado pela plataforma.
Em mais de dez rodadas semanais de descoberta que conseguimos reconstruir, nosso motor avaliou 8.610 candidatos a estratégia. 36 passaram pelo gauntlet completo — 0,42%. Desses, 8 foram de fato publicados na biblioteca. Depois, construímos um conjunto de testes mais rigorosos, apontamos para nossas próprias estratégias já publicadas, e 10 das 15 estratégias da nossa biblioteca ativa foram sinalizadas.
Estamos publicando tudo — inclusive a parte em que descobrimos que nosso próprio motor tinha um bug que fazia com que ele nunca buscasse em um terço das famílias de estratégias que dizia buscar.
O gauntlet, em linguagem direta
Cada estratégia candidata — um conjunto de regras, em uma moeda, em um timeframe — precisa sobreviver a uma sequência de filtros. Quando uma estratégia falha, ela falha em um filtro com nome, e cada filtro existe para proteger você de uma forma específica pela qual os backtests mentem:
Portões de sanidade. Trades suficientes para significar algo (mínimo de 30), um limite de drawdown de 35% e um retorno mínimo ajustado ao risco. Entediante, e responsável pela maior parte das eliminações — mais sobre isso abaixo.
Walk-forward. Um backtest pode memorizar o passado. O walk-forward esconde parte da história da estratégia e depois verifica como ela se sai na parte que nunca viu. Exigimos que ela mantenha pelo menos 50% da sua performance em dados não vistos — se não conseguir, o número bonito do backtest foi sorte, e dizemos isso claramente.
Bootstrap de sequência de trades. Seu backtest mostra uma versão da história. Repetimos os trades de uma estratégia em 500 ordens embaralhadas — 500 universos alternativos — e olhamos para o pior que poderia ter acontecido de forma plausível. Se 1 em 20 universos produz um drawdown que faria você desistir, você precisa saber disso antes de colocar dinheiro real. O mesmo teste também captura o oposto: uma estratégia cuja história real foi mais sortuda do que quase todos os seus próprios embaralhamentos.
Teto de plausibilidade e limite de divergência. Se uma estratégia pontua de forma perfeita demais, a rejeitamos — na nossa experiência, resultados "incríveis" são quase sempre um erro de dados ou sorte, não uma descoberta. E se o score do período de prática e o score dos dados não vistos discordam muito em qualquer direção, sinalizamos: você não pode confiar em nenhum dos dois números.
Abrangência. Uma estratégia que só funcionou em uma moeda é provavelmente uma história sobre aquela moeda, não uma estratégia. Quando as mesmas regras sobrevivem de forma independente em muitos ativos, isso é evidência de que o edge é real.
O funil, com as partes inconvenientes incluídas

Ao longo das dez rodadas recuperadas: 8.610 candidatos, 36 aprovados no gauntlet completo (0,42%), 8 publicados. Contando apenas o que chegou de fato à biblioteca, a sobrevivência é de 0,09%.
Para contexto, um funil público de validação de estratégias bastante conhecido — o tipo de análise "testamos milhares de backtests" que circula no YouTube — aprova aproximadamente 5,7% dos seus candidatos. Dependendo de se você compara os aprovados no nosso gauntlet ou nossas publicações reais, nosso funil é 8 a 60 vezes mais rigoroso. Não estamos dizendo que isso nos torna mais inteligentes. Nos torna mais seletivos, e significa que as estratégias que carregam nosso selo de validação o conquistaram contra um filtro que a maioria do marketing enviesado por survivorship nunca enfrenta.
Dois achados inconvenientes dentro desse funil:
Quase tudo morre na porta. 5.243 dos 5.370 candidatos com logs detalhados — 97,6% — foram eliminados pelos dois portões mais básicos (trades insuficientes, win rate abaixo do limiar) antes que o maquinário sofisticado de out-of-sample chegasse sequer a vê-los. Um dos nossos portões de out-of-sample, até hoje, jamais disparou uma única vez. Um gauntlet onde os portões sofisticados ficam subempregados é um gauntlet cuja estrutura precisa ser revisada, e reequilibrá-lo é exatamente o que a próxima seção aborda.
Três semanas de histórico foram perdidas. Nossas rodadas de 12, 19 e 26 de julho foram perdidas por rotação de logs antes de pensarmos em preservar os resultados por candidato — para candidatos rejeitados, nenhuma métrica estava sendo armazenada em lugar nenhum. Tudo acima foi reconstruído a partir das rodadas que conseguimos recuperar, e desde então implementamos persistência para que os números de cada candidato futuro sobrevivam independentemente de ele passar ou não. Quando dizemos "reconstruído", trate os números exatamente como isso.
A confissão: nunca chegamos a explorar um terço do mapa

Quando agregamos a sobrevivência por família de estratégia, duas famílias — volume e pattern — mostraram zero candidatos. Sempre.
Não foi o veredicto do mercado. Foi um bug: um flag de configuração introduzido durante uma reescrita anterior do motor descartava silenciosamente nosso catálogo expandido de estratégias, fazendo com que o cron semanal de descoberta continuasse buscando em uma lista hardcoded antiga. Duas das nossas seis famílias de estratégias nunca entraram na corrida, e nada no nosso monitoramento indicava isso. Descobrimos porque a tabela de sobrevivência por família tornava o buraco impossível de ignorar — o que é um bom argumento para construir a tabela. A configuração foi corrigida; o catálogo expandido adiciona aproximadamente 7.000 backtests a cada rodada semanal.
(Uma estratégia da família pattern está atualmente publicada. Foi descoberta em 26 de julho — uma das semanas cujos logs perdemos — então não conseguimos reconstruir o funil pelo qual ela passou. Essa ressalva permanece associada a ela.)
O restante da tabela por família é humilhante do jeito comum: mixed confluence — a família de "combinar vários indicadores" que parece mais sofisticada — foi 0 de 460. Momentum teve a melhor taxa de sobrevivência, com 1,44%. Nada passou de 2%.
Então apontamos os novos portões para nós mesmos
A pergunta mais difícil: nossas próprias estratégias publicadas sobrevivem aos testes que acabamos de construir? Repetimos a biblioteca completa de 15 estratégias pelos três novos portões. 10 das 15 foram sinalizadas.
- Piso de walk-forward: 1 falha. Uma estratégia manteve apenas 42,5% da sua performance em dados não vistos, abaixo do nosso piso de 50% — e bem abaixo da segunda colocada mais baixa na biblioteca, com 81,3%. Está sinalizada para auditoria.
- Bootstrap: 6 sinalizadas. Quatro tiveram um drawdown no reshuffling de 1 em 20 pior do que nosso limite de 35% (chegando a 38,1%). Quatro apresentaram o problema oposto — caudas sortudas: o histórico real de uma estratégia foi mais raso do que 98 em 100 dos seus próprios reshufflings (percentil 1,9), o que significa que seu desempenho ao vivo flateia o que os mesmos trades normalmente entregariam. Duas estratégias atingiram ambos os flags.
- Limite de divergência: 4 sinalizadas — todas estratégias na direção short cujos scores em dados não vistos eram aproximadamente o dobro dos scores de prática (ex: 2,72 vs 1,24). Bom demais também é um flag: aquelas janelas de out-of-sample ficaram na fraqueza das altcoins do primeiro semestre de 2026, então um presente de regime está fazendo um trabalho que a estratégia não vai repetir sob demanda.
Notavelmente, os três portões capturaram estratégias diferentes — a falha no walk-forward está limpa no bootstrap, e as falhas no bootstrap passam no walk-forward. Nenhum teste único teria encontrado todas elas.
Nenhuma foi despublicada silenciosamente. Cada flag vai para uma auditoria humana com as evidências anexadas, e os usuários que têm bots rodando em qualquer estratégia que venha a ser retirada serão notificados diretamente. Isso é política, não humor do momento.
O que os reshufflings nos ensinaram sobre sequências de perdas
Enquanto reequilibrávamos os portões, rodamos uma nova simulação forward — 1.620 backtests pelo nosso universo de descoberta — para testar se o portão cru de win rate poderia ser substituído pela banda do bootstrap. Dois achados que valem seu tempo:
A banda do bootstrap é o instrumento mais preciso. Dos candidatos que apenas o portão de win rate estava bloqueando, a banda do bootstrap eliminou independentemente 8 de 9 — e também reprova 5 das 9 estratégias que passam pelo gauntlet atual. Aplicá-la encolhe a biblioteca antes de qualquer crescimento. Vamos fazê-lo de qualquer forma, sequenciado pela auditoria, porque uma biblioteca menor e honesta é melhor do que uma maior e frágil.
Sequências de perdas são uma característica da matemática, não uma falha. Entre os sobreviventes com win rates de 39,6–43,1%, as sequências máximas de perdas consecutivas foram 6, 6, 6, 7 e 11 derrotas seguidas. Se você roda uma estratégia com win rate de ~40%, uma sequência de 6 a 11 perdas é a experiência esperada. Vamos exibir esse número ao lado das estratégias de baixo win rate, e circuit breakers em tempo real (limites de perdas consecutivas e perdas em janela de tempo) ficam ativados por padrão para elas — a alternativa honesta a deixar você descobrir a sequência com dinheiro real.
Honestidade de escopo: essa simulação é uma janela de tempo, dois de três timeframes, lista de estratégias legada apenas. Os números principais carregam grande incerteza; as conclusões direcionais foram verificadas contra o funil histórico e se sustentam.
O que acontece a seguir
- A auditoria. As 10 estratégias sinalizadas passam pela nossa auditoria mensal de biblioteca — decisão humana por estratégia, evidências na mesa, sem remoções silenciosas. Se uma estratégia sair da prateleira, qualquer um que tenha um bot rodando nela ouve de nós diretamente, antes de notar na interface.
- Re-gauntlet mensal. O replay completo da biblioteca é agora parte permanente dessa auditoria. Um selo conquistado em junho precisa ser reconquistado em agosto; regimes de mercado mudam e a validação tem prazo de validade.
- Um catálogo mais amplo. Com o bug de configuração corrigido, as estratégias de volume e pattern finalmente entram na corrida — e os gráficos de funil e família neste artigo serão regerados a partir dos dados persistidos, não reconstruídos a partir de logs.
O que isso significa para você
Quando uma estratégia na nossa biblioteca carrega o selo de validação, significa: ela sobreviveu a um funil que rejeita mais de 99% dos candidatos, manteve pelo menos metade da sua performance em dados que nunca viu, seus 500 históricos alternativos não contêm um drawdown ruinoso, e seus resultados não foram bons nem ruins demais para confiar. Também significa que o selo é revogável — pelos nossos próprios testes, em público, com uma frequência definida.
Não podemos prometer alpha para você. Ninguém honestamente pode. O que podemos prometer é que tudo que publicamos foi testado contra o mesmo maquinário que acabamos de usar em nós mesmos — e que quando esse maquinário encontra algo embaraçoso, você vai ler sobre isso aqui primeiro.
Todos os números neste artigo vêm de artefatos de rodadas confirmadas e jobs de replay — nenhum foi montado manualmente. Três rodadas de descoberta de julho de 2026 foram perdidas por rotação de logs antes da implementação da persistência por candidato; os números das rodadas recuperadas são reconstruídos a partir dos logs de rodada e marcados como tal acima.
Quer que a IA da Anny analise seu portfólio? Experimente a Anny Line ou veja os preços.


