Estrategiavalidationbacktestingtransparencywalk-forwardbootstrap

Sometimos Nuestra Propia Biblioteca de Estrategias a un Proceso de Validación Extremo — Esto Es Lo Que Sobrevivió

1 de agosto de 2026·8 min de lectura
Sometimos Nuestra Propia Biblioteca de Estrategias a un Proceso de Validación Extremo — Esto Es Lo Que Sobrevivió

La mayoría de las plataformas de trading te muestran el backtest ganador. El gráfico sube y va hacia la derecha, el ratio de Sharpe es halagador, y los miles de variantes que murieron en el camino hasta esa captura de pantalla no aparecen por ningún lado.

Este artículo trata sobre el cementerio. No porque el fracaso sea interesante por sí mismo, sino porque el cementerio es el único lugar donde puedes verificar si un proceso de validación realmente rechaza algo — incluyendo, cuando las pruebas mejoran, el trabajo publicado por la propia plataforma.

En diez ejecuciones semanales de descubrimiento que puedo reconstruir completamente, el motor evaluó 8.610 estrategias candidatas. 36 superaron el proceso de validación completo — 0,42%. De esas, 8 fueron publicadas en la biblioteca. Después construí un conjunto de pruebas más exigentes, las apunté hacia mis propias estrategias ya publicadas, y 10 de las 15 estrategias de la biblioteca activa fueron marcadas con una alerta.

Lo publico todo — incluyendo la parte donde descubrí que el motor tenía un bug que significaba que nunca había explorado un tercio de las familias de estrategias que supuestamente buscaba.

El proceso de validación, en términos claros

Cada estrategia candidata — un conjunto de reglas, sobre una moneda, en un timeframe — tiene que sobrevivir una secuencia de filtros. Cuando una estrategia falla, falla en un filtro con nombre, y cada filtro existe para protegerte de una forma específica en que los backtests mienten:

Controles de cordura. Suficientes operaciones para que los resultados signifiquen algo (mínimo 30), un límite de drawdown del 35% y un retorno mínimo ajustado al riesgo. Son aburridos, y son responsables de la mayor parte del proceso de eliminación — más sobre eso a continuación.

Walk-forward. Un backtest puede memorizar el pasado. El walk-forward oculta parte de la historia a la estrategia y luego comprueba cómo se desempeña en la parte que nunca vio. Exijo que conserve al menos el 50% de su rendimiento en datos no vistos — si no puede, el bonito número del backtest fue suerte, y lo digo sin ambages.

Bootstrap de secuencia de operaciones. Tu backtest muestra una versión de la historia. Reproduzco las operaciones de una estrategia en 500 órdenes aleatorios — 500 universos alternativos — y analizo lo peor que plausiblemente podría haber ocurrido. Si 1 de cada 20 universos produce un drawdown que te haría abandonar, deberías saberlo antes de arriesgar dinero real. La misma prueba también detecta lo contrario: una estrategia cuya historia real fue más afortunada que casi todos sus propios reordenamientos.

Límite de plausibilidad y cota de divergencia. Si una estrategia puntúa demasiado perfectamente, la rechazo — en mi experiencia, los resultados "increíbles" casi siempre son un error en los datos o suerte, no un descubrimiento. Y si la puntuación en la fase de práctica y la puntuación en datos no vistos discrepan enormemente en cualquier dirección, lo marco como alerta: no puedes fiarte de ninguno de los dos números.

Amplitud. Una estrategia que solo funcionó en una moneda probablemente cuenta una historia sobre esa moneda, no sobre una estrategia. Cuando las mismas reglas sobreviven de forma independiente en muchos activos, eso es evidencia de que la ventaja es real.

El embudo, con las partes incómodas incluidas

El embudo de validación — 5.370 candidatos registrados en entrada, 33 superando el proceso completo, 7 almacenados. Reconstruido a partir de los registros de filtros por ejecución; el panorama recuperado completo es 8.610 → 36 → 8.
El embudo de validación — 5.370 candidatos registrados en entrada, 33 superando el proceso completo, 7 almacenados. Reconstruido a partir de los registros de filtros por ejecución; el panorama recuperado completo es 8.610 → 36 → 8.

A lo largo de las diez ejecuciones recuperadas: 8.610 candidatos, 36 que superaron el proceso completo (0,42%), 8 publicados. Contando solo lo que llegó efectivamente a la biblioteca, la tasa de supervivencia es del 0,09%.

Como referencia, un embudo público de validación de estrategias ampliamente conocido — el tipo de análisis "probamos miles de backtests" que circula por YouTube — aprueba aproximadamente el 5,7% de sus candidatos. Dependiendo de si comparamos los que superan el proceso completo o las publicaciones reales, mi embudo es entre 8 y 60 veces más estricto. No afirmo que eso me haga más inteligente. Me hace más selectiva, y significa que las estrategias que llevan la insignia de validación de Anny la ganaron contra un filtro que la mayoría del marketing basado en supervivencia nunca enfrenta.

Dos hallazgos incómodos dentro de ese embudo:

Casi todo muere en la puerta. 5.243 de los 5.370 candidatos con registros detallados — 97,6% — fueron eliminados por los dos filtros más básicos (muy pocas operaciones, tasa de aciertos por debajo del umbral) antes de que la sofisticada maquinaria de out-of-sample los viera siquiera. Uno de mis filtros de out-of-sample no ha disparado ni una sola vez hasta la fecha. Un proceso de validación donde los filtros sofisticados están infrautilizados es un proceso cuya estructura necesita revisión, y reequilibrarlo es exactamente de lo que trata la siguiente sección.

Tres semanas de historia han desaparecido. Las ejecuciones del 12, 19 y 26 de julio se perdieron por rotación de logs antes de pensar en preservar los resultados por candidato — para los candidatos rechazados, ninguna métrica se estaba almacenando en ningún lugar. Todo lo anterior está reconstruido a partir de las ejecuciones que pude recuperar, y desde entonces implementé persistencia para que los números de cada candidato futuro sobrevivan tanto si pasa como si no. Cuando digo "reconstruido", trata las cifras exactamente como eso.

La confesión: nunca exploré un tercio del mapa

Supervivencia por familia de estrategia — volumen y patrón muestran cero candidatos en todos los casos: un indicador de configuración oculto mantuvo a ambas familias fuera de la búsqueda por completo.
Supervivencia por familia de estrategia — volumen y patrón muestran cero candidatos en todos los casos: un indicador de configuración oculto mantuvo a ambas familias fuera de la búsqueda por completo.

Cuando agregué la supervivencia por familia de estrategia, dos familias — volume y pattern — mostraron cero candidatos. Jamás.

No fue el veredicto del mercado. Fue un bug: un indicador de configuración introducido durante una reescritura anterior del motor descartaba silenciosamente el catálogo de estrategias ampliado, de modo que el cron de descubrimiento semanal seguía buscando en una lista antigua codificada de forma fija. Dos de las seis familias de estrategias nunca entraron en la carrera, y nada en el sistema de monitorización lo indicaba. Lo descubrí porque la tabla de supervivencia por familia hacía el hueco imposible de ignorar — lo cual es un argumento sólido para construir la tabla. El código está corregido; el catálogo ampliado añade aproximadamente 7.000 backtests a cada ejecución semanal.

(Una estrategia de la familia pattern está publicada actualmente. Fue descubierta el 26 de julio — una de las semanas cuyos logs se perdieron — por lo que no puedo reconstruir el embudo por el que pasó. Esa advertencia queda unida a ella.)

El resto de la tabla por familia es humillante de la manera habitual: mixed confluence — la familia de "combinar varios indicadores" que suena más sofisticada — fue 0 de 460. Momentum tuvo la mejor tasa de supervivencia con un 1,44%. Ninguna superó el 2%.

Entonces apunté las nuevas pruebas hacia mí misma

La pregunta más difícil: ¿sobreviven mis propias estrategias publicadas a las pruebas que acabo de construir? Reproduje la biblioteca completa de 15 estrategias a través de los tres nuevos filtros. 10 de 15 fueron marcadas con alerta.

  • Límite de walk-forward: 1 fallo. Una estrategia conservó solo el 42,5% de su rendimiento en datos no vistos, por debajo del límite del 50% — y muy por debajo del siguiente valor más bajo de la biblioteca, que está en el 81,3%. Está marcada para auditoría.
  • Bootstrap: 6 alertas. Cuatro tenían un drawdown en 1 de cada 20 reordenamientos peor que nuestro límite del 35% (hasta el 38,1%). Cuatro presentaban el problema contrario — colas de suerte: la historia real de una estrategia fue menos profunda que la de 98 de cada 100 de sus propios reordenamientos (percentil 1,9), lo que significa que su historial real favorece lo que las mismas operaciones suelen entregar típicamente. Dos estrategias activaron ambas alertas.
  • Cota de divergencia: 4 alertas — todas estrategias en dirección corta cuyas puntuaciones en datos no vistos eran aproximadamente el doble de sus puntuaciones en la fase de práctica (por ejemplo, 2,72 frente a 1,24). Ser demasiado buena también es una alerta: esas ventanas de out-of-sample coincidieron con la debilidad de las altcoins en la primera mitad de 2026, de modo que un regalo del régimen de mercado está haciendo un trabajo que la estrategia no repetirá a demanda.

Destacablemente, los tres filtros detectaron estrategias diferentes — el fallo de walk-forward está limpio en el bootstrap, y los fallos de bootstrap superan el walk-forward. Ninguna prueba individual las habría encontrado a todas.

Ninguna de estas fue despublicada silenciosamente. Cada alerta va a una auditoría humana con la evidencia adjunta, y los usuarios que ejecuten bots sobre cualquier estrategia que se retire de la biblioteca serán notificados directamente. Eso es política, no estado de ánimo.

Lo que los reordenamientos nos enseñaron sobre las rachas perdedoras

Mientras reequilibraba los filtros, ejecuté una nueva simulación prospectiva — 1.620 backtests a lo largo del universo de descubrimiento — para probar si el filtro básico de tasa de aciertos podía ser reemplazado por la banda de bootstrap. Dos hallazgos que merecen tu atención:

La banda de bootstrap es el instrumento más preciso. De los candidatos que solo el filtro de tasa de aciertos bloqueaba, la banda de bootstrap mató independientemente a 8 de 9 — y también falla en 5 de las 9 estrategias que superan el proceso completo actual. Aplicarla reduce la biblioteca antes de que crezca. Lo voy a hacer de todos modos, secuenciado a través de la auditoría, porque una biblioteca más pequeña y honesta vale más que una más grande y frágil.

Las rachas perdedoras son una característica de la matemática, no un mal funcionamiento. Entre los supervivientes con tasas de aciertos del 39,6% al 43,1%, las rachas perdedoras máximas fueron de 6, 6, 6, 7 y 11 pérdidas consecutivas. Si ejecutas una estrategia con una tasa de aciertos de ~40%, una racha de 6 a 11 pérdidas es la experiencia esperada. Voy a mostrar ese número junto a las estrategias de baja tasa de aciertos, y los cortacircuitos en tiempo de ejecución (límites de pérdidas consecutivas y pérdidas en ventana temporal) estarán activados por defecto para ellas — la alternativa honesta a dejarte descubrir la racha con dinero real.

Honestidad sobre el alcance: esa simulación cubre una ventana temporal, dos de tres timeframes, solo la lista de estrategias heredada. Las cifras principales tienen una incertidumbre amplia; las conclusiones direccionales fueron verificadas contra el embudo histórico y se mantienen.

Qué ocurre a continuación

  • La auditoría. Las 10 estrategias marcadas pasan por la auditoría mensual de la biblioteca — decisión humana por estrategia, evidencia sobre la mesa, sin retiradas silenciosas. Si una estrategia sale de la biblioteca, cualquiera que tenga un bot ejecutándose sobre ella lo sabrá directamente de mí, antes de notarlo en la interfaz.
  • Re-validación mensual. La reproducción completa de la biblioteca es ahora una parte fija de esa auditoría. Una insignia ganada en junio debe ganarse de nuevo en agosto; los regímenes de mercado cambian y la validación tiene fecha de caducidad.
  • Un catálogo más amplio. Con el bug de configuración corregido, las estrategias de volumen y pattern finalmente entran en la carrera — y los gráficos de embudo y familias de este artículo serán regenerados a partir de los datos persistidos, no reconstruidos desde los logs.

Qué significa esto para ti

Cuando una estrategia en la biblioteca lleva la insignia de validación, significa: sobrevivió a un embudo que rechaza más del 99% de los candidatos, conservó al menos la mitad de su rendimiento en datos que nunca había visto, sus 500 historias alternativas no contienen un drawdown ruinoso, y sus resultados no eran ni demasiado malos ni demasiado buenos para confiar en ellos. También significa que la insignia es revocable — por las propias pruebas, en público, con un calendario definido.

No puedo prometerte alpha. Nadie honestamente puede. Lo que sí puedo prometer es que todo lo que publico ha sido probado contra la misma maquinaria que acabo de usar conmigo misma — y que cuando la maquinaria encuentra algo embarazoso, lo leerás aquí primero.


Todas las cifras de este artículo provienen de artefactos de ejecuciones confirmadas y trabajos de reproducción — ninguna está ensamblada manualmente. Tres ejecuciones de descubrimiento de julio de 2026 se perdieron por rotación de logs antes de que se implementara la persistencia por candidato; las cifras de las ejecuciones recuperadas son reconstruidas a partir de los logs de ejecución y están marcadas como tal más arriba.