我们把自己的策略库送上了验证炼狱——以下是存活下来的

大多数交易平台只给你看赢了的回测。图表向右上方延伸,Sharpe ratio 漂亮得体,而那些死在截图之前的无数变体,早已销声匿迹。
这篇文章写的是那片墓地。不是因为失败本身有什么趣味,而是因为只有在墓地里,你才能验证一套验证流程究竟有没有真正淘汰过什么——包括当测试变得更严苛时,拿自己已发布的成果开刀。
在我们可以完整复盘的十次每周发现运行中,我们的引擎评估了 8,610 个策略候选。36 个通过了完整的验证炼狱——0.42%。其中 8 个最终发布到策略库。然后我们构建了一套更严苛的测试,对准自己已发布的策略,结果:15 个在线策略中有 10 个被标记。
我们把一切都公开了——包括我们发现自己的引擎存在一个 bug,导致它声称要搜索的策略族中有三分之一从未被真正搜索过。
验证炼狱,用大白话说
每一个候选策略——某个规则集,针对某个币种,在某个时间框架上——必须依次通过一套过滤器。策略失败时,它会在某个具名过滤器上失败,每个过滤器的存在都是为了防止一种具体的回测造假方式:
基础健全门控。 足够的交易次数才有统计意义(最低 30 次)、35% 的最大回撤上限、以及最低风险调整收益要求。枯燥,但负责终结了绝大多数候选——详见下文。
Walk-forward 验证。 回测可以"背下"过去的历史。Walk-forward 将部分历史对策略隐藏,然后检验它在从未见过的数据上表现如何。我们要求它至少保留 50% 的样本外表现——如果做不到,那个漂亮的回测数字不过是运气,我们会直说。
交易序列 bootstrap。 你的回测只展示了历史的一个版本。我们将策略的交易打乱顺序重放 500 次——500 个平行宇宙——然后观察在最坏的合理情况下会发生什么。如果 20 分之 1 的平行宇宙产生的回撤会让你提前离场,你应该在真钱介入之前就知道这一点。同样的测试也能发现相反的情况:某个策略的真实历史比它自己几乎所有的重排版本都更幸运。
合理性上限与偏差边界。 如果一个策略的得分完美得令人难以置信,我们会拒绝它——根据我们的经验,"难以置信"的结果几乎总是数据错误或运气,而不是真正的发现。如果它的练习分数与样本外分数在任意方向上出现巨大分歧,我们也会标记它:两个数字都不值得信任。
广度验证。 一个只在单一币种上有效的策略,很可能讲的是那个币的故事,而不是一套策略。当同一套规则在许多资产上独立存活下来,那才是边缘优势真实存在的证据。
漏斗数据,包括那些让人尴尬的部分

在十次已恢复的运行中:8,610 个候选,36 个通过完整炼狱(0.42%),8 个发布。若只计算真正进入策略库的,存活率为 0.09%。
作为参考,一个广为流传的公开策略验证漏斗——那种在 YouTube 上传播的"我们测试了数千个回测"分析——大约通过 5.7% 的候选。取我们的炼狱通过率或实际发布数相比,我们的漏斗严苛 8 到 60 倍。这不代表我们更聪明,而是代表我们更挑剔——也意味着那些确实获得我们验证徽章的策略,是在大多数幸存者偏差式营销从未面对过的过滤器面前赢得的。
这个漏斗里有两个让人尴尬的发现:
几乎所有东西都死在门口。 在有详细日志的 5,370 个候选中,5,243 个——即 97.6%——在最基础的两个门控(交易次数不足、胜率低于阈值)处就被淘汰,复杂的样本外机制从未见过它们。我们的某个样本外门控,迄今为止从未触发过一次。一个高级门控严重闲置的炼狱,说明它的结构需要调整,而调整正是下一节的主题。
三周的历史记录已经丢失。 我们 7 月 12 日、19 日和 26 日的运行,在我们想到保留每个候选结果之前就已被日志轮转清除——被拒绝的候选,其指标从未存储在任何地方。以上所有数据都是从可恢复的运行中重建的,此后我们已上线持久化功能,确保每个未来候选的数据无论通过与否都会保留。当我们说"重建"时,请将这些数据视为重建结果。
坦白:我们甚至从未搜索过三分之一的地图

当我们按策略族汇总存活率时,两个族——volume 和 pattern——显示零候选,从未有过。
这不是市场的判决,而是一个 bug:在早期引擎重写期间引入的一个配置标志,静默地丢弃了我们扩展后的策略目录,导致每周发现的定时任务持续搜索一个旧的硬编码列表。我们六个策略族中的两个从未参加过比赛,而我们的监控对此只字未提。我们发现它,是因为族存活率表格让这个空洞变得无法忽视——这也是构建这张表格的充分理由。配置已修复;扩展后的目录为每次每周运行新增约 7,000 个回测。
(有一个 pattern 族策略目前确实已发布。它是在 7 月 26 日被发现的——正是日志已丢失的那周——因此我们无法复原它经历的漏斗。这个注意事项将一直附在它身上。)
其余的族存活率表令人以普通方式感到羞愧:混合合流——那个"组合多个指标"的族,听起来最复杂——在 460 次尝试中全军覆没。Momentum 族拥有最高存活率,为 1.44%。没有任何策略族超过 2%。
然后我们把新门控对准了自己
更难回答的问题是:我们自己已发布的策略,能否通过刚刚构建的测试?我们将完整的 15 个策略库通过三个新门控重放了一遍。15 个中有 10 个被标记。
- Walk-forward 下限:1 次失败。 一个策略在样本外数据上仅保留了 42.5% 的表现,低于我们 50% 的下限——而库中次低的策略为 81.3%。该策略已标记待审。
- Bootstrap:6 个被标记。 四个策略的 1/20 重排回撤超过了我们 35% 的上限(最高达 38.1%)。另外四个则是相反的问题——幸运尾部:一个策略的真实历史比它自身 100 次重排中的 98 次都更浅(百分位 1.9),意味着其实盘记录远比同一批交易通常能交出的成绩要好看。两个策略同时命中两个标记。
- 偏差边界:4 个被标记——均为空头方向策略,其样本外得分约为练习得分的两倍(例如 2.72 对比 1.24)。"太好"同样是一个标记:那些样本外窗口恰好落在 2026 年上半年山寨币的疲软期,一个市场机制的馈赠正在代替策略本身做功,而这种馈赠不会在需要时重演。
值得注意的是,三个门控捕获的是不同的策略——walk-forward 失败的那个 bootstrap 完全合格,而 bootstrap 失败的那些通过了 walk-forward。没有任何单一测试能发现全部问题。
没有任何策略被静默下架。每一个标记都会附带证据提交人工审核,任何被下架策略上运行了机器人的用户,将在界面变化之前直接收到通知。这是政策,不是心情。
重排告诉我们关于连败的事
在重新平衡门控的过程中,我们对发现宇宙运行了一次新的前向模拟——1,620 个回测——以测试粗糙的胜率门控是否可以被 bootstrap 区间取代。两个值得你花时间了解的发现:
Bootstrap 区间是更锋利的工具。 在仅被胜率门控拦住的候选中,bootstrap 区间独立淘汰了其中 9 个里的 8 个——而且它同样会淘汰当前通过完整炼狱的 9 个策略中的 5 个。强制执行它会在策略库增长之前先压缩它。我们仍然会这么做,通过审核流程有序推进——因为一个更小但诚实的策略库,胜过一个更大但脆弱的。
连败是数学的特征,不是故障。 在胜率为 39.6–43.1% 的存活策略中,最大连败次数分别为 6、6、6、7 和 11 连续亏损。如果你运行一个胜率约 40% 的策略,6 到 11 连败是预期中的体验。我们将把这个数字显示在低胜率策略旁边,并为它们默认开启运行时熔断器(连续亏损限制和时间窗口亏损限制)——这是诚实的替代方案,而不是让你用真钱去亲自发现连败。
范围说明:该模拟只覆盖一个时间窗口、两个时间框架中的三个、以及遗留策略列表。其总量数字存在较大不确定性;方向性结论已与历史漏斗进行交叉验证,结论成立。
接下来发生什么
- 审核。 10 个被标记的策略进入月度策略库审核——每个策略单独由人工决定,证据摆在桌上,没有静默下架。如果某个策略从架上撤下,任何在其上运行机器人的用户将在界面变化之前直接听到我们的通知。
- 月度重跑炼狱。 完整策略库重放现已成为该审核的常规环节。六月获得的徽章,八月必须重新赢得;市场机制会变化,验证也有保质期。
- 更广的策略目录。 随着遮蔽配置修复,volume 和 pattern 策略终于进入比赛——本文中的漏斗图和族存活率图将从持久化数据中重新生成,而不再依赖日志重建。
这对你意味着什么
当我们策略库中的某个策略获得验证徽章时,它意味着:它在一个淘汰率超过 99% 的漏斗中存活下来,在从未见过的数据上至少保留了一半的表现,它的 500 个平行历史中不包含毁灭性的回撤,其结果既不差到、也不好到让人无法信任。它还意味着这枚徽章是可撤销的——被我们自己的测试,公开地,按计划地。
我无法承诺给你 alpha。没有人能诚实地做到这一点。我能承诺的是:我们发布的一切,都经历过我们刚刚用来审视自己的同一套机制——当这套机制发现了让人尴尬的东西时,你会在这里第一个读到。
本文所有数据均来自已提交的运行产物和重放任务——无一出自手工整理。2026 年 7 月的三次发现运行,在每候选持久化上线之前已被日志轮转清除;已恢复运行的数据为从运行日志中重建的结果,已在上文特别注明。
想让 Anny AI 分析您的投资组合? 试试 Anny Line 或 查看价格.


