长期以来,金融机器学习中自然而然的问题一直是哪个模型表现最好 —— 梯度提升、LSTM、Transformer,还是其他方法。到了 2026 年,越来越多的研究指向了一个不同的问题:那个宣布某模型获胜的实验本身,究竟是否值得信赖?
近期的研究工作表明,这种差异可以有多大。在 2026 年 7 月 22 日发表的一项研究《Quantifying Backtest Overfitting from Information Leakage》中,作者故意向一个金融 ML 流水线中引入信息泄漏,然后利用 walk-forward 验证和时间禁运逐步将其消除。其结果比“泄漏会夸大指标”这一常见说法更为重要:失真的大小,甚至方向,都取决于架构与验证机制。换句话说,不能想当然地认为一个微小的技术性不严谨只会略微美化结果 —— 它完全可能彻底改变实验的结论。
另一项于 7 月 20 日发表的研究《Evaluation Integrity in Machine Learning for Finance》,将该问题置于更宏观的视角。作者将整个金融 ML 流程 —— 从数据采集、特征构建,到模型选择、回测,再到持续监控 —— 视为一个需要整体核查的单一系统。其核心观点很简单:泄漏、选择偏差、回测过拟合以及可复现性问题并非源自单一环节。因此,质量控制也必须覆盖整个流水线,而不仅仅是模型的最终测试。
此外还有一个与决策时点密切相关的独立问题。论文《When Alpha Disappears》表明,时间语义上一个看似微小的变化 —— 例如使用了在决策时点实际上并不可得的信息 —— 就可能显著改变金融回测的结果。作者建议通过每次只改变一个假设、其余条件保持不变的方式来诊断这些影响。
对于加密货币市场而言,还存在额外的一层考量:真实的执行情况。一项 2026 年针对 BTC/USDT 的研究《Machine Learning-Based Bitcoin Trading Under Transaction Costs》,在 walk-forward 设定下比较了多个 ML 模型,发现即便毛收益结果亮眼,在计入交易成本后也未必等同于一个在经济上可行的策略。作者还指出,一种架构相对于另一种架构的统计优势,远没有单独的头条指标所暗示的那样明确。
这是一个意义重大的转变。一个复杂精巧的模型,已不再是系统在技术上成熟的充分证明。更严格的标准看起来完全不同:
在决策的那一刻,模型实际上能够知道什么?
过去与未来是如何被分隔开的?
测试信息是否在预处理或模型选择的任何环节中被使用过?
模拟是否与事件的真实发生顺序相符?
在不同的时间段和条件下,该结论是否依然成立?
是否计入了真实成本?
该核查能否被独立复现?
这正是为什么在 Tantoryn AI,研究纪律被视为架构本身的一部分,而不是训练完成后附加的最终检查。项目已经公开承诺了一系列原则:按时间顺序验证、因果重构、泄漏控制、预先锁定的评估规则、稳健性测试,以及对重大结果的独立核查。这些都不是对盈利能力的主张 —— Tantoryn AI 仍处于早期公开测试阶段,以 live-paper/虚拟交易模式运行,真实订单执行功能已禁用。
这里有一个重要的区别:一个好的结果,与一个值得信赖的结果并不相同。前者可能很快就会出现。后者则需要约束条件、负面实验、暂时保留不用的数据,以及在核查发现问题时愿意舍弃该结果的态度。
对于交易领域的 AI/ML 而言,这种纪律最终可能会成为比下一个新架构更重要的优势。
在 Tantoryn AI,我们坚持同样的顺序:先有证据,后有结论。而不是反过来。