Tantoryn AI 过去三周同时涵盖了多条战线:拓展项目的公开面、为团队扩张做准备,以及延续一轮漫长的机器学习研究周期。

为项目的下一阶段做准备

随着 Tantoryn AI 的成长,我们已经开始重塑项目内部的组织方式,使其不仅服务于创始人本人,也能适应加入进来的新成员。

我们将项目架构及其工作领域的描述整理成了系统化的形式,更新了路线图,并开始为未来的团队成员构建一份独立的背景资料。路线图刻意将开发顺序与指示性日期区分开来:各阶段的先后顺序,比试图提前把研究工作硬性绑定到一份严格日历上更为重要。

与此同时,我们也在为团队扩张做准备。首批正在考虑的岗位中包括 Lead Developer 和 Community Manager。

针对 Community Manager 一职,一个专门面向公众的领域正在逐步成形:网站、发布内容、社交平台以及来自受众的反馈。未来,我们计划通过 TAICM —— Tantoryn AI Community Manager —— 来支持这项工作的一部分,但发布内容与回复仍需经过人工审批。TAICM 本身目前仍是一个发展方向,而非已经运行的系统。

我们的公开面也在扩大

在同一时期,我们持续推进“受控披露下的公开建设”这一模式。

其背后的理念很简单:不仅讲述成功的结果,也讲述研究进展本身 —— 各项检查、被证明错误的假设,以及决策发生变化的原因 —— 同时不公开交易核心逻辑、私有数据,或实质上会揭示系统算法工作方式的细节。

在网站上,我们扩充了联系方式以及指向项目公开资源的链接。Tantoryn AI 的研究文章目前发布在 Dzen 和 Medium 上,我们也在使用 HackerNoon 及其他公开平台,而项目自身的新闻则保留在 tantoryn.com 上。

这种区分对我们而言很重要。一篇文章应当独立于 Tantoryn AI,就问题本身进行阐释。而一条项目新闻,则应当展示我们究竟是在何处遇到了那个问题,以及我们的工作因此发生了怎样的改变。

正因如此,我们尽量不在不同平台之间复制同样的材料,而是将科普性文章与项目实际开发过程中的实践故事联系起来。

在 ML 方面,我们经历了若干未能奏效的假设

尽管如此,这项 ML 工作还是把我们引向了一个重要的实践结论:一个复杂模型的价值,并非源于其复杂本身,而只有当其优势经受住与更简单方案的公平比较之后,才真正成立。

近几周的大部分技术工作都围绕 ML Evaluator —— 项目基于 AI 的评估层 —— 展开。

我们使用在时间上相互分离的开发与验证阶段、重复的训练运行,以及预先固定的实验规则,依次测试了不同的模型系列以及不同的任务表述方式。

部分结果在模型对市场状态排序的能力方面显得颇有希望。但进一步的检查揭示出一个问题:良好的 ML 排序能力,并不等同于已经找到了一个具有经济价值的优势。

我们没有把这一结果转化为“成功交易模型”的主张。相反,我们停止了那条调优路线,并重新思考了任务本身的表述方式。该研究分支作为一次历史性实验被关闭,不附带任何关于盈利能力或真实交易准备就绪的主张。

这也带来了一项更为根本的变化。ML Evaluator 的角色被收窄回一项更聚焦的任务:根据市场状态,估计某个交易场景成功展开的可能性,而整个系统的经济结果则被单独测试。为此,我们设置了一项新的分类任务,用于区分失败、部分成功与成功三种结果。

新模型显示出信号 —— 但下一个问题随之出现

在重新表述任务之后,我们准备了一轮新的训练周期,并对其中一个模型进行了首次完整检验。

这一结果之所以有价值,正是因为它没有给出诸如“模型好”或“模型差”这样简单的答案。

该模型确实展现出区分更有希望与较无希望的市场状态的能力,并通过了为这一阶段设定的检查。

与此同时,我们将其与一个基于一小组基础市场状况特征构建的、远为简单的参照基准进行了比较。

在关键的独立检验中,这个简单的 baseline 表现强于复杂的 ML 模型。

这并不意味着我们所做的训练毫无价值。恰恰相反,这样一次比较表明,我们的研究控制机制正在发挥作用:新增的复杂性,尚未证明其能带来相应的价值。

正因如此,眼下对我们而言,更重要的是弄清楚这个简单 baseline 依赖的是哪些信息,以及为什么更复杂的模型未能从数据中提取出更多信息,而不是不惜一切代价去推高一个看起来漂亮的模型数字。

我们单独研究了这一问题

与此同时,我们研究了这种情况在当代金融 ML 中有多普遍 —— 结果表明,这远非 Tantoryn AI 所独有的问题。

我们在 Medium 上的一篇独立文章中,更详细地分享了这项研究的发现:"When a Simple Baseline Beats AI: Why More Complex Doesn’t Always Mean Better"。

近期关于金融时间序列的研究呈现出一幅复杂的图景:现代神经网络与基于 Transformer 的方法确实能够超越经典方法,但并非总是如此。在某些机制下,线性与自回归 baseline 依然具有竞争力,甚至优于复杂得多的架构。

因此,关键问题不在于模型有多复杂,而在于其优势能否在相同的数据、相同的时间划分和相同的评估规则下依然成立。

我们就此写了一篇独立文章:"When a Simple Baseline Beats AI: Why More Complex Doesn’t Always Mean Better"。

在文中,我们独立于 Tantoryn AI 探讨了这一问题:为什么金融 ML 需要简单的 baseline、为什么在单一指标上取胜是不够的,以及为什么一个负面结果可能比又一轮模型调优更有价值。

接下来是什么

ML 方向的下一步,并不是默认让系统变得更复杂。

首先,我们需要弄清楚,为什么这个简单的参照基准表现强于新系列中第一个接受测试的模型。在此之后,其余的方法也都必须经受同样的比较原则:新增的复杂性必须证明其能带来价值。

与此同时,围绕 Tantoryn AI 公开面的工作,以及为项目组建更大团队所做的准备,也将继续推进。

因此,近几周的主要成果并非某一个新模型或新功能。项目正同时在三个方向上逐步变得更加结构化:研究、公开透明度,以及未来团队的组织建设。

而在 ML 方面,我们再一次得到了一个即便令人不太舒服、我们仍认为值得保留的结果:如果一个简单的 baseline 表现强于复杂的 AI,正确的下一步不是把这个 baseline 藏起来,而是去弄清楚背后的原因。