内容提要
AQuA系统由普林斯顿、蚂蚁和斯坦福团队开发,用于自主量化交易研究。它通过分离数据路径与评价规则,防止数据泄漏和过拟合,使Agent能可靠积累证据。实验显示,因子研究IC达0.190,模型预测IC为0.0843,样本外Sharpe达2.50。该系统强调研究过程的可靠性,而非仅依赖模型智能。
延伸解读
数据泄漏的隐蔽性:语义正确不等于代码正确
AQuA 论文披露的一次早期失败显示,Agent 编写的特征在语义上看似只使用历史数据,但代码实际访问了未来信息(如全日成交量分母)。作者 Agent 和审查 Agent 都未发现,说明仅靠模型审查无法保证可靠性。这提醒我们,在自主研究系统中,必须从数据路径上约束 Agent 的访问权限,而非依赖对代码含义的推理。
两类泄漏:生成过程与选择过程
AQuA 区分了两种数据泄漏:一是特征生成时访问未来信息,二是反复查看测试集导致过拟合。前者通过固定数据切分、特征和评价器来隔离,后者通过将最终测试窗口与搜索过程分离来避免。这种拆分对任何需要反复调用评价器的自主系统(如自动调参、药物筛选)都有借鉴意义,提醒我们既要防止实验污染,也要防止搜索适应指标。
研究制度的可靠性比模型智能更重要
AQuA 的核心观点是:自主研究系统的上限不仅取决于模型智能,更取决于系统能否区分新证据与偶然高分。通过将数据路径和评价规则置于循环之外,系统能可靠积累证据。这改变了人类在研究中的角色,从逐次检查实验转向设计审计制度。对于持续运行的 AI 系统,这种制度设计比依赖 Agent 的自我解释更可审计、更可靠。
Q&A
AQuA系统是由哪些机构开发的?
AQuA系统由普林斯顿大学、蚂蚁集团和斯坦福大学的研究团队联合开发。
AQuA系统如何防止数据泄漏和过拟合?
AQuA通过分离数据路径与评价规则来防止数据泄漏和过拟合。具体措施包括:固定数据切分、特征、标签和评价器,限制Agent只能使用预先登记的算子和组件,以及将最终测试集隔离在搜索过程之外,确保Agent无法反复查看测试结果。
AQuA在实验中取得了哪些关键性能指标?
在实验中,Part I在加密资产五分钟级数据上得到约0.190的组合验证集Spearman IC;Part II在美股未来30分钟收益预测上取得+0.0843的逐股票IC,转化后的多空策略在计入双边换手成本后,样本外Sharpe最高达到+2.50,2021-2025年间每年Sharpe均为正。
AQuA的递归自我改进具体指什么?
AQuA的递归自我改进不涉及底层模型权重的变化,而是发生在研究过程层面。系统通过保存每次实验的完整记录,包括假设、市场状态、与基线的比较以及推翻判断的证据,使后续研究能够基于这些可靠证据进行,从而持续改进研究质量。
AQuA系统由哪两部分组成,它们各自的研究对象是什么?
AQuA由Part I和Part II两部分组成。Part I研究符号化因子,Part II研究可训练模型。它们使用不同的Agent、记忆和候选空间,但遵循相同的研究原则。
AQuA在早期设计中遇到了什么失败案例,并如何改进?
早期设计中,Agent可以直接编写特征代码,导致出现数据泄漏。例如,一个特征使用了当天总成交量作为分母,而该数据在盘中不可得。两个Agent都未能发现此问题。因此,团队放弃了依赖模型审查的思路,改为限制Agent只能使用预先登记的算子和组件,从数据路径上杜绝泄漏。
AQuA如何区分两个数据泄漏入口?
AQuA区分了生成过程和选择过程两个泄漏入口。生成过程关注候选如何生成,通过固定数据切分、特征、标签和评价器,限制Agent只能使用登记过的算子;选择过程关注候选如何被选中,通过只向Agent返回验证集分数,并隔离最终测试集,防止Agent反复查看测试成绩。
AQuA的研究方法可以迁移到哪些其他领域?
AQuA的研究方法可以迁移到自动调参、材料发现、药物筛选或模型优化等领域,只要Agent可以反复调用评价器,就存在生成过程污染和搜索过程适应指标的风险,AQuA的隔离思路具有通用性。
AQuA系统有哪些局限性?
AQuA的局限性包括:Part I和Part II分别只在一个市场和一个预测周期上验证;交易结果来自模拟回测,尚未经过实盘检验;最终测试集的隔离依赖运行权限和审计,不是密码学意义上的强制隔离。