内容提要
蚂蚁国际发布自研时序AI预测大模型“鹰序TST”2.0版,在基准测试中取得最优成绩,预测准确率超93%。该模型专为跨境支付外汇风险管理设计,已获巴克莱、花旗等银行应用,并拓展至电商、航空等领域。文章还对比了Chronos-2、TimesFM等模型,强调金融场景需结合领域数据验证,通用榜单优势不等于稳定金融收益。
延伸解读
通用榜单优势不等于金融收益
文章指出,虽然Falcon TST 2.0在GIFT-Eval等通用基准上取得领先,但金融市场的低信噪比、厚尾和机制切换等特点,使得通用榜单优势难以直接转化为稳定的金融预测收益。曼彻斯特大学等研究显示,直接使用预训练TSFM进行零样本预测效果较弱,需在金融数据上重新预训练。因此,金融机构应关注模型在自身数据上的滚动回测稳定性,而非仅依赖公开排名。
分位数输出不等于风控合规
Falcon-2.0和Falcon-X提供多分位数输出,可用于构造情景和估计尾部损失,但文章强调,这不能直接等同于监管意义上的VaR和ES。真实风控体系需经过覆盖率检验、条件覆盖检验和压力测试,才能判断分位数校准能力。仅凭API能输出1%或5%分位点,不足以证明模型满足风控要求,金融机构需进行二次验证。
行业落地效果依赖组合而非单一模型
文章列举了巴克莱、花旗、渣打和Capital A等合作案例,显示Falcon在真实业务中降低了对冲成本,但效果来自模型、行业数据、银行交易设施和企业资金管理规则的组合。例如,Capital A的航空版本加入了旅行行业数据。因此,行业专用化的价值在于整体解决方案,而非单个基础模型替代现有体系,金融机构应评估模型与自身流程的整合能力。
Q&A
鹰序TST 2.0是什么?它在基准测试中取得了什么成绩?
鹰序TST 2.0是蚂蚁国际发布的自研时序AI预测大模型,全称Falcon TST(Time-Series Transformer)2.0版。它在全球权威基准测试中取得最优成绩(SOTA),平均绝对比例误差(MASE)降至0.666,预测准确率稳定超过93%。
鹰序TST 2.0主要应用于哪些金融场景?有哪些银行采用了它?
鹰序TST 2.0专为跨境支付外汇风险管理设计,已应用于现金流预测与外汇管理。巴克莱银行、花旗银行、德意志银行、渣打银行等大型金融机构已将其用于提升流动性风险敞口的预测能力。
通用时间序列基础模型在金融领域面临哪些挑战?
金融市场的低信噪比、机制切换、厚尾风险和跨市场联动,以及金融收益率具有低信噪比、厚尾、波动率聚集和机制切换等特征,日内行情、日度收盘、利率曲线和宏观数据存在频率不一致、节假日错位和缺失值,这些因素使通用榜单优势很难直接转化为稳定的金融预测收益。
Falcon TST的发展路径与其他时间序列基础模型有何不同?
Falcon TST的发展路径是先进行金融业务验证,再逐步形成公开模型家族。2025年先在外汇敞口和资金管理中完成业务验证,2026年发布Falcon-2.0和Falcon-X,而典型TSFM是“先刷公开基准、再寻找行业应用”。
Falcon-2.0和Falcon-X在技术上有何特点?
Falcon-2.0是基于ORBIT训练框架的Encoder-Only单变量TSFM,可输出21个分位点,支持缺失值标记;Falcon-X是异构多变量建模模型,将不同物理含义的变量转换为统一隐空间表示,通过差分注意力识别正负关联,处理变量间关系并重建各变量轨迹。
分位数预测能否直接等同于VaR和ES?为什么?
不能。分位数预测可用于构造情景和作为风险价值(VaR)和预期损失(ES)模型的输入,但真实风控体系仍需经过覆盖率检验、条件覆盖检验、压力情景和模型风险管理,才能判断分位数是否具备稳定校准能力。仅凭API输出分位点不能直接推导模型已满足VaR或ES要求。
巴克莱银行、花旗银行和渣打银行与蚂蚁国际的合作分别带来了哪些效果?
巴克莱银行将TST接入BARX NetFX外汇对冲平台,提高外汇敞口预测准确度;花旗银行与蚂蚁国际试点将Falcon TST与固定汇率解决方案结合,首个航空客户对冲成本节省约30%;渣打银行将Falcon接入SCALE流动性引擎,外汇敞口预测准确率超90%,外汇成本最高下降60%,流动性管理成本最高下降50%。
GIFT-Eval基准是什么?在解读榜单成绩时需要注意什么?
GIFT-Eval是Salesforce AI Research于2024年11月发布的基准,覆盖28个数据集、超过14.4万条时间序列和1.77亿个测试数据点,用于统一零样本测试、减少数据泄漏并比较不同频率和变量数量。解读榜单成绩时需注意榜单是动态的,且部分提交存在训练数据重叠标记,固定引用某一时点“全球第一”容易失真,应检查模型在自己数据上的稳定性。
金融TSFM的下一阶段竞争重点是什么?
金融TSFM的下一阶段竞争重点将从“能否零样本预测”转向“能否在真实风险流程中稳定使用”,衡量标准包括滚动回测稳定性、极端行情失效边界、分位数校准、数据泄漏控制、推理成本和系统接入能力。