内容提要
蚂蚁集团发布金融增强开放模型Ling-3.0-flash-Fin,聚焦投资研究场景,强化信息检索、推理、估值建模和研报撰写能力,旨在让AI从回答问题转向完成完整工作流。模型已开源,并同步开放金融搜索评测基准FinFIRST,推动金融AI向专业生产力发展。
延伸解读
从“问答”到“工作流”的转变
传统金融大模型多聚焦于单点任务,如问答和摘要,而Ling-3.0-flash-Fin则尝试覆盖完整投研链路,包括信息检索、推理、估值建模和研报撰写。这种转变意味着AI不再只是提供答案,而是试图承担一项完整的工作,这可能是金融AI从辅助工具走向专业生产力的关键一步。
评测基准FinFIRST的意义
FinFIRST评测基准的开放,旨在解决如何评估金融Agent能力的问题。它强调信息溯源、口径判断和推导过程,要求AI不仅给出答案,还要说明信息来源和结论依据。这种设计将专业判断转化为可验证的标准,有助于推动金融AI的可靠性和实用性。
开放策略与行业影响
蚂蚁百灵此次采取“模型+工具+评测”同步开放的模式,开放模型权重和API,并开源评测基准。这种开放策略可能降低金融机构和开发者应用金融AI的门槛,同时通过真实业务反馈反哺模型迭代。对于金融行业而言,这可能加速AI在专业场景的落地,但也需关注模型在复杂任务中的实际表现和局限性。
Q&A
蚂蚁百灵发布的金融增强模型叫什么?它主要针对什么场景?
蚂蚁百灵发布的金融增强开放模型名为Ling-3.0-flash-Fin,主要针对投资研究场景,旨在强化信息检索、研究推理、估值建模和研报撰写等能力。
Ling-3.0-flash-Fin与传统的金融大模型有什么不同?
传统金融大模型主要解决问答、摘要等单点任务,而Ling-3.0-flash-Fin瞄准真实金融工作流,尝试让AI从“回答一个问题”走向“完成一项工作”,覆盖从找资料、做分析到形成研究成果的完整任务链。
Ling-3.0-flash-Fin的模型参数和上下文长度是多少?
Ling-3.0-flash-Fin基于Ling-3.0-flash打造,总参数为124B,激活参数为5.1B,并具备256K的长上下文能力。
Ling-3.0-flash-Fin重点强化了哪四项能力?
Ling-3.0-flash-Fin重点强化了信息检索、研究推理、估值建模和研报撰写四项能力,分别对应投研链路中的找信息、验信息、做计算和形成成果等环节。
FinFIRST是什么?它主要评测什么?
FinFIRST是蚂蚁集团构建并开源的金融搜索Agent评测基准,全称Financial Information Retrieval, Sourcing and Traceability,重点评测金融搜索Agent在信息检索、信源选择、口径判断和推导过程等方面的能力。
FinFIRST的题目构成有什么特点?
FinFIRST覆盖中国内地、美国、中国香港及其他市场,中文题占60.2%,英文题占39.8%。超过五分之四的题目包含多个相关子问题,61.8%要求显式计算,32.5%需要多个信源,75.6%不直接指定信源,所有题目均使用公开可访问的信源。
Ling-3.0-flash-Fin在哪些基准上进行了测试?表现如何?
Ling-3.0-flash-Fin在FinFIRST、FinSearchComp Verified、Finance Agent、APEX-Agents、SpreadsheetBench、τ³-Banking等多个金融智能体基准上进行了测试,覆盖金融信息检索、投资研究、长程任务执行、估值建模和银行业务等场景。评测显示,模型综合表现超过部分大尺寸旗舰模型,在同尺寸模型中具备较强竞争力。
蚂蚁百灵此次发布模型和基准的开放策略是什么?
蚂蚁百灵采取“模型+工具+评测”同步开放的策略,Ling-3.0-flash-Fin已开放模型权重,并提供API体验;FinFIRST也同步开放,以降低金融AI研究和应用开发的门槛,让金融机构、研究团队和开发者共同参与迭代。