本文介绍9个数学推理数据集,涵盖竞赛级问题、多语言多模态、工具增强推理及知识依赖建模等方向,旨在提升大模型推理能力。包括Math-Graph定理依赖图、Nemotron-SFT-Math-v4、MathNet多模态基准、Nemotron-Math-v2、CHIMERA合成数据、Open-RL、GPT-5.4逐步推理、Sutra 10B预训练及VisCoR-55K视觉推理,助力模型训练与评测。
本文提出了一种名为Ctrl-R的框架,通过可控轨迹学习结构化推理,旨在系统性地发现和强化多样化的推理模式。实验表明,Ctrl-R能有效探索并内化以往难以获得的推理模式,提升语言和视觉-语言模型在数学推理任务上的表现。
谷歌DeepMind的AI系统在无人帮助下成功解出了9道长期未解的数学难题,每道题的成本仅为几百美元。这一成就展示了AI在数学推理领域的强大能力,可能会改变数学研究的方式。AI通过逻辑推理链条自动寻找解法,效率远超人类数学家,未来在多个科学领域有望发挥重要作用。
LaDiR(潜在扩散推理器)是一种新颖的推理框架,结合了连续潜在表示的表达能力与潜在扩散模型的迭代精炼能力。通过变分自编码器(VAE)构建的结构化潜在推理空间,LaDiR在数学推理和规划基准测试中展现出更高的准确性、多样性和可解释性,开辟了文本推理的新范式。
DeepSeek网页端新增“快速模式”和“专家模式”。快速模式适合日常对话,响应迅速;专家模式擅长复杂问题,推理能力强,特别在数学推理和编程任务中表现优越,适合高难度任务。
本文提出了iGRPO(迭代组相对策略优化),通过自我反馈提升AI的数学推理能力。该方法包括探索与选择、条件化改进两个阶段,显著提升多个基准测试的表现,且无需复杂的外部反馈。iGRPO的理念与人类学习相似,强调超越自我,具有广泛应用潜力。
本文提出了一种新方法“建设性电路放大”,通过识别模型推理中的关键标记和相关组件,针对性地更新大语言模型(LLMs)的特定电路。这种方法在数学推理中提高了准确率,最多可达11.4%,同时仅修改了1.59%的模型组件,对其他能力影响最小,表明选择性更新稀疏组件可以有效增强特定能力。
天才陈立杰已加盟OpenAI,负责数学推理。他16岁保送清华,后在UC伯克利担任助理教授,专注于计算复杂性理论,并在信息学竞赛中表现优异,发表多篇重要论文,近期研究扩散语言模型。
DeepSeek开发的DeepSeekMath-V2在数学推理方面取得显著进展,尤其在定理证明中表现优异,获得国际数学奥林匹克金牌和普特南接近满分。该模型通过自我修正和验证循环提升推理能力。
Deepseek V3.2于12月1日发布,采用稀疏注意力算法DSA,显著降低API调用成本。尽管在数学推理方面表现优异,但实际应用能力有限,尤其缺乏多模态支持。整体而言,Deepseek在行业内具有创新贡献,但基础模型仍需提升以实现全面领先。
DeepSeek推出开源数学模型DeepSeekMath-V2,专注于自验证推理,表现超越谷歌和OpenAI,获得IMO金牌级分数。该模型通过迭代强化学习优化证明验证和生成,克服传统方法的局限性,展现出卓越的数学推理能力。
美团LongCat团队推出AMO-Bench,包含50道高难度原创数学推理题,旨在提升大模型的推理能力。目前顶尖模型在该评测中的表现仍未及格,显示出其在复杂推理任务上的局限性。AMO-Bench为行业提供了新的评测标准,未来将持续更新。
数学推理正成为人工智能的重要研究方向,机器逐渐掌握逻辑推演和多步思考。高质量、结构化的数据集对模型推理能力至关重要,数据集的多样性和可解释性是推动人工智能向“可解释智能”发展的关键特征。
蚂蚁集团发布了开源的万亿参数思考模型Ring-1T,具备接近GPT-5的能力,数学推理达到IMO银牌水平。该模型通过自研算法解决训练与推理精度差异,在医疗问答和人类偏好对齐测试中表现优异。Ring-1T是蚂蚁在万亿参数模型上的首次尝试,未来将继续优化。
研究团队提出了一种选择性熵正则化方法(SIREN),有效解决了大语言模型在RLVR训练中的“熵困境”。该方法通过限制探索范围、聚焦关键决策和稳定训练过程,精准调控探索行为,显著提升了模型在数学推理等任务上的表现。
阿联酋推出的K2 Think是全球最快的开源AI模型,速度超过2000 tokens/秒,参数仅32B,专注于数学推理,表现优异,具备多项技术创新。
字节推出的Seed-Prover模型在数学推理方面表现优异,解决了78.1%的国际数学奥林匹克(IMO)难题,并在普特南数学竞赛中取得显著成绩。该模型结合引理式证明和Seed-Geometry引擎,建立了独特的几何问题库,达到了IMO银牌水平。
Kimi K2 模型将于2025年发布并开源,具备强大的代码生成和通用任务处理能力,在多个基准测试中表现优异,尤其在代码生成和数学推理方面。用户可通过官网或 API 接入使用,支持生成知识卡片和复杂应用,整体效果良好,期待国产大模型的进一步发展。
香港大学、字节跳动Seed和复旦大学联合推出的Polaris方法,通过700步强化学习训练,使4B模型在数学推理能力上超越多款商业大模型,特别是在长文本生成方面表现突出。该方法强调动态调整训练数据和超参数,提升了模型的多样性和准确性。
本文介绍了MiniMax-M1模型的核心创新,包括闪电注意力和混合专家架构,显著提升了长文本处理能力。采用CISPO算法优化强化学习训练,提高效率并降低成本。模型在数学推理和工具调用等任务中表现优异,全面开源推动大模型应用普及。未来挑战包括数学推理优化和生态建设。
完成下面两步后,将自动完成登录并继续当前操作。