本文解析Kimi K3模型中的Attention Residuals(注意力残差)结构。该机制将残差连接视为深度方向上的RNN,通过可学习伪query对embedding及各层输出做softmax加权,替代固定求和。K3采用Block形式,将93层分为8块,块内普通求和,块间注意力聚合,共9个来源。相比普通残差,此设计提升多步推理能力,降低输出幅度增长,并支持高效两阶段推理。
本文介绍9个数学推理数据集,涵盖竞赛级问题、多语言多模态、工具增强推理及知识依赖建模等方向,旨在提升大模型推理能力。包括Math-Graph定理依赖图、Nemotron-SFT-Math-v4、MathNet多模态基准、Nemotron-Math-v2、CHIMERA合成数据、Open-RL、GPT-5.4逐步推理、Sutra 10B预训练及VisCoR-55K视觉推理,助力模型训练与评测。
Anthropic发布Claude Opus 5,编程评测登顶,性能接近顶级模型Fable 5但价格减半。推理能力突出,能自主写代码修bug,完成复杂工程和科研任务,安全对齐创纪录。定价与上代相同,但成本争议存在,网友评价分化。
OpenAI发布了GPT 5.6系列模型,包括旗舰Sol、均衡Terra和低价Luna,标志着AI从“回答工具”进化为“智能体”。新模式“Max”和“Ultra”提升了推理能力和协作效率。ChatGPT与Codex合并,增强了编程功能,以满足更广泛的市场需求。AI行业竞争转向性价比,消费者将受益于更优服务和更低价格。
Empero 开源了 Qwythos-9B-Claude-Mythos-5-1M,这是一款增强推理能力的小模型,拥有 90 亿参数。该模型通过高质量数据提升复杂推理任务的表现,支持长上下文和工具调用,拓展了多模态应用。HyperAI 提供了快速部署和测试的资源,方便开发者使用。
自一致性是一种新型解码策略,通过生成多个独立推理路径并选择最一致的答案,显著提升大型语言模型的推理能力。该方法克服了传统链式思维的局限,允许模型在选择答案前探索多种可能性,从而提高准确性。实验表明,自一致性在算术、常识和符号推理任务中表现优异,证明更好的推理不一定依赖于更大的模型或额外的训练。
本文比较了ChatGPT、Gemini和Claude三种模型的架构差异。三者均基于变换器架构,但在训练方法、密度、多模态处理、上下文窗口和对齐方式上存在显著不同。Gemini采用专家混合模型,支持多模态输入;OpenAI通过人类反馈强化学习优化模型;Anthropic使用宪法AI进行自我修正。尽管起点不同,三者在推理能力上逐渐趋同,均采用显式推理令牌以提升性能。
Anthropic的研究发现,Claude模型内部存在类似人脑的“J-space”,用于处理意识和潜意识的思维。实验验证了J-space的可报告性、可操控性和推理能力。尽管Claude在多步推理中表现不佳,但其基本功能正常。研究表明Claude的思维结构与人脑相似,但并不具备真正的意识。
人类最后考试(HLE)是评估现代AI系统推理和知识能力的基准,包含2500多个专家级问题,涵盖多个学科。尽管HLE被认为有用,但专家意见分歧,部分人认为其过于学术化,无法真实反映AI在实际生活中的表现。HLE旨在克服以往测试的局限性,尽管一些问题存在错误。总体来看,HLE被视为识别最佳AI模型的重要工具。
京东在开放原子开源基金会捐赠仪式上,将自主研发的大模型推理引擎Oxygen xLLM捐赠给基金会,旨在推动国产AI基础设施的智能化发展。该引擎采用服务-引擎解耦架构,提升资源利用率和性能,已在多个行业成功应用。未来,京东将与更多合作伙伴共同构建生态,推动国产推理能力的标准化和规模化应用。
GLM-5.2是新一代开放权重模型,性能接近顶级闭源模型GPT-5.5,成本仅为其三分之一。该模型拥有7000亿参数,实际运行时激活400亿,推理能力显著提升。推理过程消耗token较多,最大强度下需42000个token。用户可通过调整推理强度优化性价比,日常任务使用中等强度即可。尽管在非幻觉率测试中表现优异,但缺乏视觉输入能力,API稳定性需改进。
xAI的Grok 4.3模型已在Amazon Bedrock上线,成为其模型供应商之一。该模型专注于推理能力,适用于客户支持和网站开发等企业场景,具备高效的工具调用和指令遵循能力,能够在高并发情况下控制成本。Grok 4.3运行于Amazon Mantle引擎,支持结构化输出和流式响应。
大型语言模型在多步推理任务中的表现有限。研究提出了“链式思维提示”,鼓励模型展示推理过程后再给出答案,从而显著提升推理能力。这一方法无需额外训练,适用于算术、常识和符号推理任务,尤其在大型模型中效果显著。研究表明,适当的提示可以激发推理能力,改变了对语言模型推理的理解。
谷歌推出NotebookLM的升级版,增强了聊天功能和推理能力,支持复杂的研究项目。新系统具备安全云计算能力,能够生成PDF报告和数据可视化。用户可以从初步想法开始,NotebookLM帮助构建资料库并进行可靠的信息搜索。这些更新已全球推出,旨在提升研究效率。
DeepSeek V4 Pro在精度和指令遵循方面优于GPT-5.5 Pro,尤其在复杂任务处理上表现更佳。测试显示,DeepSeek在日志处理和邮件生成等任务中更能准确执行要求,而GPT常常添加多余信息。尽管DeepSeek成本低廉,但推理深度仍不及GPT。社区对评估方法提出质疑,认为样本量小且缺乏科学性。总体来看,DeepSeek提供了“足够好”的性能,但顶尖推理能力仍由GPT和Claude掌握。
本文探讨了大语言模型的核心原理,强调知识和推理能力分布在权重网络中,而非独立模块。通过类比人类大脑,讨论了意识的涌现理论及人类对AI的情感投射,指出人类对自身智能的理解仍存在许多未解之谜。
Claude Opus 4.8在ARC-AGI-3测试中得分超过1%,尽管分数较低,但显示出AI开始具备原始推理能力。该测试要求AI在新规则下进行自适应推理,避免死记硬背,得分表明AI在陌生环境中尝试理解规则,展现出学习潜力,尽管仍有不足。这一进展被视为通向通用人工智能的重要一步。
快手发布了多模态大模型Keye-VL-2.0-30B-A3B,具备深度视频理解能力,采用DSA机制处理超长视频上下文,提升推理效率和准确性。该模型能够精准识别视频细节,提供高情商建议,并在复杂任务中展现强大的逻辑推理能力,标志着快手在多模态理解和自动化调度方面的重大进展,推动内容生产智能化。
李飞飞团队发布了ESI-Bench,这是一个用于评测具身空间智能的新基准。该基准要求AI主动探索以获取信息,研究显示当前AI在空间智能方面,尤其是主动探索和推理能力上仍存在不足。ESI-Bench包含3081个任务实例,覆盖人类核心空间认知能力,旨在提升AI的空间推理能力。
CX-Mind是首个将胸片诊断转化为可验证推理链的多模态大模型,提升了医学影像AI的推理能力,解决了传统AI模型的黑箱问题。该模型在多个评测中表现优异,尤其在真实世界测试中获得医生高度认可,标志着医学AI从视觉模型向推理模型的转变。
完成下面两步后,将自动完成登录并继续当前操作。