谷歌新架构突破Transformer超长上下文瓶颈!Hinton灵魂拷问:后悔Open吗?

💡 原文中文,约2900字,阅读约需7分钟。
📝

内容提要

谷歌在NeurIPS 2025上推出了新架构Titans和MIRAS,突破了Transformer在超长上下文处理中的限制。Titans结合了RNN的速度与Transformer的性能,能够动态更新记忆,扩展上下文至200万token。MIRAS则提供统一的序列建模框架,优化信息整合与记忆更新。这些新架构在处理长序列时优于现有模型,标志着AI领域的重要进展。

🎯

关键要点

  • 谷歌在NeurIPS 2025上推出新架构Titans和MIRAS,突破Transformer在超长上下文处理中的限制。

  • Titans结合了RNN的速度与Transformer的性能,能够动态更新记忆,扩展上下文至200万token。

  • MIRAS提供统一的序列建模框架,优化信息整合与记忆更新。

  • Titans引入新的神经长期记忆模块,能够在推理阶段动态更新权重。

  • MAC架构将长期记忆作为额外上下文信息,提升模型的表达能力。

  • Titans通过“意外指标”选择性更新长期记忆,保持快速和高效。

  • MIRAS将序列模型结构为四个关键设计选择,优化信息的学习与保留。

  • 基于Titans和MIRAS的模型性能优于现有的线性循环模型和Transformer基线模型。

  • 谷歌的研究人员认为公开Transformer的研究对世界产生了积极影响。

🔎

延伸解读

新架构的技术优势

谷歌的新架构Titans和MIRAS在处理超长上下文时展现出显著优势。Titans结合了RNN的速度与Transformer的性能,能够动态更新记忆,扩展上下文至200万token。这一突破不仅提升了模型的表达能力,还能在不增加计算成本的情况下,处理更复杂的信息,标志着AI技术的进一步发展。

记忆更新机制的创新

Titans引入的神经长期记忆模块在推理阶段动态更新权重,打破了传统模型固定记忆的局限。这种机制使得模型能够根据输入的“意外度”选择性地更新长期记忆,从而提高了信息处理的灵活性和效率。这一创新为未来的AI模型设计提供了新的思路。

MIRAS的统一框架

MIRAS作为Titans的理论基础,提供了一个统一的序列建模框架,强调在推理阶段的学习能力。通过将不同架构视为解决同一问题的多种方式,MIRAS优化了信息整合与记忆更新的过程。这种方法不仅提升了模型的性能,也为未来的研究指明了方向。

延伸问答

谷歌在NeurIPS 2025上推出了哪些新架构?

谷歌在NeurIPS 2025上推出了Titans和MIRAS两项新架构。

Titans架构如何突破Transformer的限制?

Titans结合了RNN的速度与Transformer的性能,能够动态更新记忆,扩展上下文至200万token。

MIRAS的主要目标是什么?

MIRAS的主要目标是让模型在推理阶段也能进行学习,优化信息整合与记忆更新。

Titans架构中的“意外指标”是什么?

“意外指标”是指模型检测到当前记忆内容与新输入内容之间存在较大差异时的度量,用于选择性更新长期记忆。

基于Titans和MIRAS的模型性能如何?

基于Titans和MIRAS的模型性能优于现有的线性循环模型和Transformer基线模型,能够处理极长上下文。

谷歌研究人员对公开Transformer的看法是什么?

谷歌研究人员认为公开Transformer的研究对世界产生了巨大的积极影响。

🏷️

标签

➡️

继续阅读