中国模型算法创新:Engram/N-Gram记忆体引爆AI新竞赛

中国模型算法创新:Engram/N-Gram记忆体引爆AI新竞赛

💡 原文中文,约4900字,阅读约需12分钟。
📝

内容提要

DeepSeek与阿里通义推出Engram/N-Gram记忆模块,为Transformer增加“记忆硬盘”,将固定知识查找从计算中分离,提升推理效率。实验显示性能提升,但社区测试发现其擅长短语补全而非事实回忆,且DeepSeek V4未采用Engram。该技术尚处探索阶段,可能改变AI竞赛格局。

🔎

延伸解读

记忆与计算的分离:范式转变的起点

Engram/N-Gram模块的核心思想是将固定知识的查找从Transformer的计算中分离,类似于给模型加装一个“记忆硬盘”。这种设计让主干网络专注于推理,而记忆模块负责快速查表。实验显示,在等参数和计算量下,Engram模型在知识和推理任务上均有提升,表明“条件记忆”可能成为继MoE之后的新方向。

社区测试揭示的局限性

尽管论文数据亮眼,但社区测试发现,Engram/N-Gram模块更擅长短语补全而非事实回忆。在诗歌测试中,模型能引用常见名句,但无法准确回忆诗歌原文,生成的是“仿制品”。这提醒我们,该技术目前更像一个“短语补全引擎”,而非精确的知识库,其作为事实回忆引擎的能力仍有待验证。

DeepSeek V4的缺席与不确定性

DeepSeek V4技术报告未提及Engram,引发社区猜测。可能的原因包括工程化挑战、大规模复现效果不佳,或正在研发更强大的版本。这一缺席表明,Engram技术尚未成熟,其实际应用价值仍需更多验证。同时,Qwen3.8-Flash-Next的实践证明了可行性,但两者之间的差异凸显了技术演进的不确定性。

Q&A

Engram/N-Gram记忆体是什么?它如何提升Transformer模型的效率?

Engram/N-Gram记忆体是一种为Transformer模型设计的记忆模块,通过哈希查找表将固定的短语模式(如N-Gram)直接映射到嵌入向量,从而将知识查找从计算中分离。这样,模型的主干网络可以专注于推理,减少不必要的计算,提升效率。实验显示,在27B参数规模下,Engram模型在MMLU、CMMLU等任务上分别提升3.0和4.0分,在推理、代码和数学任务上也有显著提升。

DeepSeek和阿里通义在Engram/N-Gram记忆体上分别做了什么?

DeepSeek与北京大学在2026年1月联合发布了Engram模块的论文,提出了将N-Gram方法现代化为哈希查找表,并插入Transformer层间。阿里通义千问则在2026年8月发布了Qwen3.8-Flash-Next模型,首次将Engram/N-Gram记忆体落地,配备51B参数的N-Gram嵌入表,放置在模型第2层,并支持卸载到系统内存或SSD。

Engram/N-Gram记忆体在实际测试中表现如何?有哪些局限性?

社区测试发现,Engram/N-Gram记忆体擅长短语补全,而非事实回忆。例如,在诗歌测试中,模型能完整引用常见名句,但无法准确回忆诗歌原文,生成的是仿制品。此外,Engram存在U型缩放定律,记忆模块占比超过20%-25%后收益下降,且哈希碰撞限制了其作为精确知识库的潜力。

为什么DeepSeek V4没有采用Engram模块?

DeepSeek V4的技术报告中没有提及Engram,选择了更稳健的纯MoE路线。可能的原因包括Engram的工程化挑战、在更大规模上未能复现论文效果,或者DeepSeek正在研发更强大的Engram 2.0,但具体原因未知。

Engram/N-Gram记忆体对AI竞赛格局有何影响?

Engram/N-Gram记忆体可能改变AI竞赛的焦点,从堆显卡转向内存和硬盘大小以及数据调度算法。它使得在普通硬件上运行千亿级知识储备的模型成为可能,例如Qwen3.8-Flash-Next在92GB内存下可达到每秒40个token的生成速度。但该技术尚处探索阶段,其最终影响取决于后续发展。

什么是U型缩放定律?它如何影响Engram记忆模块的设计?

U型缩放定律是指Engram记忆模块的收益随参数占比先增后减,当总参数中约20%-25%的稀疏预算分配给Engram时,模型表现最优。记忆太少则模型仍需费力记忆,太多则挤占推理能力。这指导了Engram模块的设计,需要平衡记忆和计算的比例。

🏷️

标签

➡️

继续阅读