小红花·文摘
  • 首页
  • AI Tokens🪙
  • 排行榜🏆
  • 直播
  • FAQ
超越下一个词元预测:扩散语言模型与自回归语言模型的性能表征

本文比较了自回归语言模型(ARMs)与扩散语言模型(DLMs)的性能。DLMs通过并行生成令牌提高算术强度,但长上下文扩展不佳;块状解码可改善此问题。批处理推理中,ARMs因序列并行优势吞吐量更高。减少采样步数是DLMs降低延迟的关键。

超越下一个词元预测:扩散语言模型与自回归语言模型的性能表征

Apple Machine Learning Research Apple Machine Learning Research · 2026-08-07T00:00:00Z
ICML 26杰出论文:清华JustGRPO攻克dLLM推理瓶颈;告别简单指令测试:Agents Last Exam 全面评估智能体长程专业能力

清华大学团队在ICML 26上获得杰出论文奖,提出了JustGRPO模型,解决了扩散语言模型(dLLM)在数学和编程推理中的灵活性陷阱问题。该模型在GSM8K基准测试中取得89.1%的准确率,展示了其推理潜力。

ICML 26杰出论文:清华JustGRPO攻克dLLM推理瓶颈;告别简单指令测试:Agents Last Exam 全面评估智能体长程专业能力

HyperAI超神经 HyperAI超神经 · 2026-07-13T03:28:59Z
学习扩散语言模型的解码策略

本文探讨了扩散语言模型(dLLMs)的采样策略,提出通过强化学习训练采样过程,以提高解码效率和样本质量。研究表明,基于单层变换器的轻量级策略在全扩散设置中优于传统启发式方法,尤其在代码生成任务中表现出色。

学习扩散语言模型的解码策略

Apple Machine Learning Research Apple Machine Learning Research · 2026-07-02T00:00:00Z
何恺明首个语言模型:不走GPT老路,105M参数干翻主流

何恺明团队推出了首个扩散语言模型ELF,采用105M参数和45B训练token,成功超越主流模型。ELF通过在连续空间中去噪生成离散token,显著提高生成速度和质量,展示了小规模模型的高效输出,降低了训练成本,未来有望推动AI生成速度提升。

何恺明首个语言模型:不走GPT老路,105M参数干翻主流

dotNET跨平台 dotNET跨平台 · 2026-05-14T23:58:43Z
何恺明首个语言模型:105M参数,不走GPT自回归老路

何恺明团队推出了新的扩散语言模型ELF,该模型采用连续的embedding空间进行文本生成,显著降低了生成困惑度。ELF在训练和采样效率上表现优异,仅用105M参数和45B训练token,生成质量超过主流模型。该模型首次实现了连续与离散的有效结合,推动了扩散语言模型的发展。

何恺明首个语言模型:105M参数,不走GPT自回归老路

量子位 量子位 · 2026-05-13T01:23:32Z
使用扩散生成文本(以及使用LLMs的投资回报)

本期节目包含两次采访。第一部分,Ryan与Inception的CEO Stefano Ermon讨论扩散语言模型的生成速度和准确性。第二部分,Ryan与Roomie的主席Aldo Luevano探讨Roomie在物理和软件AI模型构建中的ROI优先方法,以帮助公司评估机器人和AI的影响。

使用扩散生成文本(以及使用LLMs的投资回报)

Stack Overflow Blog Stack Overflow Blog · 2026-02-03T08:40:00Z

华人团队研究表明,扩散语言模型在token数量受限时,其数据潜力超过自回归模型三倍,且未出现性能饱和。该模型通过双向建模和高计算密度提升学习效果,且在过拟合情况下性能仍可能持续提升。

华人团队终结Token危机:扩散模型数据潜力超自回归三倍

量子位 量子位 · 2025-08-13T09:19:44Z

Mercury是一种高效的扩散语言模型,生成代码速度比传统模型快10倍,达到1109 tokens/秒。它采用“从噪声到结构化输出”的方法,具备动态纠错能力,提升生成灵活性。Mercury结合Transformer架构,优化硬件利用,解决CI/CD速度瓶颈。

扩散语言模型写代码!速度比自回归快10倍

量子位 量子位 · 2025-07-10T09:18:27Z
Dream 7B:一种强大且开放的扩散语言模型

Dream 7B是一种新型的扩散语言模型,采用去噪方法,能够更好地处理上下文,提高生成灵活性和规划能力。与传统模型相比,Dream 7B在多项任务中表现优异,显示出扩散模型可能会取代自回归模型。

Dream 7B:一种强大且开放的扩散语言模型

The New Stack The New Stack · 2025-06-03T17:00:59Z
通过自回归模型的适应扩展扩散语言模型

扩散语言模型(DLMs)旨在克服自回归模型的局限性。本文提出通过适应自回归模型构建文本扩散模型,展示了自回归与扩散建模目标之间的联系,并介绍了一种持续预训练方法。实验结果表明,转换后的模型在语言建模和推理基准上表现优异,超越了早期的DLMs,并与自回归模型竞争。

通过自回归模型的适应扩展扩散语言模型

Apple Machine Learning Research Apple Machine Learning Research · 2025-04-16T00:00:00Z

本文介绍了SSD-LM扩散语言模型,采用自条件嵌入扩散机制,提升了文本生成的效率和质量。研究表明,该模型在推断时间上更高效,并能根据指令进行微调,表现优于自回归模型。通过算法改进,成功构建了大规模扩散语言模型Plaid 1B,推动了扩散模型在文本生成中的应用。

文本上的掩蔽扩散模型的规模化研究

BriefGPT - AI 论文速递 BriefGPT - AI 论文速递 · 2024-10-24T00:00:00Z

本文介绍了一种基于扩散语言模型的文本导向分子生成方法(TGM-DLM),该方法克服了自回归方法的局限性,通过两阶段的扩散生成过程更新SMILES字符串中的标记嵌入。实验证明,TGM-DLM模型在生成具有特定属性的连贯准确分子方面优于自回归模型MolT5-Base,无需额外数据资源,为药物发现和相关科学领域开辟新途径。

基于扩散语言模型的文本引导分子生成

BriefGPT - AI 论文速递 BriefGPT - AI 论文速递 · 2024-02-20T00:00:00Z
  • <<
  • <
  • 1 (current)
  • >
  • >>
👤 个人中心
在公众号发送验证码完成验证
登录验证
在本设备完成一次验证即可继续使用

完成下面两步后,将自动完成登录并继续当前操作。

1 关注公众号
小红花技术领袖公众号二维码
小红花技术领袖
如果当前 App 无法识别二维码,请在微信搜索并关注该公众号
2 发送验证码
在公众号对话中发送下面 4 位验证码
小红花技术领袖俱乐部
小红花·文摘:汇聚分发优质内容
小红花技术领袖俱乐部
Copyright © 2021-
粤ICP备2022094092号-1
公众号 小红花技术领袖俱乐部公众号二维码
视频号 小红花技术领袖俱乐部视频号二维码