本文比较了自回归语言模型(ARMs)与扩散语言模型(DLMs)的性能。DLMs通过并行生成令牌提高算术强度,但长上下文扩展不佳;块状解码可改善此问题。批处理推理中,ARMs因序列并行优势吞吐量更高。减少采样步数是DLMs降低延迟的关键。
清华大学团队在ICML 26上获得杰出论文奖,提出了JustGRPO模型,解决了扩散语言模型(dLLM)在数学和编程推理中的灵活性陷阱问题。该模型在GSM8K基准测试中取得89.1%的准确率,展示了其推理潜力。
本文探讨了扩散语言模型(dLLMs)的采样策略,提出通过强化学习训练采样过程,以提高解码效率和样本质量。研究表明,基于单层变换器的轻量级策略在全扩散设置中优于传统启发式方法,尤其在代码生成任务中表现出色。
何恺明团队推出了首个扩散语言模型ELF,采用105M参数和45B训练token,成功超越主流模型。ELF通过在连续空间中去噪生成离散token,显著提高生成速度和质量,展示了小规模模型的高效输出,降低了训练成本,未来有望推动AI生成速度提升。
何恺明团队推出了新的扩散语言模型ELF,该模型采用连续的embedding空间进行文本生成,显著降低了生成困惑度。ELF在训练和采样效率上表现优异,仅用105M参数和45B训练token,生成质量超过主流模型。该模型首次实现了连续与离散的有效结合,推动了扩散语言模型的发展。
本期节目包含两次采访。第一部分,Ryan与Inception的CEO Stefano Ermon讨论扩散语言模型的生成速度和准确性。第二部分,Ryan与Roomie的主席Aldo Luevano探讨Roomie在物理和软件AI模型构建中的ROI优先方法,以帮助公司评估机器人和AI的影响。
华人团队研究表明,扩散语言模型在token数量受限时,其数据潜力超过自回归模型三倍,且未出现性能饱和。该模型通过双向建模和高计算密度提升学习效果,且在过拟合情况下性能仍可能持续提升。
Mercury是一种高效的扩散语言模型,生成代码速度比传统模型快10倍,达到1109 tokens/秒。它采用“从噪声到结构化输出”的方法,具备动态纠错能力,提升生成灵活性。Mercury结合Transformer架构,优化硬件利用,解决CI/CD速度瓶颈。
Dream 7B是一种新型的扩散语言模型,采用去噪方法,能够更好地处理上下文,提高生成灵活性和规划能力。与传统模型相比,Dream 7B在多项任务中表现优异,显示出扩散模型可能会取代自回归模型。
扩散语言模型(DLMs)旨在克服自回归模型的局限性。本文提出通过适应自回归模型构建文本扩散模型,展示了自回归与扩散建模目标之间的联系,并介绍了一种持续预训练方法。实验结果表明,转换后的模型在语言建模和推理基准上表现优异,超越了早期的DLMs,并与自回归模型竞争。
本文介绍了SSD-LM扩散语言模型,采用自条件嵌入扩散机制,提升了文本生成的效率和质量。研究表明,该模型在推断时间上更高效,并能根据指令进行微调,表现优于自回归模型。通过算法改进,成功构建了大规模扩散语言模型Plaid 1B,推动了扩散模型在文本生成中的应用。
本文介绍了一种基于扩散语言模型的文本导向分子生成方法(TGM-DLM),该方法克服了自回归方法的局限性,通过两阶段的扩散生成过程更新SMILES字符串中的标记嵌入。实验证明,TGM-DLM模型在生成具有特定属性的连贯准确分子方面优于自回归模型MolT5-Base,无需额外数据资源,为药物发现和相关科学领域开辟新途径。
完成下面两步后,将自动完成登录并继续当前操作。