大语言模型(LLM)自1980年代的分布式表示发展至2017年的Transformer架构,展示了在大规模数据和算力下简单规则的有效性。通过自回归框架,模型学习预测下一个词,逐步掌握语言规律。注意力机制和生成式预训练提升了模型能力,使其在无监督学习中吸收大量知识。对齐技术确保模型输出符合人类价值观,最终形成智能对话助手。
本文讨论了GPT模型的结构及其自回归文本生成过程。GPT基于Decoder架构,采用贪婪解码和集束搜索策略生成文本。通过右移输入实现自回归,模型将输入和输出视为一个长序列,适用于多种生成任务。GPT的核心在于利用Causal Mask实现并行计算,简化了传统的编码-解码结构。
本文介绍了迭代去噪的归一化流(iTARFlow),一种新型生成模型。与扩散模型不同,iTARFlow在训练中保持完全的端到端似然目标,并在采样时结合自回归生成和迭代去噪过程。实验结果表明,iTARFlow在不同分辨率的图像生成任务中表现优异,展现了其作为强大生成模型的潜力。
因果掩码是自回归生成模型中的关键技术,确保模型在训练时仅依赖过去的信息,解决了Transformer在并行处理与生成任务之间的矛盾。通过将上三角部分设为负无穷,因果掩码确保模型在生成时不“偷看”未来的token。这一技术是现代大语言模型(如GPT系列)的基础,提升了模型训练的效率和规模。
LongCat团队推出了新AI模型LongCat-Next,旨在统一处理图像、声音和文本等多模态信息。通过离散原生自回归架构DiNA和视觉分词器dNaViT,该模型实现了不同模态的统一建模,增强了理解与生成的协同能力。研究表明,离散化能更好地理解物理世界,且不损失信息。该模型已开源,欢迎开发者参与。
智谱与华为联合开源了新一代图像生成模型GLM-Image,该模型采用自回归与扩散解码器混合架构,提升了文字生成的准确性,支持多种比例的图像生成,成本低至0.1元,适合商业应用。用户可在HyperAI官网体验该模型。
本文介绍了一种新的语言建模框架TarFlowLM,该框架利用基于变换器的自回归正则化流,将离散标记空间转变为连续潜在空间。此方法增强了模型的灵活性,支持双向上下文捕捉和分块生成,能够处理复杂的潜在依赖关系。实验结果表明,该框架在语言建模基准上表现优异,展现了其灵活的建模能力。
HybridVLA是一种新型视觉-语言-动作模型,结合自回归和扩散策略,旨在提升机器人在动态环境中的操作能力。通过协同训练,该模型有效整合两种生成方法的优势,提高了动作预测的准确性和鲁棒性,并在多样化数据集上展现出优越的性能。
近年来,扩散模型在自然语言处理中的应用引起关注,发展出离散扩散语言模型(DLM)。DLM通过去噪生成文本,支持并行解码,提高生成速度和结构控制。新加坡国立大学的Dimple模型结合视觉编码器与扩散语言模型,采用自回归与扩散的两阶段训练,性能优于同规模自回归模型。
本研究提出了一种无训练的水印框架IndexMark,针对自回归图像生成模型中的水印技术不足,通过匹配和替换相似索引嵌入水印,确保图像质量,同时展现出良好的鲁棒性和验证精度。
MAGI-1是一种新型世界模型,通过自回归预测视频片段序列生成视频。该模型在图像到视频任务中表现优异,具备高时间一致性和可扩展性,适合实时和内存高效部署。
MAGI-1是由Sand AI开发的先进视频生成模型,采用自回归方式生成高质量视频,并支持因果时间建模。其基于Transformer的变分自编码器实现了高效压缩和快速解码,适用于内容创作和游戏开发等多个领域。MAGI-1在视频生成质量上超越其他开源模型,展现出显著的创新和性能优势。
DART是一种基于变换器的模型,结合自回归和扩散,克服了传统扩散模型的马尔可夫特性限制,能够更有效地进行图像建模。该模型在统一框架中同时处理文本和图像数据,展现出在生成任务中的竞争力,为扩散模型提供了高效替代方案。
OpenAI发布了新版本的GPT-4o,具备原生图像生成能力,能够修改上传的图像或根据提示创建新图像,并保持多轮一致性。该模型直接处理图像输出,使用自回归生成方法,在文本渲染和提示遵循方面表现优异。同时,OpenAI建立了工具以识别生成的图像,防止违反内容政策的图像生成。
清华大学朱军团队提出的DeepMesh方法,通过自回归生成框架,显著提升了三维网格生成能力,支持生成高达3万个面片,并结合几何质量与人类评价,优化了生成结果的结构与美观性,展现出在影视和游戏领域的应用潜力。
自OpenAI发布GPT-4o图像生成功能以来,网络上对此进行了广泛讨论。尽管OpenAI未透露技术细节,研究者们推测其可能结合了自回归与扩散生成或采用纯自回归生成方式。部分研究者认为,GPT-4o通过逐步生成图像,展现出与传统模型不同的特性,具体实现仍待OpenAI公布。
Uni-3DAR是一个新型3D结构生成与理解框架,采用自回归方法统一微观与宏观3D建模。该模型通过层次化token化和掩码预测策略,显著提升了生成与理解任务的性能,尤其在分子生成和晶体结构预测中表现突出,展现了在科学研究中的广泛应用潜力。
本研究提出了一种粗到细的标记预测方法,解决自回归图像生成中的量化误差问题。实验结果显示,Inception分数平均提升59分,且采样速度更快。
OpenAI 的块离散去噪扩散语言模型(BD3-LMs)结合了扩散与自回归模型,解决了生成任意长度序列的局限性。研究表明,BD3-LMs 在多个基准测试中表现出最佳困惑度,能够高效生成可变长度文档,克服了传统扩散模型的缺陷。
FlexTok是一种新型图像标记器,将2D图像转换为可变长度的1D标记序列,提高了自回归图像生成的效率。与传统的2D网格标记方法相比,FlexTok能够根据图像复杂性灵活调整标记数量,从而生成高质量图像。实验结果表明,FlexTok在生成任务中表现优异,以更少的标记数实现了先进水平。
完成下面两步后,将自动完成登录并继续当前操作。