香农信息论被视为AI的底层逻辑,大模型本质上是数据压缩器,其压缩能力与智能正相关;扩散模型通过去噪测量互信息;自由能原理驱动智能体探索。然而,批评者指出该理论忽视了记忆、深度、因果与意义。香农理论是智能的基础,但并非全部,意义问题仍未解决。
本文介绍2019年Song与Ermon提出的基于分数的生成建模框架。该方法不直接学习数据分布,而是学习其分数(对数密度梯度),通过分数匹配训练噪声条件分数网络(NCSN),并用退火朗之万动力学从噪声中采样。多级高斯噪声扰动解决了流形假设和低密度区域问题,在CIFAR-10上取得先进结果,为现代扩散模型奠定基础。
PersonaLive是澳门大学等机构提出的实时肖像动画方案,通过流式金字塔去噪,使不同噪声档位的帧共享一次UNet前向,实现4步去噪仅需1/4次计算,支持无限长视频流。它分离身份、姿态、表情三条条件通路,并用TensorRT融合加速。训练分三阶段,代码和权重已开源。
PersonaLive是澳门大学等机构提出的实时肖像动画方案,通过流式金字塔去噪使4步扩散仅需一次前向,实现无限长视频生成。它利用三条条件通路分别处理身份、姿态和表情,并采用TensorRT融合优化提速。训练分三阶段,代码和权重已开源。
本文介绍DiT(扩散Transformer),用Transformer替代U-Net作为扩散模型去噪网络。DiT在潜在空间通过patchify和adaLN-Zero条件注入,以更少计算量取得更优FID,但U-Net经调优仍具竞争力。视频生成中,时空token数量爆炸,联合注意力成本随帧数平方增长,需用分解式注意力平衡效率与一致性。Sora架构细节未公开,且承认物理模拟等局限。
蚂蚁集团inclusionAI团队发布千亿参数MoE扩散模型LLaDA2.2,首次将扩散模型应用于长程Agent任务。该模型支持128K上下文,通过Levenshtein编辑、强化学习L-EBPO和BlockRouting机制,实现自我修正、环境反馈处理及高效推理。在七大基准上接近顶尖自回归模型,吞吐量达1.64倍,预示扩散与自回归模型将双轨并行。
扩散模型推动了现代生成AI的发展,能够生成逼真的图像、视频和语音。2015年,Jascha Sohl-Dickstein等提出了一种通过逐步添加噪声来破坏数据并学习逆过程重建数据的新方法。这一思路解决了生成模型中的复杂性与可计算性之间的权衡,奠定了扩散概率模型的数学基础。该模型在多个数据集上表现出色,展示了在图像去噪和修复等实际应用中的潜力。
本文介绍了DGAF-VSR,一种基于扩散模型的视频超分辨率方法。该方法通过光流引导变形模块和特征级时序条件模块,显著提升了视频的感知质量、重建保真度和时序一致性。实验结果表明,DGAF-VSR在多个数据集上表现优异,为短视频和直播等应用提供了重要突破。
阿里巴巴与清华大学合作的论文《灵活性陷阱》入选ICML杰出论文,质疑扩散语言模型任意顺序生成的价值。研究表明,任意顺序生成会导致推理能力下降,提出的“JustGRPO”方法强制模型从左到右生成,显著提高推理效果。
谷歌推出了新型文本生成模型DiffusionGemma,采用扩散模型技术,生成速度比传统自回归模型快4倍。该模型一次性生成256个token,支持实时自我纠错,适合速度敏感的本地应用。尽管质量上与同类模型存在差距,但其并行计算能力展示了未来大模型的潜力。
字节推出了开源视频生成与编辑框架Bernini,强调“先理解再生成”。该框架利用多模态大模型进行语义理解,并通过扩散模型实现高质量渲染,解决视频编辑中的一致性和自然性问题。Bernini支持多种编辑选项,如天气、风格和焦点,能够处理复杂视觉效果,提高创作的可控性和稳定性。
宋佳铭(DDIM之父)离开Luma AI,期间推动了多模态基础模型的发展,并参与了3D生成到视频生成的技术转型。他的DDIM论文奠定了扩散模型在图像生成中的基础,影响了多个生成式AI产品。
自2021年以来,音频驱动虚拟人合成技术迅速发展,结合静态图像与音频生成同步视频,广泛应用于直播和客服等领域。主要技术挑战包括身份保持与音视频同步。近年来,扩散模型成为主流,推动了该领域的进步。关键研究包括Hallo2、Let Them Talk和OmniHuman-1,分别聚焦于长视频生成、多人人物对话及全身数字人模型,展现出显著的技术突破与商业潜力。
本文讨论了生成模型与判别模型的区别。生成模型学习数据的概率分布,而判别模型则关注于根据输入数据预测标签。介绍了自回归模型、变分自编码器(VAE)和生成对抗网络(GAN)的基本原理及训练方法。变分自编码器通过编码器和解码器提取特征,生成对抗网络通过生成器和判别器进行对抗训练。最后,探讨了扩散模型在图像生成中的稳定性和多样性。
在GTC 2026上,NVIDIA推出了Physical AI概念,强调AI与现实世界的深度结合。发布了Isaac GR00T、Kimodo和SOMA-X等开源项目,旨在提升机器人在复杂环境中的执行能力,使其更自然、高效地完成任务。
扩散模型在图像生成方面取得了重要进展,但由于推理步骤多和分辨率限制,实际应用受到制约。为提高效率和图像保真度,提出了GenDR和GenDR-Pix模型,优化了VAE和UNet,支持高分辨率图像处理,增强了细节恢复效果,推动生成技术与实际业务的结合。
何恺明团队在arXiv发布了《Generative Modeling via Drifting》论文,提出了Drifting Models生成模型,训练时分布逐步漂移,推理时仅需一步生成,速度提升100倍,质量更佳,标志着生成模型领域的重要转折,期待广泛应用。
Inception Labs推出了基于扩散模型的语言模型Mercury 2,其速度比传统自回归模型快5到10倍,采用并行计算优化响应时间。尽管生成文本质量与Claude Haiku和Google Flash相当,但在经济性上更具优势。Mercury 2现已通过OpenAI兼容API提供。
扩散模型Mercury 2成为最快的生成模型,生成速度达到每秒1009个tokens,比传统自回归模型快5倍。其并行优化机制提升了生成速度,并在性能和成本上具有优势。Inception Labs专注于扩散模型,致力于突破速度与成本的瓶颈。
抱歉,提供的文本内容过于简短,无法进行有效总结。请提供更详细的文章内容。
完成下面两步后,将自动完成登录并继续当前操作。