本文介绍机器学习中潜在空间(latent space)的三种核心作用:描述性(如PCA压缩高维数据)、生成性(通过插值创造新数据点)和预测性(如推荐系统、RAG中计算相似度)。潜在空间将复杂数据转化为结构化数值表示,是压缩、生成和连接数据的关键基础概念。
谷歌Flow Sessions第四期收官,该项目为期六周,汇聚艺术家使用谷歌Flow创意工作室及先进生成模型进行合作创作。本期聚焦共创,艺术家们将激情项目付诸实践,现已发布该组创作的影片。
本文探讨了在本地运行生成模型进行编码的可行性,分析了影响模型性能的因素,如内存、处理器核心、模型参数和推理能力。尽管小型模型在工具调用上存在困难,但Qwen3.6 35B MoE模型在能力、速度和内存占用方面表现最佳。总体而言,当前模型仍需改进,尚未实现简单的“即插即用”体验。
NTIRE 2026挑战赛专注于UGC短视频的复杂降质修复,面向全球研究者开放。比赛基于KwaiVIR数据集,涵盖合成与真实降质视频,旨在推动生成模型在视频修复中的应用。共95支队伍参赛,最终12支提交有效结果,展示了UGC短视频修复的进展。
语音增强(SE)面临数据、目标和任务等挑战,自监督学习(SSL)逐渐成为解决方案。SSL通过未配对数据学习和生成式方法,重塑了SE的训练目标。研究表明,SSL特征在增强任务中有效,未来将关注多任务统一增强、低信噪比生成模型及可控的语音生成。整体来看,SSL为SE提供了更强的先验和设计空间。
本文介绍了迭代去噪的归一化流(iTARFlow),一种新型生成模型。与扩散模型不同,iTARFlow在训练中保持完全的端到端似然目标,并在采样时结合自回归生成和迭代去噪过程。实验结果表明,iTARFlow在不同分辨率的图像生成任务中表现优异,展现了其作为强大生成模型的潜力。
本文讨论了生成模型与判别模型的区别。生成模型学习数据的概率分布,而判别模型则关注于根据输入数据预测标签。介绍了自回归模型、变分自编码器(VAE)和生成对抗网络(GAN)的基本原理及训练方法。变分自编码器通过编码器和解码器提取特征,生成对抗网络通过生成器和判别器进行对抗训练。最后,探讨了扩散模型在图像生成中的稳定性和多样性。
因果掩码是自回归生成模型中的关键技术,确保模型在训练时仅依赖过去的信息,解决了Transformer在并行处理与生成任务之间的矛盾。通过将上三角部分设为负无穷,因果掩码确保模型在生成时不“偷看”未来的token。这一技术是现代大语言模型(如GPT系列)的基础,提升了模型训练的效率和规模。
本文介绍了GenCtrl,一个用于生成模型的可控性工具包。随着生成模型的普及,精细控制生成过程的需求增加。研究提出了一种理论框架,评估对话设置中模型的可控性,并提供了误差估计的正式保证。实验证明,模型的可控性脆弱且依赖于实验设置,强调了进行严格可控性分析的必要性。
何恺明团队在arXiv发布了《Generative Modeling via Drifting》论文,提出了Drifting Models生成模型,训练时分布逐步漂移,推理时仅需一步生成,速度提升100倍,质量更佳,标志着生成模型领域的重要转折,期待广泛应用。
扩散模型Mercury 2成为最快的生成模型,生成速度达到每秒1009个tokens,比传统自回归模型快5倍。其并行优化机制提升了生成速度,并在性能和成本上具有优势。Inception Labs专注于扩散模型,致力于突破速度与成本的瓶颈。
VSSFlow是一种新方法,将视频到声音(V2S)和视觉文本到语音(VisualTTS)任务整合在一个框架中。它通过条件聚合机制处理不同输入信号,利用交叉注意力和自注意力层的不同偏差,提升生成效果。VSSFlow在联合学习中表现优异,超越了现有基准,展示了统一生成模型的潜力。
全球黑客马拉松Sketch & Search汇聚开发者,探索AI驱动的创意流程。参赛团队需构建结合生成模型、视觉创作和向量搜索的系统。获奖项目包括Prometheus、Roast My Snack和AutoScape,展示了检索在创意和实用性中的基础作用。
何恺明团队推出了改进版单步生成模型iMF,解决了训练的稳定性和效率问题。在ImageNet测试中,iMF表现优异,FID成绩为1.72,超越多步扩散模型,证明其性能可与之媲美。
LinEAS是一种新方法,通过全局损失训练激活引导,旨在控制生成模型的输出,减少有害内容。该方法仅需少量无配对样本,在语言模型的毒性缓解上表现优于传统方法,具有更强的鲁棒性和有效性。
谷歌DeepMind与设计师Ross Lovegrove合作,利用生成模型创建椅子设计原型。通过精细调整,AI成功捕捉Lovegrove的设计语言,并将生成的设计转化为金属3D打印的实物椅子,展示了AI在设计中的独特价值。
研究提出了Transition Model(TiM),旨在解决生成模型中的速度与质量矛盾。TiM通过建模任意时间点的状态转移,支持灵活步长采样,实现快速生成与高保真度的平衡。实验结果表明,TiM在多分辨率设置下优于现有模型,具备更好的可扩展性和稳定性。
GraphRAG结合知识图谱与生成模型,提升大语言模型的推理能力,克服传统RAG的局限性。通过结构化关系网络,GraphRAG实现多跳推理,增强上下文理解,适用于复杂分析与决策支持。
STARFlow是一种基于归一化流的生成模型,专注于高分辨率图像合成。其核心是Transformer自回归流(TARFlow),结合了归一化流的表达能力与自回归Transformer的结构建模能力。通过深浅设计、在预训练自编码器的潜在空间建模及新颖的引导算法,STARFlow显著提升了可扩展性和样本质量,接近最先进的扩散模型表现。
Yandex 发布了 Alchemist,一个包含 3,350 个图像-文本对的公开 SFT 数据集,旨在提升文本到图像生成模型的输出质量。该数据集通过预训练的扩散模型筛选样本,注重高质量而非数量。评估结果显示,使用 Alchemist 微调的模型在美学和复杂度上显著提升,同时保持文本-图像相关性稳定。这一方法为生成视觉模型设定了新标准和资源。
完成下面两步后,将自动完成登录并继续当前操作。