小红花·文摘
  • 首页
  • AI Tokens🪙
  • 排行榜🏆
  • 直播
  • FAQ
Dify.AI
香农信息论才是AI底牌,大模型压缩机80年前就造好了

香农信息论被视为AI的底层逻辑,大模型本质上是数据压缩器,其压缩能力与智能正相关;扩散模型通过去噪测量互信息;自由能原理驱动智能体探索。然而,批评者指出该理论忽视了记忆、深度、因果与意义。香农理论是智能的基础,但并非全部,意义问题仍未解决。

香农信息论才是AI底牌,大模型压缩机80年前就造好了

极道 极道 · 2026-08-25T10:14:00Z
AI论文评述:通过估计数据分布的梯度进行生成建模

本文介绍2019年Song与Ermon提出的基于分数的生成建模框架。该方法不直接学习数据分布,而是学习其分数(对数密度梯度),通过分数匹配训练噪声条件分数网络(NCSN),并用退火朗之万动力学从噪声中采样。多级高斯噪声扰动解决了流形假设和低密度区域问题,在CIFAR-10上取得先进结果,为现代扩散模型奠定基础。

AI论文评述:通过估计数据分布的梯度进行生成建模

freeCodeCamp.org freeCodeCamp.org · 2026-08-12T21:35:20Z

PersonaLive是澳门大学等机构提出的实时肖像动画方案,通过流式金字塔去噪,使不同噪声档位的帧共享一次UNet前向,实现4步去噪仅需1/4次计算,支持无限长视频流。它分离身份、姿态、表情三条条件通路,并用TensorRT融合加速。训练分三阶段,代码和权重已开源。

PersonaLive: 把肖像扩散模型压到能直播

阁子 阁子 · 2026-08-10T11:20:00Z
PersonaLive: 把肖像扩散模型压到能直播

PersonaLive是澳门大学等机构提出的实时肖像动画方案,通过流式金字塔去噪使4步扩散仅需一次前向,实现无限长视频生成。它利用三条条件通路分别处理身份、姿态和表情,并采用TensorRT融合优化提速。训练分三阶段,代码和权重已开源。

PersonaLive: 把肖像扩散模型压到能直播

阁子 阁子 · 2026-08-10T11:20:00Z

本文介绍DiT(扩散Transformer),用Transformer替代U-Net作为扩散模型去噪网络。DiT在潜在空间通过patchify和adaLN-Zero条件注入,以更少计算量取得更优FID,但U-Net经调优仍具竞争力。视频生成中,时空token数量爆炸,联合注意力成本随帧数平方增长,需用分解式注意力平衡效率与一致性。Sora架构细节未公开,且承认物理模拟等局限。

【Transformer 与注意力机制】47|Diffusion + Transformer:DiT 与 Sora 为什么用 Transformer

土法炼钢兴趣小组的博客 土法炼钢兴趣小组的博客 · 2026-08-06T00:00:00Z
全球首个Agentic扩散模型来了:边行动边纠错,128K上下文追平自回归

蚂蚁集团inclusionAI团队发布千亿参数MoE扩散模型LLaDA2.2,首次将扩散模型应用于长程Agent任务。该模型支持128K上下文,通过Levenshtein编辑、强化学习L-EBPO和BlockRouting机制,实现自我修正、环境反馈处理及高效推理。在七大基准上接近顶尖自回归模型,吞吐量达1.64倍,预示扩散与自回归模型将双轨并行。

全球首个Agentic扩散模型来了:边行动边纠错,128K上下文追平自回归

量子位 量子位 · 2026-07-28T04:18:15Z
人工智能论文评审:使用非平衡热力学的深度无监督学习

扩散模型推动了现代生成AI的发展,能够生成逼真的图像、视频和语音。2015年,Jascha Sohl-Dickstein等提出了一种通过逐步添加噪声来破坏数据并学习逆过程重建数据的新方法。这一思路解决了生成模型中的复杂性与可计算性之间的权衡,奠定了扩散概率模型的数学基础。该模型在多个数据集上表现出色,展示了在图像去噪和修复等实际应用中的潜力。

人工智能论文评审:使用非平衡热力学的深度无监督学习

freeCodeCamp.org freeCodeCamp.org · 2026-07-15T15:23:43Z
CVPR 2026 | 重思基于扩散模型的视频超分辨率:利用对齐特征的稠密引导 DGAF-VSR

本文介绍了DGAF-VSR,一种基于扩散模型的视频超分辨率方法。该方法通过光流引导变形模块和特征级时序条件模块,显著提升了视频的感知质量、重建保真度和时序一致性。实验结果表明,DGAF-VSR在多个数据集上表现优异,为短视频和直播等应用提供了重要突破。

CVPR 2026 | 重思基于扩散模型的视频超分辨率:利用对齐特征的稠密引导 DGAF-VSR

实时互动网 实时互动网 · 2026-07-10T06:47:32Z
极简方案刷新扩散模型推理纪录,阿里清华论文入选ICML杰出论文

阿里巴巴与清华大学合作的论文《灵活性陷阱》入选ICML杰出论文,质疑扩散语言模型任意顺序生成的价值。研究表明,任意顺序生成会导致推理能力下降,提出的“JustGRPO”方法强制模型从左到右生成,显著提高推理效果。

极简方案刷新扩散模型推理纪录,阿里清华论文入选ICML杰出论文

量子位 量子位 · 2026-07-06T10:33:45Z
Mythos阴影里谷歌悄悄发模型,速度暴涨4倍

谷歌推出了新型文本生成模型DiffusionGemma,采用扩散模型技术,生成速度比传统自回归模型快4倍。该模型一次性生成256个token,支持实时自我纠错,适合速度敏感的本地应用。尽管质量上与同类模型存在差距,但其并行计算能力展示了未来大模型的潜力。

Mythos阴影里谷歌悄悄发模型,速度暴涨4倍

量子位 量子位 · 2026-06-11T04:17:22Z
字节开源统一框架Bernini:给DiT配个“大模型军师”,AI视频编辑先理解再动手

字节推出了开源视频生成与编辑框架Bernini,强调“先理解再生成”。该框架利用多模态大模型进行语义理解,并通过扩散模型实现高质量渲染,解决视频编辑中的一致性和自然性问题。Bernini支持多种编辑选项,如天气、风格和焦点,能够处理复杂视觉效果,提高创作的可控性和稳定性。

字节开源统一框架Bernini:给DiT配个“大模型军师”,AI视频编辑先理解再动手

量子位 量子位 · 2026-06-02T09:28:00Z
DDIM之父宋佳铭,宣布离职

宋佳铭(DDIM之父)离开Luma AI,期间推动了多模态基础模型的发展,并参与了3D生成到视频生成的技术转型。他的DDIM论文奠定了扩散模型在图像生成中的基础,影响了多个生成式AI产品。

DDIM之父宋佳铭,宣布离职

量子位 量子位 · 2026-05-31T14:30:16Z
从”对口型”到”数字人” 音频驱动虚拟人合成技术全景解析

自2021年以来,音频驱动虚拟人合成技术迅速发展,结合静态图像与音频生成同步视频,广泛应用于直播和客服等领域。主要技术挑战包括身份保持与音视频同步。近年来,扩散模型成为主流,推动了该领域的进步。关键研究包括Hallo2、Let Them Talk和OmniHuman-1,分别聚焦于长视频生成、多人人物对话及全身数字人模型,展现出显著的技术突破与商业潜力。

从”对口型”到”数字人” 音频驱动虚拟人合成技术全景解析

实时互动网 实时互动网 · 2026-05-25T06:33:54Z

本文讨论了生成模型与判别模型的区别。生成模型学习数据的概率分布,而判别模型则关注于根据输入数据预测标签。介绍了自回归模型、变分自编码器(VAE)和生成对抗网络(GAN)的基本原理及训练方法。变分自编码器通过编码器和解码器提取特征,生成对抗网络通过生成器和判别器进行对抗训练。最后,探讨了扩散模型在图像生成中的稳定性和多样性。

CS231n 讲义:生成模型

Louis Aeilot's Blog Louis Aeilot's Blog · 2026-05-03T00:45:09Z
在线教程丨低门槛部署英伟达最新Physical AI模型,覆盖人形机器人/人体运动生成/扩散模型微调等

在GTC 2026上,NVIDIA推出了Physical AI概念,强调AI与现实世界的深度结合。发布了Isaac GR00T、Kimodo和SOMA-X等开源项目,旨在提升机器人在复杂环境中的执行能力,使其更自然、高效地完成任务。

在线教程丨低门槛部署英伟达最新Physical AI模型,覆盖人形机器人/人体运动生成/扩散模型微调等

HyperAI超神经 HyperAI超神经 · 2026-03-25T05:49:56Z
ICLR 2026 | 火山引擎多媒体实验室提出GenDR, 探索扩散模型超分落地难题

扩散模型在图像生成方面取得了重要进展,但由于推理步骤多和分辨率限制,实际应用受到制约。为提高效率和图像保真度,提出了GenDR和GenDR-Pix模型,优化了VAE和UNet,支持高分辨率图像处理,增强了细节恢复效果,推动生成技术与实际业务的结合。

ICLR 2026 | 火山引擎多媒体实验室提出GenDR, 探索扩散模型超分落地难题

实时互动网 实时互动网 · 2026-03-04T06:39:12Z
何恺明团队再出大招:Drifting Models 挑战扩散模型,单步生成高质量图像

何恺明团队在arXiv发布了《Generative Modeling via Drifting》论文,提出了Drifting Models生成模型,训练时分布逐步漂移,推理时仅需一步生成,速度提升100倍,质量更佳,标志着生成模型领域的重要转折,期待广泛应用。

何恺明团队再出大招:Drifting Models 挑战扩散模型,单步生成高质量图像

Micropaper Micropaper · 2026-03-03T00:30:00Z
Inception表示其扩散语言模型比Claude、ChatGPT和Gemini快10倍

Inception Labs推出了基于扩散模型的语言模型Mercury 2,其速度比传统自回归模型快5到10倍,采用并行计算优化响应时间。尽管生成文本质量与Claude Haiku和Google Flash相当,但在经济性上更具优势。Mercury 2现已通过OpenAI兼容API提供。

Inception表示其扩散语言模型比Claude、ChatGPT和Gemini快10倍

The New Stack The New Stack · 2026-03-02T21:30:30Z
扩散模型成最快深度思考!告别自回归每秒1009个tokens,英伟达微软都投了

扩散模型Mercury 2成为最快的生成模型,生成速度达到每秒1009个tokens,比传统自回归模型快5倍。其并行优化机制提升了生成速度,并在性能和成本上具有优势。Inception Labs专注于扩散模型,致力于突破速度与成本的瓶颈。

扩散模型成最快深度思考!告别自回归每秒1009个tokens,英伟达微软都投了

量子位 量子位 · 2026-02-26T02:03:18Z
ICLR 2026 | 把视频扩散模型压到4bit,还能接近满血效果? QVGen让「超低比特视频生成量化」真正可用

抱歉,提供的文本内容过于简短,无法进行有效总结。请提供更详细的文章内容。

ICLR 2026 | 把视频扩散模型压到4bit,还能接近满血效果? QVGen让「超低比特视频生成量化」真正可用

机器之心 机器之心 · 2026-02-25T10:07:08Z
  • <<
  • <
  • 1 (current)
  • 2
  • 3
  • >
  • >>
👤 个人中心
在公众号发送验证码完成验证
登录验证
在本设备完成一次验证即可继续使用

完成下面两步后,将自动完成登录并继续当前操作。

1 关注公众号
小红花技术领袖公众号二维码
小红花技术领袖
如果当前 App 无法识别二维码,请在微信搜索并关注该公众号
2 发送验证码
在公众号对话中发送下面 4 位验证码
友情链接: MOGE.AI 九胧科技 1tok 菜鸟教程 Remio.AI DeekSeek连连 53AI 神龙海外代理IP IPIPGO全球代理IP 东波哥的博客 匡优考试在线考试系统 开源服务指南 蓝莺IM Solo 独立开发者社区 AI酷站导航 极客Fun 我爱水煮鱼 周报生成器 He3.app 简单简历 白鲸出海 T沙龙 职友集 TechParty 蟒周刊 Best AI Music Generator 模力方舟 Gitee AI

小红花技术领袖俱乐部
小红花·文摘:汇聚分发优质内容
小红花技术领袖俱乐部
Copyright © 2021-
粤ICP备2022094092号-1
公众号 小红花技术领袖俱乐部公众号二维码
视频号 小红花技术领袖俱乐部视频号二维码