PixelDiT提出单阶段端到端像素空间扩散Transformer,无需VAE,采用补丁级和像素级双层架构,结合像素级AdaLN与Token压缩,高效建模全局语义和局部纹理。在ImageNet 256×256达1.61 FID,文生图GenEval 0.74,逼近潜空间模型,并避免VAE重建伪影,利于细节保留。
LaDiR(潜在扩散推理器)是一种新颖的推理框架,结合了连续潜在表示的表达能力与潜在扩散模型的迭代精炼能力。通过变分自编码器(VAE)构建的结构化潜在推理空间,LaDiR在数学推理和规划基准测试中展现出更高的准确性、多样性和可解释性,开辟了文本推理的新范式。
本文探讨了条件扩散模型的组合泛化能力,特别是长度泛化,即生成训练中未见过的对象图像。在CLEVR实验中,发现长度泛化在某些情况下可行,表明模型能够学习组合结构。研究表明,局部条件分数与组合泛化相关,成功的模型展现出局部条件分数,而失败的模型则没有。通过因果干预,可以在之前失败的模型中实现长度泛化。
Modular发布了Gemma 4,展示了AI编码代理在复杂系统工程任务中的能力。五个前沿模型成功重建了Wan 2.1文本到视频推理管道,证明了MAX图形API的有效性,并展示了调试和工程纪律的重要性,能够在新框架中构建完整的多模态推理系统。
本文提出了一种改进的对抗扩散压缩方法(AdcVSR),用于真实世界视频超分辨率。该方法通过剪枝和轻量级一维卷积,显著降低模型参数和推理时间,同时保持视频质量。实验结果表明,AdcVSR在减少95%参数的同时,实现约8倍的速度提升,优化了细节生成与时域一致性。
RDT2是一种新型机器人基础模型,旨在实现跨本体、物体和场景的零样本迁移能力。通过使用UMI数据集和三阶段训练策略,RDT2能够高效处理多样化的真实世界任务,提升机器人在未见物体和场景中的泛化能力。该模型在微调实验中表现优异,尤其在复杂操作和动态任务中,展现出显著的性能提升。
抱歉,您提供的文本内容过于简短,无法进行有效的总结。请提供更详细的文章内容。
智谱与华为联合开源了新一代图像生成模型GLM-Image,该模型采用自回归与扩散解码器混合架构,提升了文字生成的准确性,支持多种比例的图像生成,成本低至0.1元,适合商业应用。用户可在HyperAI官网体验该模型。
研究团队开发了InstantViR框架,成功解决了实时高质量视频重建的难题。该系统通过简化视频扩散模型,实现每秒超过35帧的处理速度,重建质量优于现有技术,为视频会议和直播等应用带来了新机遇。
本文探讨了条件扩散模型的组合泛化能力,特别是长度泛化,即生成比训练时更多物体的图像。研究发现,模型在某些情况下能够实现长度泛化,表明它们有时学习到组合结构。成功的CLEVR模型展示了局部条件分数,而失败的模型则没有。强制局部条件分数的干预可以恢复失败模型的长度泛化能力。
本文讨论了DreamControl,一种结合扩散模型与强化学习的全身类人机器人控制方法。该方法利用人类动作数据生成自然运动轨迹,提升机器人在复杂环境中的自主操作能力,解决了稳定性和协调性问题。研究表明,该方法在多种任务中有效,推动了人形机器人技术的发展。
本文介绍了一种新的扩散采样方法,其速度比现有最优解快186%。该方法无需训练,利用普通微分方程求解器,通过高维初始噪声生成更详细的样本,并控制细节水平。研究表明,该方法在多个预训练扩散模型上表现优异。
腾讯混元升级了AI绘画微调方法,通过Direct-Align和语义相对偏好优化(SRPO)显著提升了图像的真实感和美学评分,人工评估分数提高300%。新方法在32块H20上训练10分钟即可收敛,解决了传统模型的优化局限性,并支持在线调整奖励信号,生成图像质量显著提升。
本文探讨了人形机器人在运动追踪和控制方面的进展,重点介绍了BeyondMimic和UniTracker两个项目。BeyondMimic旨在解决真实环境中的运动跟踪和sim2real迁移问题,而UniTracker通过条件变分自编码器提升运动表现力和全局一致性。这些研究为人形机器人的高效控制和应用提供了新思路。
本期讨论银狐病毒及安全漏洞管理,提出应对方案和高效漏洞运营体系的建议,包括安全意识培训、自动化规则和跨部门协作,强调事前准备和高效工具的重要性。
机器之心数据服务现已上线,提供高效稳定的数据获取,简化数据爬取流程。
ADiT模型通过结合潜在表示与Transformer技术,突破了原子系统建模的周期性与非周期性限制,显著提高了生成效率与可扩展性,为新材料和药物设计提供了重要支持。
本文探讨了扩散模型生成图像的多样性问题,提出了一种通过引入数据驱动的排斥项来增强生成图像多样性和质量的方法。该方法在批量生成相同提示的图像时表现优异,同时保护特定图像集的多样性。
完成下面两步后,将自动完成登录并继续当前操作。