本文研究了扩散变换器(DiTs)在文本到图像生成中的效率,分析了架构选择和训练策略。结果表明,标准DiT在性能上与专门模型相当,但参数效率更高。通过层级参数共享策略,DiT-Air和DiT-Air-Lite在保持竞争力的同时,模型尺寸减少了66%。DiT-Air在GenEval和T2I CompBench上表现优异。
本文探讨了扩散变换器(DiT)模型的归纳偏差对泛化能力的影响。研究发现,局部注意力窗口与泛化能力密切相关,通过限制注意力窗口并注入局部注意力,可以显著提高模型的泛化和生成质量,尤其在训练数据较少的情况下。优化DiT的归纳偏差有助于提升性能。
本研究提出了一种有效的超参数调优方法μP,应用于扩散变换器,显著提升了模型的收敛速度和扩展性,尤其在文本到图像生成任务中表现突出,同时降低了调优成本。
本研究提出通过扩散变换器提升图像理解与生成模型的训练效率和生成质量。采用顺序预训练策略,开发的BLIP3-o模型在基准测试中表现优异,并开放源代码和数据集以促进研究。
本研究提出了JointDiT模型,通过扩散变换器增强RGB和深度的联合建模。采用自适应调度权重和不平衡时间步采样策略,JointDiT显著提升了图像生成和深度估计的性能,展现了在多种生成任务中的应用潜力。
本研究提出了一种基于扩散变换器的新方法,有效解决表格数据时间序列生成的问题。实验结果表明,该方法在多个数据集上显著优于以往的研究。
本研究提出了一种新的解耦设计的扩散变换器(DDT),有效解决了训练周期和推理步骤过长的问题。实验结果显示,随着模型规模的增加,编码器性能显著提升,DDT-XL/2在ImageNet上达到了最先进的FID值,并加快了推理速度。
本研究解决了多模态扩散变换器中自注意力层对位置嵌入和查询-键相似性的依赖,提出了一种无训练的图像编辑框架,提升了图像编辑质量并保持了原始语义内容。
本研究提出了BlockDance方法,旨在提高扩散变换器的推理速度。通过重用相邻时间步的相似时空特征,BlockDance在保持生成质量的同时,实现了25%至50%的加速效果。
该研究提出了TIDE框架,增强了扩散变换器(DiTs)在生成模型中的应用,通过稀疏自编码器提取层次特征,提升了重建性能,并展示了良好的图像编辑和风格转换能力。
本研究提出了TaylorSeer方法,以解决扩散变换器的高计算需求问题。该方法通过泰勒级数近似特征高阶导数,显著提升了图像和视频合成的效率,尤其在高加速比下实现了近乎无损的加速效果。
Wan-2.1-1.3b是由Wan-Video维护的先进视频生成模型,能够根据文本描述生成5秒480p的视频。该模型采用扩散变换器架构,支持中英文输入,具备良好的视觉质量和运动连贯性,用户可调整参数以控制生成过程。
本研究提出DiTAR方法,结合语言模型与扩散变换器,有效解决了生成连续语音的计算负荷与效果问题,显著提高了生成效率,降低了计算需求,并在零样本语音生成中表现优异。
该研究提出了DiffRatio-MoD框架,解决了扩散变换器在资源受限设备上的高延迟和内存低效问题。通过动态计算路由,令牌计算需求可适应性调整,显著提升了生成质量与效率的平衡。实验结果表明,该方法在文本到图像生成和图像修复任务中优于现有技术。
本研究提出PAD框架,通过扩散变换器统一图像预测与机器人动作生成,显著提升机器人控制性能和泛化能力。
本研究提出了跳跃分支(Skip-DiT),旨在提高扩散变换器在图像和视频生成中的效率和特征平滑性。实验结果显示,Skip-DiT的速度提升了1.5倍,性能仅略有下降,为生成质量的改善提供了新方案。
本研究探讨扩散变换器(DiTs)的隐含空间特性,提出编码-识别-操作框架,通过文本提示实现图像的精确语义控制,推动零样本细粒度图像编辑技术的发展。
本研究提出了一种新颖的时空引导扩散变换器概率模型(st-DTPM),旨在解决双时段PET影像中的延迟扫描问题。该模型结合了CNN的局部特征与变换器的全局信息,显著提高了影像预测的准确性,实验结果表明其在影像质量和结构信息保持方面优于其他方法。
本文提出了多种针对扩散变换器(DiTs)的量化方法,包括EfficientDM、PTQ4DiT和VQ4DiT。这些方法通过量化感知训练和后训练量化技术,在保持图像生成质量的同时,显著降低了计算成本和模型大小,适用于边缘设备的高效推理。
Tora是一种以轨迹为导向的扩散变换器(DiT)架构,可以生成具有不同分辨率和宽高比的高质量视频。它通过整合文本、视觉和轨迹条件来精确控制视频内容。Tora在平滑度、轨迹对齐和保真度方面优于其他方法。它使用轨迹提取器、时空DiT和运动引导融合器来生成视频。Tora展示了出色的运动保真度,能够准确模拟物理运动。它实现了高精度的轨迹对齐,并在视觉质量和保真度方面优于其他方法。
完成下面两步后,将自动完成登录并继续当前操作。