小红花·文摘

本研究提出了一种基于Vision Transformers构建的简单通用的U-ViT架构，实现了无条件和类条件图像生成以及文本到图像生成任务的优化。研究结果表明，长跳过连接对于基于扩散的图像建模至关重要，而CNN-based U-Net中的下采样和上采样算子并非总是必要的。

DiffiT：用于图像生成的扩散视觉 Transformer

BriefGPT - AI 论文速递 ·

该研究提出了一种基于Vision Transformers构建的U-ViT架构，采用标记方法对所有输入进行处理，并在浅层和深层之间采用长跳过连接，实现无条件和类条件图像生成，以及文本到图像生成任务的优化。长跳过连接对于基于扩散的图像建模至关重要，而CNN-based U-Net中的下采样和上采样算子并非总是必要的。

Diffusion U-Net 中的免费午餐

BriefGPT - AI 论文速递 ·