本文介绍了连续增强离散扩散模型(CADD),该模型通过在连续潜在空间中增强离散状态空间,解决了传统离散扩散模型的信息缺失问题。CADD利用噪声潜在向量表示被遮蔽的标记,提升了文本生成、图像合成和代码建模的生成质量,并在多样性与上下文精确性之间实现了灵活控制。
本文介绍了一种生成建模框架RepTok,该框架通过自监督视觉变换器获取单一连续潜在标记来表示图像。该方法在预训练的SSL编码器基础上微调语义标记嵌入,并与生成解码器联合训练。通过添加余弦相似度损失,保持潜在空间的平滑性。RepTok在ImageNet生成和文本到图像合成中表现出色,展示了微调SSL表示作为有效潜在空间的潜力。
STARFlow是一种基于归一化流的生成模型,专注于高分辨率图像合成。其核心是Transformer自回归流(TARFlow),结合了归一化流的表达能力与自回归Transformer的结构建模能力。通过深浅设计、在预训练自编码器的潜在空间建模及新颖的引导算法,STARFlow显著提升了可扩展性和样本质量,接近最先进的扩散模型表现。
本研究综合评估了生成性人工智能在角色动画中的应用,分析了面部动画、表情渲染和图像合成等技术,指出了当前面临的挑战,并为未来研究方向提供指导。
本研究提出了Science-T2I数据集,解决了图像合成中科学知识整合不足的问题。研发的SciScore模型显著提升了生成图像的科学性和视觉效果,评估性能接近人类水平,推动了图像合成标准的建立。
本文提出了一种新型生成对抗网络CKGAN,基于特征核积分概率度量框架,旨在解决模式崩溃问题。CKGAN通过自动学习特征核函数,在合成和真实图像基准测试中表现优于其他GAN,接近手动调整的最佳性能。
本研究提出了一种两阶段的差分隐私图像合成框架,通过引入“中心图像”有效学习简单特征,使合成图像的保真性和实用性分别提高了33.1%和2.1%。
自回归视觉生成模型通过离散和连续token实现高质量图像合成。TokenBridge采用新颖的训练后量化技术,显著提升生成效果,且在参数更少的情况下优于传统模型,为未来视觉合成技术提供新思路。
本研究结合视觉提示与差分隐私神经切线核,提升了高分辨率图像合成数据的有效性,准确率从0.644提升至0.769,为差分隐私合成数据的应用开辟新路径。
本研究提出DPImageBench,解决了差分隐私图像合成领域评价标准不一致的问题。通过评估十一种方法,发现上游分类器的选择会高估效用评分,且低维特征添加噪声的效果优于高维特征。
本研究提出了TaylorSeer方法,以解决扩散变换器的高计算需求问题。该方法通过泰勒级数近似特征高阶导数,显著提升了图像和视频合成的效率,尤其在高加速比下实现了近乎无损的加速效果。
这项研究介绍了一种新型深度学习架构——分形生成模型。该模型利用分形的自相似性原理,参数减少了65%,在图像和音频合成任务中表现更佳。
本研究提出MAETok方法,通过掩码建模探索扩散模型的潜在空间特性,从而提高图像合成任务的生成质量与效率。
本研究提出了一种无需调优的方法,解决物体插入和主体驱动生成中的高数据收集成本问题。通过利用无标签数据的共现现象,构建强大的配对数据集,训练高效的文本到图像扩散架构,提升物体身份保持和图像合成效果。
本文介绍了多种生成模型的改进,包括Flow++、NC-VAE、DeFlow和重建生成扩散模型。研究表明,矫正流模型在高分辨率文本到图像合成中表现优越,解决了模型崩溃和图像重建问题,提升了生成质量和性能。
本研究提出了一种新方法,将超声心动图转化为高质量的心脏MRI图像,有效解决了噪声和对比度不足的问题。经过Cycle-GAN训练后,78.9%的病例中医师更倾向于使用合成图像进行诊断。
本研究提出了一种基于监督对比学习的图像合成框架,旨在解决文本到图像生成中的内模态语义对应问题。通过共享对比分支,该框架有效聚类语义相似的图像-文本对,从而提升生成质量。实验结果表明,在COCO数据集上,FID指标显著提高,验证了方法的有效性。
本文介绍了10种提升OG图像生成的高级技巧,如动态字体缩放、智能图像合成和渐变文本效果。这些技巧能显著提高生成速度和质量,优化内存管理,确保图像符合质量标准。
ICLR 2025 论文《SANA》提出了一种高效的高分辨率图像合成方法,支持1024×1024至4096×4096的分辨率。研究团队采用新型自动编码器和线性注意力模块,显著提升了生成速度和质量。经过审稿人反馈,作者详细解释了创新点,最终获得更高评分,体现了积极互动的重要性。
本文探讨了扩散模型在高维数据生成中的应用,包括图像合成和视频生成。研究提出了一个统一框架,并结合进化算法以提高生成效率,强调了扩散模型的潜力及未来发展方向。
完成下面两步后,将自动完成登录并继续当前操作。