Yandex 发布了 Alchemist,一个包含 3,350 个图像-文本对的公开 SFT 数据集,旨在提升文本到图像生成模型的输出质量。该数据集通过预训练的扩散模型筛选样本,注重高质量而非数量。评估结果显示,使用 Alchemist 微调的模型在美学和复杂度上显著提升,同时保持文本-图像相关性稳定。这一方法为生成视觉模型设定了新标准和资源。
港中文MMLab团队发布了首个基于强化学习的文生图模型T2I-R1,采用双层级CoT推理框架,提升了图像生成的准确性和质量,增强了文本与图像的理解。该模型在多个基准测试中表现优异,显示出推理在图像生成中的有效性,未来有望应用于视频生成等领域。
机器之心数据服务现已上线,提供高效稳定的数据获取,简化数据爬取流程。
本研究提出了Science-T2I数据集,解决了图像合成中科学知识整合不足的问题。研发的SciScore模型显著提升了生成图像的科学性和视觉效果,评估性能接近人类水平,推动了图像合成标准的建立。
本研究提出了一种新的保留度量和有效的遗忘算法,以解决文本到图像扩散模型在遗忘特定训练数据时对模型完整性的影响,优于现有方法。
本文介绍了LoRAdapter,一种通过新型条件LoRA模块实现统一风格和结构条件的文本到图像生成模型的方法。该方法能够进行零-shot控制,提供高效且强大的生成过程控制,超越了现有技术。
本文介绍了一个新的多任务基准,用于评估文本到图像模型,并比较了开源与商业模型的表现。研究探讨了多模态信息如何提升文本生成模型的能力,并提出了交互式文本到图像生成的新任务。实验结果显示,现有模型在常识推理生成方面与人类表现存在显著差距,并且存在社会偏见问题。研究旨在提升人机交互体验和图像质量。
该研究提出了一种无需 LoRA 的风格化图像生成方法,通过文本提示和风格参考图像生成高质量图像。为提高生成内容的可控性和保真度,作者引入了 StyleAdapter 模型,采用双路径交叉注意力模块和解耦策略,增强了生成的灵活性和效率。实验结果验证了该方法的优越性。
最近的研究发现,个性化文本到图像(T2I)扩散模型在生成高保真度图像方面存在困难。研究人员提出了一种名为ComFusion的新方法,能够将视觉主题实例与文本特定场景融合,生成高保真度的实例。ComFusion使用预训练模型和场景特定知识来提高生成的保真度,并确保图像与实例和场景文本对齐。对T2I个性化中的各种基线进行了评估,证明了ComFusion的优越性。
该文章介绍了大规模文本-图像扩散模型的突破性发展,可以生成令人信服的图像,并让用户具有控制能力。该技术应用前景广阔。
本研究通过与DALLE3集成的T2I模型ChatGPT重新审视现有的T2I系统,并引入新的任务——交互式文本到图像(iT2I)。我们提出了一种简单的方法来增强LLMs在iT2I上的能力,并在不同的LLMs下在多种常见场景中评估了我们的方法。
该研究提出了一种低成本的自然多概念文本到图像生成解决方案,通过微调预训练文本到图像扩散模型中的文本嵌入,应用交叉令牌非极大值抑制来避免不同概念之间的特征混合,优于以前的方法。
完成下面两步后,将自动完成登录并继续当前操作。