基于隐式提示的文本到图像模型的研究
内容提要
本文综述文本到图像生成中的提示优化研究,涵盖安全生成、无提示图像合成、偏见识别与量化、交互式生成及提示扩展等方向,并提出多种方法以减少不当内容、缓解社会偏见、提升图像质量与多样性。
延伸解读
提示优化成为T2I安全与公平的关键路径
文章汇总的多项研究显示,提示优化已从单纯提升生成质量,扩展到安全生成、偏见识别与量化等方向。例如,通过构建毒性-清洁提示对训练优化器,可显著减少不当图像生成,且对文本对齐影响不大;而基于遮蔽语言模型的影响得分方法,能识别生成图像中的种族与性别刻板印象。这些工作表明,提示层面的干预是缓解T2I模型社会风险的有效手段,但文章也指出,提示缓解可能无法解决图像质量或模型在其他场景中的差异。
无提示与交互式生成拓展T2I应用边界
文章提到Prompt-Free Diffusion框架仅依赖视觉输入即可生成新图像,其核心SeeCoder在基于示例的合成上优于先前方法,在最佳实践提示下也能与最先进T2I模型媲美。同时,交互式文本到图像(iT2I)任务允许用户与LLM交互,通过自然语言生成、编辑、精炼图片,且能低成本地为现有LLM和T2I模型引入该功能,对LLM固有能力影响很小。这些方向降低了文本提示的依赖,提升了人机交互体验。
提示因素与偏见量化揭示模型对齐复杂性
针对提示模板的新度量研究发现,潜在噪声、提示概念数量、顺序和属性等因素都会影响图像生成,说明提示的细微变化可能导致输出差异。此外,对DALLE-v2和Stable Diffusion的评估显示,模型存在严重的职业偏见和地理位置代表的日常情况偏差,增加提示详细信息虽可缓解部分偏差,但可能无法解决图像质量或其他场景用途的差异。反事实推理方法则提供了量化任何T2I模型和提示偏见的通用途径。
Q&A
文本到图像生成中,如何减少不当内容的生成?
可以构建毒性-清洁提示对数据集,设计奖励函数衡量生成图像的毒性和文本对齐度,训练一个通用提示优化器。实验证明该方法能显著减少不当图像的生成概率,且对文本对齐无明显影响,与其他方法结合效果更好。
有没有不需要文本提示就能生成图像的模型?
有,Prompt-Free Diffusion 框架基于仅视觉输入,不需要文本提示就能生成新图像。其核心架构是语义上下文编码器 (SeeCoder),在基于示例的合成方法上优于先前方法,在遵循最佳实践的提示下也能与最先进的 T2I 模型相媲美。
文本到图像模型存在哪些社会偏见?如何量化?
T2I 模型存在职业偏见和地理位置代表的日常情况等社会偏见。可以通过遮蔽语言模型计算单词影响得分来识别种族和性别偏见;也可以通过自动化和人工评估实验,研究性别、年龄、种族和地理位置在职业、人格特征和日常情况中的偏见;还可以通过反事实推理来研究和量化广泛偏见,并以语义概念形式扩展定量评分。
什么是交互式文本到图像(iT2I)?
iT2I 是一种新任务,人们可以与 LLM 进行交互,通过自然语言生成、编辑、精炼高质量图片,并进行问题回答。通过引入提示技术和现成的 T2I 模型,可以低成本地为任何现有 LLMs 和任何文本到图像模型引入 iT2I 功能,同时对 LLMs 在问题回答和代码生成等方面的固有能力造成很小降低。
如何通过提示优化提升生成图像的美感和多样性?
可以使用基因算法结合人类反馈学习组合最有用的提示关键字,以改善生成艺术图像的美感;也可以利用扩散模型进行串行优化得到直观的语言提示,产生具有相似内容的多样化图像;还可以通过 Prompt Expansion 框架优化扩展文本提示,生成更美观多样的图像。
提示中的哪些因素会影响文本到图像模型的对齐性?
潜在噪声、提示概念的数量、顺序和属性等因素都会影响图像生成的对齐性。