Improving Object State Representation in Text-to-Image Generation

💡 原文英文,约100词,阅读约需1分钟。
📝

内容提要

目前文本到图像生成模型在物体状态表示上存在困难。本文提出一种全自动流程生成高质量合成数据,以准确捕捉物体不同状态,并微调多个开源模型。研究表明,微调后模型在生成图像与提示文本的对齐度上平均提升超过8%。

🏷️

标签

➡️

继续阅读