PhyBench:用于评估文本到图像模型的物理常识基准
内容提要
本文提出了常识-T2I基准,用于评估文本到图像生成模型的常识推理能力。研究发现,现有模型(如DALL-E 3和稳定扩散XL)在生成符合常识的图像方面存在显著不足,准确率分别为48.92%和24.92%。此外,研究还揭示了视频生成模型在模拟物理世界方面的局限性,并提出了新的评估基准和方法,以推动文本到图像生成的进展。
延伸解读
常识-T2I基准的独特设计
常识-T2I基准通过提供成对的对抗性文本提示来评估模型的视觉常识推理能力。这些提示包含相同的动作词但存在细微差异,例如“没有电的灯泡”与“有电的灯泡”,要求模型生成与语义相符的图像。数据集由专家精心策划,并带有细粒度标签,如常识类型和预期输出的可能性,便于分析模型行为。这种设计能够精确测试模型是否理解物理常识,而不仅仅是生成逼真图像。
现有模型的常识短板
评测显示,即使是先进的文本到图像模型在常识-T2I上表现不佳。DALL-E 3的准确率仅为48.92%,稳定扩散XL更是低至24.92%。这表明图像合成与真实生活照片之间存在显著差距,模型在生成符合常识的图像方面仍有很大提升空间。研究还证明,GPT强化的提示无法解决这一挑战,说明问题根源在于模型本身的常识推理能力不足。
对视频生成模型的启示
文章提及VideoPhy基准的评估结果,显示文本到视频生成模型缺乏生成符合文字提示和物理规律视频的能力。这揭示了视频生成模型远未准确模拟物理世界的程度。常识-T2I与VideoPhy共同指出,当前生成模型在理解物理常识方面存在普遍局限,不仅限于图像生成,也影响视频生成等更复杂任务。
推动实际生活图像生成
常识-T2I旨在作为文本到图像常识检查的高质量评估基准,促进实际生活图像生成的进展。通过提供对抗性挑战和细粒度标签,该基准有助于研究者分析模型行为并识别不足。文章还提到其他相关基准如T2I-CompBench和HRS-Bench,它们从不同角度评估模型能力,共同推动文本到图像生成技术的发展。
Q&A
常识-T2I基准的主要目的是什么?
常识-T2I基准旨在评估文本到图像生成模型在生成符合常识的图像方面的能力。
DALL-E 3和稳定扩散XL在常识-T2I基准上的准确率是多少?
DALL-E 3的准确率为48.92%,稳定扩散XL的准确率为24.92%。
研究中提到的文本到视频生成模型的局限性是什么?
文本到视频生成模型缺乏生成符合文字提示和物理规律的视频的能力。
常识-T2I基准是如何评估模型的?
常识-T2I基准通过提供成对的文本提示和预期输出,评估模型的视觉常识推理能力。
研究提出了哪些新的评估方法?
研究提出了新的生成模型细调和奖励驱动的样本选择(GORS)方法,以提高文本到图像模型的生成能力。
常识-T2I基准的设计特点是什么?
常识-T2I基准由专家精心策划,并用细粒度标签进行注释,以帮助分析模型行为。