蚂蚁 inclusionAI 开源 6B 统一图像生成与编辑模型 LLaDA-Image

蚂蚁 inclusionAI 开源 6B 统一图像生成与编辑模型 LLaDA-Image

💡 原文中文,约3700字,阅读约需9分钟。
📝

内容提要

蚂蚁集团开源统一图像生成与编辑模型LLaDA-Image,含6B参数,提供Base和Turbo两版本,支持文生图、编辑及中英文渲染。Turbo采用蒸馏技术,仅需4步采样。模型在Qwen-Image-Bench上得分领先,并公开权重与推理代码。

🔎

延伸解读

统一架构与训练策略

LLaDA-Image 采用统一的扩散架构,Backbone 与 DiT 均为扩散模型,单个权重即可同时支持文生图与指令引导编辑,无需单独的编辑骨干网络。其训练策略先通过纯图像预训练建立视觉先验,再引入成对语言监督与生成-编辑联合训练,这有助于模型在统一框架中学习生成与编辑能力。

Turbo 版本的高效推理

LLaDA-Image-Turbo 通过 Twin-DMD 蒸馏技术,将采样步数从 50 步降至 4 步,显著提升推理速度。在快速生成与编辑场景中,Turbo 版本提供了更高效的解决方案,但需注意其推荐配置(如 guidance_scale=1.0)与 Base 版本不同,用户应根据需求选择合适的版本。

多模式支持与使用注意事项

模型支持文生图、VQ 条件生成和图像编辑三种模式,但不同模式对图像尺寸有特定要求:文生图与 VQ 条件生成需高宽能被 16 整除,图像编辑需能被 32 整除。此外,VQ 模式下不应传入输入图像,而编辑模式需传入参考图。用户在使用时需根据模式调整参数,以确保生成效果。

Q&A

蚂蚁集团开源的LLaDA-Image模型有哪些版本?

LLaDA-Image模型系列包含两个版本:LLaDA-Image(Base模型,50步采样)和LLaDA-Image-Turbo(蒸馏模型,4步采样)。

LLaDA-Image-Turbo如何实现快速生成?

LLaDA-Image-Turbo采用Twin-DMD蒸馏技术,仅需2-4步采样即可快速完成生成与编辑。

LLaDA-Image模型支持哪些图像生成和编辑功能?

LLaDA-Image支持文生图、VQ条件生成、参考图编辑以及中英文文字渲染。

LLaDA-Image在Qwen-Image-Bench上的表现如何?

LLaDA-Image在Qwen-Image-Bench上综合得分登顶,英文得分53.53,中文得分53.38。

LLaDA-Image模型有哪些技术特点?

LLaDA-Image采用统一扩散架构,Backbone与DiT均为扩散模型;通过纯图像预训练建立视觉先验,再引入成对语言监督与生成-编辑联合训练;单个权重即可同时支持文生图和指令引导编辑。

如何使用LLaDA-Image进行图像编辑?

使用LLaDA-Image进行图像编辑时,需要传入参考图,并设置generation_mode为'editing',同时提供编辑指令作为prompt。

LLaDA-Image的Base和Turbo版本在采样步数和推荐配置上有何区别?

Base版本推荐50步采样,guidance_scale设为5.0;Turbo版本推荐4步采样,guidance_scale设为1.0。

🏷️

标签

➡️

继续阅读