内容提要
蚂蚁集团开源统一图像生成与编辑模型LLaDA-Image,含6B参数,提供Base和Turbo两版本,支持文生图、编辑及中英文渲染。Turbo采用蒸馏技术,仅需4步采样。模型在Qwen-Image-Bench上得分领先,并公开权重与推理代码。
延伸解读
统一架构与训练策略
LLaDA-Image 采用统一的扩散架构,Backbone 与 DiT 均为扩散模型,单个权重即可同时支持文生图与指令引导编辑,无需单独的编辑骨干网络。其训练策略先通过纯图像预训练建立视觉先验,再引入成对语言监督与生成-编辑联合训练,这有助于模型在统一框架中学习生成与编辑能力。
Turbo 版本的高效推理
LLaDA-Image-Turbo 通过 Twin-DMD 蒸馏技术,将采样步数从 50 步降至 4 步,显著提升推理速度。在快速生成与编辑场景中,Turbo 版本提供了更高效的解决方案,但需注意其推荐配置(如 guidance_scale=1.0)与 Base 版本不同,用户应根据需求选择合适的版本。
多模式支持与使用注意事项
模型支持文生图、VQ 条件生成和图像编辑三种模式,但不同模式对图像尺寸有特定要求:文生图与 VQ 条件生成需高宽能被 16 整除,图像编辑需能被 32 整除。此外,VQ 模式下不应传入输入图像,而编辑模式需传入参考图。用户在使用时需根据模式调整参数,以确保生成效果。
Q&A
蚂蚁集团开源的LLaDA-Image模型有哪些版本?
LLaDA-Image模型系列包含两个版本:LLaDA-Image(Base模型,50步采样)和LLaDA-Image-Turbo(蒸馏模型,4步采样)。
LLaDA-Image-Turbo如何实现快速生成?
LLaDA-Image-Turbo采用Twin-DMD蒸馏技术,仅需2-4步采样即可快速完成生成与编辑。
LLaDA-Image模型支持哪些图像生成和编辑功能?
LLaDA-Image支持文生图、VQ条件生成、参考图编辑以及中英文文字渲染。
LLaDA-Image在Qwen-Image-Bench上的表现如何?
LLaDA-Image在Qwen-Image-Bench上综合得分登顶,英文得分53.53,中文得分53.38。
LLaDA-Image模型有哪些技术特点?
LLaDA-Image采用统一扩散架构,Backbone与DiT均为扩散模型;通过纯图像预训练建立视觉先验,再引入成对语言监督与生成-编辑联合训练;单个权重即可同时支持文生图和指令引导编辑。
如何使用LLaDA-Image进行图像编辑?
使用LLaDA-Image进行图像编辑时,需要传入参考图,并设置generation_mode为'editing',同时提供编辑指令作为prompt。
LLaDA-Image的Base和Turbo版本在采样步数和推荐配置上有何区别?
Base版本推荐50步采样,guidance_scale设为5.0;Turbo版本推荐4步采样,guidance_scale设为1.0。