在复刻黏土风图生成中学习(1) — 模型微调/LoRA 原理/图生图

在复刻黏土风图生成中学习(1) — 模型微调/LoRA 原理/图生图

💡 原文中文,约5700字,阅读约需14分钟。
📝

内容提要

本文介绍了使用Stable Diffusion生成黏土风格图片的流程和原理,包括ComfyUI和模型的组合使用,以及模型微调的几种方式。文章详细解释了LoRA的原理,并提到了使用WD14 Tagger插件节点生成图片标签的方法。

🔎

延伸解读

模型文件格式的安全考量

文章指出,早期模型文件使用 .ckpt 格式,因其反序列化过程可能被注入恶意代码,存在安全风险。而 .safetensors 格式仅包含张量数据,无需反序列化,因此更安全且加载速度更快。目前模型基本都采用这种格式存储,读者在下载模型时应注意文件后缀,优先选择 .safetensors 以规避潜在风险。

微调方式的选择依据

文章对比了三种微调方式:Full Finetune 需要大量数据和计算资源,适合全面调优;Dreambooth 适合小数据量训练特定人物或物品,且不污染原模型;LoRA 训练门槛低,适合个人 PC,能用少量图片训练特定风格。对于黏土风格这种风格化需求,LoRA 是更合适的选择,因其成本低、效果不错且模型文件小、可插拔。

LoRA 低秩分解的效益

LoRA 通过低秩分解将参数更新矩阵分解为两个小矩阵,显著减少存储和计算量。例如,100×100 的矩阵分解为 100×5 和 5×100 后,数据量从 10000 降至 1000,降低一个数量级。这使得 LoRA 模型体积远小于原模型,训练时显存和计算需求也大幅下降,从而能在普通 PC 上运行。

图生图中降噪强度的作用

在图生图流程中,降噪强度(denoise)控制添加噪声的比例。denoise 为 0 时输出原图;为 0.4 至 0.6 时,能保留原图主要结构并添加风格;为 1.0 时则完全变为随机噪声,仅受提示词影响。因此,调整 denoise 值可以平衡原图保留与风格化效果,实际应用中需根据需求选择合适的值。

❓

Q&A

如何使用Stable Diffusion生成黏土风格的图片?

使用Stable Diffusion生成黏土风格图片的流程包括选择模型、输入提示词,并通过ComfyUI工具进行操作。

LoRA模型的微调原理是什么?

LoRA模型通过低秩适应技术,冻结原网络参数,仅调整独立的低秩矩阵,从而实现低成本、高效的微调。

什么是模型checkpoint,它的作用是什么?

模型checkpoint是在微调训练过程中保存的模型参数状态,包含生成图所需的核心组件,便于后续使用。

使用WD14 Tagger插件的目的是什么?

WD14 Tagger插件用于从图片中生成适用于SD的提示词标签,简化生成过程,无需手动输入提示词。

Full Finetune和Dreambooth的区别是什么?

Full Finetune需要大量数据和计算资源,适合全面调优,而Dreambooth适合小数据量训练,能还原特定人物或物品。

在生成黏土风格图片时,提示词应该如何设置?

提示词需要贴近训练时的文本描述,以提高生成效果,尤其是与黏土风格相关的提示词。

🏷️

标签

➡️

继续阅读