【Transformer 与注意力机制】46|多模态融合:CLIP、Flamingo、LLaVA、SAM

💡 原文中文,约12600字,阅读约需30分钟。
📝

内容提要

本文解析多模态模型核心技术:CLIP对比学习依赖大batch与温度参数;视觉接入语言模型有projector、cross-attention、指令微调三种方式,各有分辨率瓶颈、压缩损失和幻觉问题;SAM专注像素级分割,与聊天VLM是不同产品线;融合时机决定部署成本,统一token接口仍存争议。

🔎

延伸解读

CLIP 的对比学习:大 batch 与温度的双刃剑

CLIP 的 InfoNCE 损失依赖大 batch 提供足够负样本,以学习细粒度区分,但 batch 内可能混入语义上匹配的“假负样本”,造成系统性噪声。温度参数控制 softmax 锐度,影响梯度聚焦。SigLIP 改用 sigmoid 损失,降低对 batch 大小的依赖,是对 CLIP 大 batch 依赖的直接工程反驳。

三种视觉-语言连接方式的失败模式

projector 方式受限于输入分辨率,OCR 弱且 token 数随分辨率线性增长;cross-attention(如 Flamingo)通过固定数量 token 压缩视觉信息,但造成 grounding 和计数能力弱;指令微调(如 LLaVA)因训练数据由纯文本 GPT-4 生成,模型易产生语言先验主导的幻觉。实际系统常组合多种方式,失败模式叠加。

SAM 与聊天 VLM:为何是两条产品线

SAM 专注于像素级分割,训练信号无语义标签,输出结构化掩码,面向交互式标注,延迟要求近实时;聊天 VLM 学习图文对应与对话,边界精度停留在 patch 级。两者监督信号、接口和部署 SLA 均不同,常组合使用(如 Grounded SAM),而非互相替代。

融合时机决定部署成本与能力边界

late fusion(如 CLIP)可预计算图像向量,成本低,但缺乏 token 级跨模态交互;hybrid fusion(如 Flamingo)需每次重新前向,但训练成本居中;early fusion(统一 token)需从头联合预训练,成本最高。统一 token 接口仍存争议:量化会丢失像素细节,而 Fuyu-8B 等反对量化,主张保留连续 patch 特征。

Q&A

CLIP 的对比学习为什么依赖大 batch size 和温度参数?

CLIP 使用 InfoNCE 对比损失,batch 内的其他图文对作为负样本,batch size 越大,负样本越多,模型能学到更细粒度的区分(如区分金毛和拉布拉多)。温度 τ 控制 softmax 的锐度,τ 越小,梯度集中在最易混淆的负样本上,迫使模型推远它们;τ 越大,训练更稳但区分度弱。CLIP 将 1/τ 设为可学习参数并限制上限,以平衡训练稳定性和区分能力。

视觉信息接入语言模型的三种方式(projector、cross-attention、指令微调)各自的失败模式是什么?

projector(如 LLaVA 第一代)存在分辨率瓶颈,低分辨率输入导致 OCR 弱,且 token 数量随分辨率线性增长,增加成本。cross-attention(如 Flamingo)使用 Perceiver Resampler 压缩为固定 64 个 token,造成信息瓶颈,导致 grounding 和精确计数能力弱。指令微调(如 LLaVA 第二阶段)因训练数据由纯文本 GPT-4 生成,模型倾向用语言先验补全细节,产生幻觉,且对分布外指令格式遵循度差。

为什么 SAM 和聊天式 VLM 是两条不同的产品线?

SAM 和聊天式 VLM 在监督信号、接口和部署 SLA 上根本不同:SAM 学习像素级边界,训练信号无语言,输出结构化掩码,面向交互式标注,要求近实时响应;VLM 学习图文对应和对话,边界精度停留在 patch 级别,输出自然语言,延迟为百毫秒到秒级。两者是组合而非替代关系,如用检测器驱动 SAM 分割。

early、late、hybrid fusion 在训练和部署成本上有何差异?

late fusion(如 CLIP)成本最低,两个 encoder 独立训练,图像向量可离线预计算缓存,但无法进行 token 级跨模态交互。hybrid fusion(如 Flamingo)成本居中,语言模型冻结,只训练新增层,但不能预计算缓存,每次需重新前向。early fusion(统一 token 接口)成本最高,需从头联合预训练,几乎不能复用单模态权重,但推理时单次前向,架构简单。

统一 token 接口(如 Chameleon)存在哪些争议?

支持方认为统一接口可沿用语言模型的 scaling law 和训练基础设施,架构简洁。反对方(如 Fuyu-8B)指出图像离散化(VQ)是有损压缩,会丢失 OCR、文档理解所需的像素细节。目前 Chameleon 是预印本,Fuyu 是工程博客,均未经同行评审,尚无定论。

多模态模型的幻觉问题主要来源是什么?

幻觉与训练数据的共现统计强相关,如 POPE 发现模型倾向于“看到”与图中物体常共现的物体(如厨房场景中的叉子)。此外,LLaVA 类模型的指令数据由纯文本 GPT-4 生成,它未看过真实图片,仅凭文字摘要生成内容,导致模型继承“合理但未必在图里”的补全倾向。

为什么 CLIP 的零样本分类效果对模板措辞敏感?

CLIP 将类别名套入模板(如“a photo of a {label}”)生成文本,与图像向量比较相似度。训练数据是网页 alt text 和 caption 风格的短句,若目标任务的文本形式(如纯类别词)偏离此分布,模型性能下降,因此需要 prompt engineering 将查询文本拉回训练分布附近。

🏷️

标签

➡️

继续阅读