内容提要
中科院团队提出GMC核心集剪枝方法,解决视觉语言模型Token冗余问题。该方法免训练,通过互补证据筛选和群体信息传输,保留关键视觉信息,减少80%以上Token,性能保持99%以上,并抑制幻觉,兼容Qwen、LLaVA等模型,提升推理速度,降低显存占用。
延伸解读
传统Top-K筛选的局限
传统Top-K方法仅按独立得分保留高分Token,但高分Token常集中在显著区域,导致同质化冗余,遗漏分散的关键信息如文字、数字、空间关系。同时,低分Token被直接删除,细节永久丢失,引发推理失真和视觉幻觉。GMC正是针对这些缺陷设计,通过互补证据筛选和群体信息传输,避免信息丢失。
免训练与真实压缩的优势
GMC无需微调或外部模型,可直接应用于Qwen、LLaVA等主流模型,降低了部署门槛。与掩码方法不同,GMC实现真实序列压缩,实际减少解码计算和KV Cache占用。在长文档场景中,减少73.94%的KV Cache并实现1.258倍加速,同时保持98.87%的问答质量,展示了实际部署中的效率优势。
性能保持与去噪增益
实验显示,在Qwen2.5-VL-7B上减少80.2%Token时保持97.78%性能,减少90.1%时仍达99.11%;在LLaVA-1.5-7B上减少至64个Token时性能达99.82%。GMC甚至能轻微提升性能,因为移除无关Token起到去噪作用,增强多模态理解能力。
抑制幻觉与事实一致性
GMC在POPE、HallusionBench等幻觉基准上表现突出,通过保留完整视觉证据减少错误描述和信息遗漏。这得益于群体互补信息传输机制,将未选中Token的细节聚合到代表Token,确保事实判断所需信息不丢失,从而提升模型的可信度。
Q&A
紫东太初团队提出的GMC方法主要解决什么问题?
GMC方法主要解决视觉语言模型中视觉Token冗余的问题,即大量Token导致显存开销大、推理速度慢、部署成本高等问题。
GMC核心集剪枝方法与传统Top-K Token筛选相比有什么优势?
传统Top-K方法只保留得分最高的Token,容易遗漏分散但关键的互补证据,且低分Token直接删除导致信息丢失。GMC通过互补证据筛选和群体信息传输,保留关键视觉信息,减少80%以上Token,性能保持99%以上,并抑制幻觉。
GMC方法的两大核心阶段是什么?
GMC方法分为互补证据自适应筛选和群体互补信息传输两大阶段。第一阶段从问题语义、视觉外观和空间位置三个角度构建证据,选择关键Token;第二阶段将所有待删除Token的隐藏状态传输到最合适的代表Token中,聚合信息。
GMC方法在减少Token数量后,模型性能表现如何?
在Qwen2.5-VL-7B上,减少80.2% Token时保留97.78%的平均能力,减少90.1%时保留99.11%;在LLaVA-1.5-7B上,保留128和64个Token时,平均性能达到完整模型的99.76%和99.82%。
GMC方法是否支持免训练和跨模型迁移?
是的,GMC全程免训练,无需微调、任务标签、外部OCR或检测器,可直接应用于Qwen、LLaVA等主流视觉语言大模型,并已验证可迁移至不同架构的7B级模型。
GMC方法在抑制视觉幻觉方面有什么效果?
在POPE、HallusionBench等幻觉评测集上,GMC表现突出,能够更完整地保留事实判断所需的视觉证据,减少错误描述和信息遗漏,从而抑制视觉幻觉。
GMC方法在实际部署中能带来哪些效率提升?
在长文档问答场景中,面对15876个原始视觉Token,GMC在保持98.87%问答质量的同时,实现了1.258倍端到端推理加速,并减少73.94%的提示KV Cache占用。