小红花·文摘
  • 首页
  • 广场
  • 排行榜🏆
  • 直播
  • FAQ
Dify.AI

本文研究了大型视觉语言模型(LVLM)中的对象幻觉问题,提出了一种新方法——真实引导预干预(TruthPrInt)。研究发现,LVLM的内部状态可以指示幻觉行为,不同模型在潜在子空间中表现出相似的幻觉模式。实验结果表明,TruthPrInt在多个基准测试中显著优于现有方法。

TruthPrInt:通过潜在真实引导预干预缓解大型视觉语言模型的对象幻觉

BriefGPT - AI 论文速递
BriefGPT - AI 论文速递 · 2025-03-13T00:00:00Z

FlexAttention是一种增强大型视觉语言模型的方法,能够处理高分辨率图像并提高性能和效率。它通过动态选择重要区域和分层自注意机制来实现,并在多个基准测试中表现更好,减少了40%的计算成本。

FlexAttention:解决二次复杂度问题,将大型视觉语言模型的输入提升至1008 | ECCV 2024 - 晓飞的算法工程笔记

晓飞的算法工程笔记
晓飞的算法工程笔记 · 2024-08-28T01:48:00Z

本文探讨了大型视觉语言模型(LVLMs)中的幻觉问题,并提出了Instruction Contrastive Decoding(ICD)和Visual Contrastive Decoding(VCD)等优化策略,以减少幻觉现象。研究表明,这些方法有效提升了模型的生成准确性和内容可信度,且无需额外训练数据。实验验证了这些策略在不同模型中的广泛适用性和有效性。

自省解码:减轻大型视觉语言模型的幻觉

BriefGPT - AI 论文速递
BriefGPT - AI 论文速递 · 2024-08-04T00:00:00Z

本研究探讨了大型视觉语言模型(LVLMs)中的幻觉问题,提出了新的评估基准和数据集,以提高模型的准确性和可靠性。研究发现医学领域的LVLMs更易产生幻觉,并强调了模型在实际应用中的稳健性需求。同时,开发了细粒度评估指标FAITHSCORE,揭示了当前模型在生成内容时的不足,为未来改进提供了方向。

BEAF:评估视觉语言模型中的幻觉的前后变化

BriefGPT - AI 论文速递
BriefGPT - AI 论文速递 · 2024-07-18T00:00:00Z

本文介绍了Med-HallMark基准,旨在提高医学多模态领域中大型视觉语言模型(LVLMs)的幻觉检测与评估。提出了MediHall Score和MediHallDetector,并分析了LVLMs中的幻觉问题,提供了缓解建议,建立了新的评估框架和数据集,以增强医疗领域语言模型的安全性和可靠性。

MedVH:面向医学环境中大型视觉语言模型的幻觉系统评估

BriefGPT - AI 论文速递
BriefGPT - AI 论文速递 · 2024-07-03T00:00:00Z

本文综述了大型视觉语言模型(LVLMs)中的幻觉问题,分析了幻觉的概念、症状及根本原因,评估了现有的检测和缓解方法,并提出了新的评估框架和分类法,以提高模型的可靠性,探讨未来研究方向以应对虚假生成的挑战。

多模态大型语言模型的幻觉:一项调查

BriefGPT - AI 论文速递
BriefGPT - AI 论文速递 · 2024-04-29T00:00:00Z

通过综合调查分析了大型视觉语言模型(LVLMs)中的幻觉问题,包括概念、症状多样性、挑战和评估方法。研究了幻觉的原因,包括训练数据和模型组件。回顾了现有的缓解方法,并讨论了未解问题和未来研究方向。

本能偏见:虚假图像导致多语言语言模型的幻觉

BriefGPT - AI 论文速递
BriefGPT - AI 论文速递 · 2024-02-06T00:00:00Z

通过综合调查,研究了大型视觉语言模型(LVLMs)中的幻觉问题,包括幻觉的概念、症状、挑战、评估方法等。分析了幻觉的根本原因,讨论了现有方法和未解问题,并提出未来研究方向。

大型视觉语言模型中的幻觉调查

BriefGPT - AI 论文速递
BriefGPT - AI 论文速递 · 2024-02-01T00:00:00Z

本文介绍了MoE-tuning训练策略,解决了大型视觉语言模型的多模态学习和模型稀疏性带来的性能退化问题。实验证明,MoE-LLaVA在视觉理解方面表现出色,并在对象幻象基准测试中超越了LLaVA-1.5-13B,与LLaVA-1.5-7B相媲美。

MoE-LLaVA:大规模视觉语言模型的专家混合

BriefGPT - AI 论文速递
BriefGPT - AI 论文速递 · 2024-01-29T00:00:00Z

本文介绍了一种针对大型视觉语言模型的训练策略MoE-tuning,通过构建一个具有巨大数量参数但恒定计算成本的稀疏模型,有效解决多模态学习和模型稀疏性带来的性能退化问题。实验证明,MoE-LLaVA在视觉理解方面具有出色的能力,并且在模型输出的对象幻象基准测试中超越了LLaVA-1.5-13B,在各种视觉理解数据集上表现可与LLaVA-1.5-7B相媲美。通过MoE-LLaVA,我们旨在为稀疏LVLMs建立基准,并为未来开发更高效和有效的多模态学习系统提供有价值的见解。

LLaVA-MoLE:稀疏的 LoRA 专家混合模型用于缓解指令微调 MLLMs 中的数据冲突

BriefGPT - AI 论文速递
BriefGPT - AI 论文速递 · 2024-01-29T00:00:00Z

大型视觉语言模型(LVLMs)在自然语言处理中取得成功,通过多样化的上下文配置来提高上下文学习性能,并改进对LVLM的理解。实验证明了LVLM在视觉问答(VQA)中的性能改善。

如何建立适合上下文内的序列用于视觉问答

BriefGPT - AI 论文速递
BriefGPT - AI 论文速递 · 2023-12-04T00:00:00Z

通过改进训练方法和引入新的评估基准,大型视觉语言模型生成更精确的回答并减少幻觉。在新的评估基准下,该方法实现了8.4%的改进,并在其他模型上也取得了性能提升。

OPERA: 通过过高信任惩罚和回顾分配减轻多模态大语言模型中的虚构问题

BriefGPT - AI 论文速递
BriefGPT - AI 论文速递 · 2023-11-29T00:00:00Z

本文提出了一种利用大型视觉语言模型增强盲人和视力低下人士视觉感知的方法,通过整合图像识别结果和用户查询生成环境的详细描述,并识别潜在风险。实验结果表明该方法能够准确识别对象并为盲人和视力低下人士提供深入的环境描述和分析。

VisPercep:一种增强视觉感知能力的视觉语言方法(面向盲人和视力障碍人群)

BriefGPT - AI 论文速递
BriefGPT - AI 论文速递 · 2023-10-31T00:00:00Z
  • <<
  • <
  • 1 (current)
  • >
  • >>
👤 个人中心
在公众号发送验证码完成验证
登录验证
在本设备完成一次验证即可继续使用

完成下面两步后,将自动完成登录并继续当前操作。

1 关注公众号
小红花技术领袖公众号二维码
小红花技术领袖
如果当前 App 无法识别二维码,请在微信搜索并关注该公众号
2 发送验证码
在公众号对话中发送下面 4 位验证码
友情链接: MOGE.AI 九胧科技 模力方舟 Gitee AI 菜鸟教程 Remio.AI DeekSeek连连 53AI 神龙海外代理IP IPIPGO全球代理IP 东波哥的博客 匡优考试在线考试系统 开源服务指南 蓝莺IM Solo 独立开发者社区 AI酷站导航 极客Fun 我爱水煮鱼 周报生成器 He3.app 简单简历 白鲸出海 T沙龙 职友集 TechParty 蟒周刊 Best AI Music Generator

小红花技术领袖俱乐部
小红花·文摘:汇聚分发优质内容
小红花技术领袖俱乐部
Copyright © 2021-
粤ICP备2022094092号-1
公众号 小红花技术领袖俱乐部公众号二维码
视频号 小红花技术领袖俱乐部视频号二维码