本研究介绍了OmniMedVQA,这是一个涵盖75个医疗数据集的医学视觉问答基准。研究发现现有大型视觉语言模型在医学问答中的表现不佳,尤其是医学专用模型容易产生幻觉。为评估模型的可靠性,研究提出了医学视觉幻觉测试(MedVH),并强调合理设计医学提示对提升模型性能的重要性。
完成下面两步后,将自动完成登录并继续当前操作。