HumanEval-V: Evaluating the Visual Understanding and Reasoning Abilities of Large Multimodal Models Through Coding Tasks
原文英文,约100词,阅读约需1分钟。
📝
内容提要
本研究提出了HumanEval-V基准,通过108个Python编码任务评估大型多模态模型的视觉理解与推理能力。结果显示现有模型在这些任务中面临显著挑战,指出未来研究的关键方向。
🏷️