OpenEvidence 日均进行 100 万次临床咨询,覆盖超过 1 万家医院,40% 的美国医生在使用。医疗 AI 市场快速增长,预计中国市场将从 88 亿增长至 3157 亿人民币。小模型在医疗领域可能更具优势,强调场景理解和流程设计的重要性。
OpenEvidence 日均进行 100 万次临床咨询,覆盖超过 1 万家医院,40% 的美国医生在使用。医疗 AI 市场快速增长,预计中国市场将从 88 亿人民币增至 3157 亿人民币。小模型在医疗领域可能更具优势,强调场景理解和流程设计的重要性。
中之杰智能推出OAG本体模型,旨在通过构建“工业常识”体系,数字化生产要素,明确其属性和关联逻辑,从而提升智能体的场景理解力,实现从被动问答到主动治理的转变。
本研究探讨了视觉语言模型在理解虚拟物体方面的不足,测试了AI系统的场景理解能力,发现其在处理虚拟对象时表现不佳,揭示了多模态输入处理的局限性。
本文探讨了图神经网络(GNN)与定性可解释图(QXG)在自动驾驶场景理解中的结合,提出了一种新颖的GNN架构,能够有效识别交通场景中的相关对象,实验结果表明其在对象识别任务中表现优异。
本研究提出了PRIMEDrive-CoT框架,旨在解决自驾模型在不确定性场景中的不足。该框架结合激光雷达与多视角RGB信息,通过贝叶斯图神经网络实现目标交互的概率推理,提升了场景理解的可解释性与可靠性。研究结果表明,PRIMEDrive-CoT在DriveCoT数据集上优于现有模型,展示了在复杂环境中处理不确定性的潜力。
本研究提出了一种名为Ross3D的重构视觉指令调优方法,旨在解决大规模三维视觉-语言数据集的缺乏问题。该方法通过三维视觉监督,提升了三维场景理解的性能,并展示了未标记三维数据的潜力。
本研究提出CoT-Drive,通过大型语言模型和链式思维提示,提升自动驾驶中的运动预测准确性。采用知识蒸馏策略,将场景理解能力转移至轻量级模型,实现实时操作,显著增强复杂交通环境中的预测准确性和鲁棒性。
香港大学与Adobe联合提出的UniReal图像编辑与生成方法,将多种图像任务整合到视频生成框架中,通过学习真实视频数据实现高保真效果。UniReal支持图像定制生成、指令编辑和物体插入,展现出强大的生成能力和场景理解能力。未来将探索更高效的结构以提升处理速度和效率。
LeCun团队的导航世界模型NWM能够在已知和未知环境中生成视频,具备出色的导航能力。尽管在单图生成视频方面略逊于DeepMind的Genie-2,但在场景理解和路径规划上表现优异。NWM通过条件扩散Transformer实现高效导航,展现了先进的视觉导航性能。
本文总结了低成本稳定的2.5/3D视觉感知器件在室内环境视觉场景理解中的应用,探讨了数据表示、核心技术和性能评价。研究提出了基于场景图的三维语义理解、语义视图综合和视觉转换器等多种方法,以提高场景理解的准确性和多样性,并分析了不同视觉编码模型的优缺点,强调了未来选择编码器的灵活性。
本文介绍了一系列基于深度学习的视觉推理和场景理解方法,包括强化学习、类比推理和对象中心生成模型。尽管现有模型在特定任务上表现良好,但在抽象视觉推理和复杂场景中仍面临挑战。新提出的可解释性方法FovEx在模型重要区域定位上表现优越,具有实际应用潜力。
本文介绍了多种基于图结构和神经网络的机器人场景理解方法,如图卷积网络、神经隐式场和空间本体构建。这些方法在室内外环境中有效提升了语义推断、目标导航和房间布局估计的精度,并展示了在稀疏数据下生成高质量3D场景图的潜力。
本文探讨了自动驾驶中3D场景演变的重要性,提出了多种模型(如OccWorld、DriveVLM、3D-VLA)以提升场景理解和决策能力。这些模型在复杂驾驶条件下表现优异,强调了改进基础模型以适应真实动态环境的必要性。此外,CoVLA数据集为多模态大语言模型提供了支持,推动了自动驾驶技术的发展。
该研究综述了视觉语言模型(VLM)在自动驾驶和智能交通系统中的应用,评估了其在场景理解和因果推理方面的表现,并指出了方向辨别和交通信号识别等挑战。研究提出了DriveVLM和DriveDreamer-2等新系统,展示了生成视频和数据集在提升自动驾驶性能中的潜力,并强调了改进模型以适应真实动态环境的必要性。
本文探讨了基于加性关注机制和大型语言模型的场景理解方法,旨在解决场景图生成中的对象关系长尾分布问题。实验结果表明,这些方法在视觉输入、物体重新摆布和人机交互等任务中表现优越,提升了机器人在复杂环境中的操作能力和灵活性。
该论文研究了自动驾驶中的高精度3D物体检测,提出了MV3D框架,结合LIDAR和RGB图像,显著提升了3D定位和检测性能。还介绍了多个大规模数据集和新方法,以解决恶劣天气下的感知问题,并提高开放词汇3D场景理解的准确性。
本文介绍了多种3D大型语言模型(3D-LLMs),如Chat-3D、LL3DA和Scene-LLM,强调它们在3D场景理解、问答和交互规划中的应用与优势。这些模型结合了3D点云和语言处理能力,显著提升了对复杂3D环境的理解和互动能力,推动了3D视觉理解领域的发展。
本文介绍了新数据集“InScope”,旨在解决自动驾驶中的遮挡问题,提升3D多物体检测和跟踪性能。研究分析了现有感知数据集,提出了多机器人协同感知数据集,涵盖多种环境和传感器,推动相关研究。还介绍了多个合成和真实世界数据集,以支持自动驾驶系统的场景理解和性能评估。
本文提出了一个全面的多机器人协同感知数据集,旨在推动该领域的研究。该数据集结合空中与地面机器人的协同,提供多样化的传感器视角和高级感知注释,以促进多机器人协同感知算法的发展。通过多个任务验证了数据集的价值,期望提升多模态协同感知的场景理解能力。
完成下面两步后,将自动完成登录并继续当前操作。