阿里通义推出了实时语音识别模型Fun-ASR-Realtime,具备百毫秒首字延迟和高准确率,支持16种方言和30种语言。在“重返荒岛”直播中,该模型提供实时字幕,识别准确率接近离线模型,适用于国际会议和客服等复杂场景。
云知声推出Unisound U1-OCR,标志着OCR 3.0时代的到来。该模型具备高效的文档理解能力,超越传统OCR,实现从“识别文字”到“理解文档”的转变,适应复杂场景,提高文档处理效率。
理想汽车的自动驾驶技术从“端到端+ VLM视觉语言模型”演变为“VLA视觉语言动作模型”,后者具备更强的思考、沟通和学习能力,能更好地处理复杂场景。通过大量数据和仿真测试,理想汽车旨在提升安全性和驾驶舒适度,实现更高效的自动驾驶体验。
PP-OCRv5是百度开源的OCR系统,支持80多种语言,优化了小文本识别,适合移动和服务器端部署。开发者可通过OpenVINO.CSharp.API.Extensions.PaddleOCR NuGet包在Intel CPU平台上快速部署PP-OCRv5模型,提升识别精度,尤其在复杂场景中表现优异。
本文首次提出了一种普遍的注意逻辑,解决了现有动态认知逻辑在复杂注意场景中的局限性。通过引入边缘条件事件模型,扩展了注意力的应用,使智能体能够关注其他智能体的信念,从而改善对人类注意偏见的建模能力。
本研究提出了一种结合自监督训练与多列卷积神经网络的新方法,针对人群场景分析中的人群计数和异常检测,显著提升了复杂场景的处理能力,性能优于现有方法。
本研究针对DCASE 2025挑战的任务五,定义了三个子集,以评估音频语言模型在复杂场景中的问答能力,旨在提升其理解与推理能力。
本研究提出了新的视频数据集R^3-VQA,以解决社交推理任务的复杂性不足问题。研究表明,现有视觉语言模型在复杂社交场景中的推理能力仍低于人类,而心理理论的应用可以提升其社交推理能力。
文章强调AI基准测试的重要性,指出应定义更贴近现实的问题,以提高AI模型的实用性。目前的基准测试多集中于封闭任务,缺乏对复杂现实场景的评估。未来需为不同领域设计专门的基准测试,以促进AI Agent的有效应用。
研究人员开发了一种名为RoboGrasp的机器人手,能够从单视图图像中学习生成有效的抓取动作。在真实实验中,该机器人在新物体上的抓取成功率达到85%,并能应对部分遮挡和杂乱环境等复杂场景。
复旦、交大、浙大和斯坦福的学者推出了视频光照编辑工具RelightVid,能够高质量地进行时序一致的光影编辑,解决动态光照的挑战。该工具结合静态图像和视频,在保持内容不变的情况下实现光照变化,展示了在复杂场景中的应用潜力。
本研究提出了一种新方法LMAffordance3D,通过语言指令、视觉观察和交互来定位3D空间中的可操控物体,成功连接感知与行动。实验结果表明该方法在复杂场景中表现优越。
香港大学的余鑫博士生与齐晓娟教授联合提出了ObjectMover模型,旨在解决图像编辑中的物体移动、插入和删除问题。该模型结合视频扩散模型与虚幻引擎生成合成数据,能够自动调整光影效果,保持物体特征,显著提升图像质量与真实感。实验结果表明,ObjectMover在复杂场景处理上优于现有技术。
本研究提出了一种新方法,通过语言描述控制对象中心表示学习,解决了现有模型可控性不足的问题。该方法能够在复杂场景中提取特定对象的表示,并在视觉语言任务中表现优异。
本研究提出了一种检索增强决策(RAD)框架,旨在提高自动驾驶系统在复杂场景下的高层元动作理解和决策准确性。实验结果表明,RAD在主要评估指标上优于基线方法,显著提升了自动驾驶任务的决策能力。
本文提出了一种基于雷诺传输定理的雷诺流方法,克服了传统光流估计在复杂场景中的局限,尤其是在亮度一致性和慢速运动假设方面。该方法实现了无训练的流动估计,并在多个视频基准测试中展现出优异的鲁棒性和效率。
.NET中有两种流行的JSON库:Newtonsoft.Json和System.Text.Json。Newtonsoft.Json需单独安装,适合复杂场景;System.Text.Json内置于.NET Core 3.0及以上,性能更佳,适合AOT编译。两者各有优缺点。
本文提出了一种新型密集长期追踪模型MFTIQ,显著提升了视频序列中的点级视觉追踪准确性和灵活性,尤其在复杂场景中表现突出。实验结果表明其处理速度快,性能与先进追踪器相当。
该研究提出了一种新型3D聚焦与匹配网络,解决了复杂场景中多实例点云配准的精确性问题,实验结果在公共基准上表现优异。
本研究提出了一种标记合并(ToMe)方法,通过聚合相关标记来改善文本到图像模型的语义绑定,实验结果表明其在复杂场景中表现优异。
完成下面两步后,将自动完成登录并继续当前操作。