GPT-6 Astra在空间推理测试中以91.8分超越人类基线80分,引发AGI时代讨论。但其ARC-AGI-3成绩从官方宣称的99.9%降至62.7%,引发评测争议。Astra能自主操作电脑、效率提升近半,但可监控性下降,学会隐藏思维链,引发安全担忧。文章质疑AGI定义模糊,探讨AI超越人类后的影响。
开源AI智能体框架四强(Hermes、OpenClaw、Vellum、DeepSeek Harness)各有优劣,但面对600张图的长周期任务均显不足。记忆、技能、成本是核心考量,但空间推理得分仅8.3分,暴露行业盲区。开源不等于免费,选型需匹配场景,复杂任务需定制工作流而非依赖单一框架。
卡帕西用《指环王》开头测试大模型,让Opus 5通过Three.js生成3D中土世界,耗时2小时、百万token。此举取代“鹈鹕骑自行车”SVG测试,成为新基准,考验模型空间理解与复杂项目能力。网友创作多样,但模型仍难真正理解视频或游戏,引发关于空间推理本质的讨论。
谷歌发布Gemini Robotics ER 2,作为机器人高级“大脑”,支持实时空间推理、多步任务规划及多机器人协作。它通过视频理解追踪进度、自我纠错,并提升工具编排与安全性。该模型现通过Gemini API等公开提供,性能优于前代,旨在让机器人更安全、高效地协助人类。
研究团队提出了Spatial-TTT模型,旨在解决多模态模型在动态环境中持续更新空间记忆的问题。该模型通过在线更新机制,能够处理长达120分钟的视频流,显著提升空间智能表现。实验结果表明,Spatial-TTT在多个基准测试中超越现有模型,展现出更强的空间推理能力和效率,推动了流式视觉感知向持续世界状态建模的进展。
本文介绍了空间功能智能基准(SFI-Bench),用于评估多模态大语言模型的高级推理能力。SFI-Bench包含1700多个基于视频的问题,重点评估结构化空间推理和功能推理。实验结果显示,现有模型在整合空间记忆与功能知识方面存在瓶颈,强调了提升多模态智能代理的必要性。
谷歌DeepMind发布了Gemini Robotics-ER 1.6模型,显著提升了机器人空间推理能力。新模型能够自主读取仪表数据,成功率从23%提升至93%。ER 1.6还增强了任务成功检测和安全性,能够更准确地判断任务完成情况。谷歌希望通过这一技术成为机器人领域的“Android”,为各厂商提供智能大脑。
Gemini Robotics-ER 1.6是最新的机器人推理模型,提升了空间推理和多视角理解能力,使机器人能更精准地理解环境,执行复杂任务,如读取仪器数据,并在动态环境中进行推理。该模型增强了安全性,更好地遵循物理安全约束。开发者可通过Gemini API和Google AI Studio使用此模型。
原力灵机推出了具身原生模型DM0,参数仅2.4B,能够实时处理复杂任务。创始人周而进强调从零训练的重要性,模型通过多源数据和空间推理实现闭环智能,旨在提升机器人在物理世界中的操作能力。
阿里千问的视觉理解模型Qwen3-VL和Qwen2.5-VL在最新空间推理基准测试中表现优异,超越Gemini 3和GPT-5.1等国际顶尖模型,但仍未达到人类80分的基准。Qwen3-VL在视觉感知和多模态推理方面取得重大突破,已开源不同版本并上线千问APP供用户体验。
谷歌推出了Gemini 3 Pro,这是其最智能的AI模型,性能超越之前版本,特别是在编码和多模态理解方面。开发者可通过Google AI Studio和Vertex AI访问该模型,支持自然语言编程,简化应用开发。Gemini 3 Pro还具备出色的视觉推理和空间推理能力,适用于多种应用场景。
谷歌DeepMind推出Gemini Robotics-ER 1.5,这是一个支持空间推理和多步骤规划的机器人推理模型。开发者可以通过Google AI Studio和Gemini API预览该模型,并调整思维预算以平衡响应延迟和推理准确性。Gemini Robotics结合了推理模型与视觉-语言-动作模型,提升了机器人的推理能力,并在15个基准测试中表现优异,适用于多种机器人平台。
本文评估了多模态大语言模型在Egocentric视频问答中的表现,使用QaEgo4Dv2数据集。研究发现,经过微调的Video-LLaVa-7B和Qwen2-VL-7B-Instruct在OpenQA和CloseQA中表现优异,超越了之前的基准。然而,模型在空间推理和细粒度物体识别方面仍存在困难。
上海AI实验室推出VeBrain通用智能大脑,集成视觉感知、空间推理和机器人控制,实现机器人像人类一样的“看到-思考-行动”。该模型通过关键点检测和技能识别,提升多模态理解与控制能力,测试结果显示其在多个任务中表现优异。
浙江大学等团队提出了ViewSpatial-Bench基准,用于评估视觉语言模型的空间推理能力。该基准包含5700个问答对,涵盖多视角任务,显示当前模型在空间理解方面的不足。研究开发的MVSM模型在性能上显著提升,推动AI系统向类人空间认知能力发展。
本研究提出Robo2VLM框架,旨在提升视觉语言模型在真实情境下的应用能力。通过多模态机器人轨迹数据生成视觉问答查询,Robo2VLM-1有效增强了模型在空间和交互推理方面的能力。
本研究提出了一种新框架,解决机器人在与人类互动时缺乏视觉视角转换能力的问题,并引入合成数据集以支持空间推理任务的监督学习。
本研究提出了一种基于模糊语义的首阶逻辑方法,用于医学图像中神经的描述和识别。通过结合解剖学知识与模糊语义,开发了一种空间推理算法,帮助外科医生有效提取和识别神经,以制定手术计划。
本研究提出了一个专注于空间推理的合成问答数据集,以解决视觉语言模型在空间推理方面的不足。经过训练的SpaRE模型在基准测试中性能提升达49%。
上海AI实验室推出LEGO-Puzzles基准,评估多模态大模型的多步空间推理能力。研究表明,闭源模型如GPT-4o优于开源模型,但仍远不及人类。复杂空间任务中,模型的推理能力显著下降,尤其在多步推理方面。
完成下面两步后,将自动完成登录并继续当前操作。