莱斯大学与英伟达提出RoboTok,一个面向互联网规模人类视频的示范检索数据引擎。它从网络视频中筛选片段、重建三维手部轨迹,学习运动嵌入空间,实现高效相似行为检索,无需任务标签。实验显示其检索质量远超基线,并能提升灵巧操作策略成功率,为机器人学习提供可持续扩展的数据来源。
清华AIR与域变换联合发布Zeva,首个实现上下文因果学习(ICCL)的具身模型。它无需更新权重,通过因果交互提取、双时标记忆和上下文策略注入,让冻结模型在部署中自进化。在基准任务中累计成功率从26%提升至73%,真实化学实验室任务成功率显著增长,并支持一次人类演示学会新操作,开启上下文空间扩展的新范式。
Simular公司的电脑代理Sai在OSWorld 2.0基准测试中取得73%成功率,超越GPT-5.6 Sol和Opus 5,成本仅为它们的三分之二。Sai采用神经符号方法,结合神经网络与符号代码,高效处理真实工作场景任务,如发票验证和疫苗预约。公司强调其设计注重经济实用性,而非追求行业荣誉,旨在为个人和企业提供可负担的自动化解决方案。
论文《HarnessRisk》提出面向Agent外壳安全的全生命周期基准,用128个沙箱案例测试6个阶段。结果显示同一模型在不同外壳下攻击成功率差4.3倍,配置阶段最脆弱,且检测风险不等于安全行动,任务效用不能作为安全证据。
PyCharm推出Agent Environment Coordinator技能,使AI代理能查询项目正确的Python解释器并自动配置环境,避免安装到错误版本或污染系统。测试显示,6个AI模型在28个任务中平均成功率从68%提升至98%,且不修改系统Python,显著提升任务完成率和环境清洁度。
AI降本的核心并非更换更便宜的模型,而是降低系统复杂度。高成功率系统往往更复杂、成本更高,企业常只关注模型账单,忽略组织成本。真正降本需重构工作流,通过缓存、模型分层、上下文压缩、工具筛选和任务边界重定义,从减少token消耗转向降低系统复杂度。
苏度科技在WAIC展示仿真训练机器人,实现99%+抓取成功率,涵盖精密装配、柔性打包及宁德时代电池产线多机协作。公司坚持仿真为主、虚实融合数据路线,自研本体,构建高精度世界模型,目标打造具身智能iOS平台,强调高可靠性与泛化能力,估值达200亿元。
魔法原子在WAIC展示其通用具身大模型Magic-VLA K02,成功完成叠盒封胶、衣物整理等复杂长程任务。该模型采用分层双系统架构,实现任务规划与动作执行协同,具备动态纠错和受扰恢复能力,叠盒封胶成功率超90%,并提升跨机器人适配与部署稳定性。
开源AI正成为生产主力,推理成本三年降50倍,中国模型流量超美国三倍。但部署成功率低,闭源在集成、长上下文、合规上领先。开源生态经济规模达千亿美元,中国是最大权重来源。未来机会在开源harness、记忆层、权限标准等领域,窗口期有限。
本文探讨了自主谈判代理中的行为隐私泄露问题,提出了一种自适应随机谈判策略,确保差分隐私和高谈判效用。通过对3000次双边谈判的评估,该机制将对手推断准确率降低了43-50%,同时保持90%以上的成功率,证明了在不显著损失性能的情况下可以实现强隐私保障。
HIL-ResRL是一种即插即用的VLA工具,经过1小时微调后成功率超过95%。该技术在提升机器学习模型应用效率方面具有重要意义。
在具身智能领域,视觉-语言-动作(VLA)模型面临模仿学习导致的误差累积问题。华为云的HIL-ResRL方法通过人机协同和残差策略,提高了机器人在真实环境中的任务成功率,实验成功率超过95%。该方法无需重训练,适用于多种工业任务,并通过触觉反馈显著提高精度,展示了快速部署的潜力。
文章探讨了将面试视为推理游戏的方法,通过积累样本来提高成功率。作者分享了备战和复盘的流程,以帮助读者更有效地准备面试。
英伟达与卡内基梅隆大学、伯克利大学联合推出ENPIRE框架,旨在让AI自主进行机器人研究。该框架通过自动化实验流程,提高机器人在复杂任务中的成功率,研究表明AI代理能够独立提出研究思路并优化实验,最终在多个任务中实现99%的成功率。ENPIRE的核心是构建一个可迭代的物理实验环境,以提升机器人研究的效率。
一项研究评估了12个多模态大语言模型(MLLM)的规划能力,发现它们在不可解任务识别中的正确拒绝率仅为34.7%。研究提出了智能体规划基准(APB),通过五大评估设置揭示了模型在长程规划、工具鲁棒性和校准拒绝等方面的系统性弱点,强调规划能力的重要性。结果显示,模型在面对不可解任务时往往盲目尝试,可能导致资源浪费和有害输出。
HumanEgo框架通过人类第一视角视频学习机器人策略,成功解决了人类与机器人之间的具身鸿沟。研究者利用佩戴的Aria眼镜采集示范数据,实现了零样本迁移,平均成功率达到92.5%。该方法无需机器人数据,数据高效,支持在新环境中稳健迁移,显著提升了机器人操作效率。
成功的数字化转型需要业务和技术利益相关者在编写代码前达成共识。70%的转型失败源于利益相关者不一致。使用技术路线图优先级(TRP)框架,组织可以快速确定优先事项,创建可执行的架构待办事项。TRP通过成本和影响的矩阵帮助团队明确优先级,确保资源集中于高价值项目,从而提高转型成功率。
Harness是一种新型AI智能体架构,由五大子系统构成,专注于工程实现而非设计抽象。它通过固定结构和上下文管理提升智能体的稳定性和成功率,标志着AI进入工程学科时代。
本文介绍了使用GPT-Image-2模型将设计图转化为网站前端界面的六步流程,包括撰写提示词、生成设计方案、分析设计图、搭建界面、修改细节和加入个人风格。通过这一流程,成功率可提高至80%以上,适合希望创建专业网站的用户。
具身智能领域最近发布了GEN-1,成功率超过99%,速度提升2-3倍,微调成本降低至1/10。CEO Pete Florence强调,未来的世界模型应关注机器人任务的成功率,而非仅追求视觉质量。研究表明,高视觉质量与具身任务能力相关性较低,DexWorldModel通过改进表示、记忆、推理和数据引擎,提升了机器人在真实环境中的表现,展示了具身世界模型的潜力。
完成下面两步后,将自动完成登录并继续当前操作。