Anker推出SleepLab睡眠音箱,采用60GHz毫米波雷达监测呼吸与心率,结合双耳节拍和灯光,无需穿戴设备即可追踪并改善睡眠。设备可独立于手机操作,无需订阅,支持蓝牙音频,Pro版售价269.99美元,标准版169.99美元,现可1美元预订,但建议等待评测。
三篇论文提出Agent自进化新方向:从模型权重转向外部执行框架(Harness)。Recuris通过三层记忆架构和结构化证据实现组件级修补,在τ²-Bench上提升显著;StarHarness用分层搜索优化prompt和工具接口;SkillForge验证技能质量。核心模式是“结构化证据+组件级修补+验证门”,但依赖可验证环境,迁移有条件,归因准确率有限。
DeTect公司获得为雅加达苏加诺-哈达国际机场供应MERLIN 7360 True3D鸟类探测雷达的合同。该系统将在跑道两端部署,提供360度3D覆盖,自动显示并预警高风险鸟类活动,以保障航空安全。该技术最初为美国空军和NASA开发,现广泛用于全球多个机场。
Agentic Coding将AI编程从被动补全转向主动规划-执行-验证循环,SWE-bench成绩三年内从不足6%跃升至50%-70%+。核心包括规划器、执行引擎和验证器,实现多文件修改与自我修正。主流框架有Claude Code、Cursor、OpenHands和Aider,各有适用场景。但存在幻觉、回归错误和安全风险,需谨慎使用。
本文探讨AI智能体推理时计算资源分配的新范式:从均匀分配转向根据任务难度动态调整。传统ReAct等模式对简单和复杂任务消耗相同token,效率低下且易致“过早错误成功”。核心方法包括难度评估器、预算分配策略和失败检测机制,实证显示可提升成功率约20-35%,并节省计算资源。
Agentic RAG通过自我反思、自适应路由和多跳推理,将复杂问答的幻觉率降低30%-50%,但延迟增加2-4倍、Token消耗增加1.5-3倍。文章解析了Self-RAG、CRAG等五篇关键论文,提出四阶段迁移路径,并指出其适用边界:仅当存在大量多跳查询时才值得投入,简单场景传统RAG更优。
英飞凌推出新一代60 GHz雷达传感器BGT60CUTR13AIP,基于CMOS平台,从BiCMOS工艺转向CMOS,提升集成度并降低成本。芯片整合射频、模拟、数字处理及电源管理,尺寸仅6.05mm×4.3mm×0.9mm,内置硬件加速器,功耗低于200μW,支持电池或太阳能供电。采用一发三收L型天线布局,可探测水平与垂直角度,应用于电视、空调、安防和机器人,已大规模量产。
微软在 BUILD 2026 发布的 CodeAct 改变了 AI Agent 的工具调用方式,从逐轮推理转向程序化批量执行。它让模型一次性生成完整程序,在 Hyperlight 微 VM 中隔离运行所有工具调用,大幅减少推理回合、延迟和 Token 消耗。相比 ReAct 模式,CodeAct 在确定性流水线任务中表现最佳,但需注意其 alpha 阶段限制,适合与混合策略结合使用。
旭化成微电子将于2026年7月量产AK5816AIM毫米波雷达模块,该模块可非接触式监测人和宠物状态,适用于注重隐私的空间。目前已在适老住宅中应用,并与多家公司合作提供全流程支持。
ScaleCUA是清华大学和Z.AI团队提出的框架,旨在解决Computer Use Agent(CUA)训练数据稀缺问题。通过可验证任务合成、动态学习前沿采样和视觉上下文分割,ScaleCUA显著提升了数据质量和训练效率,使开源CUA在OSWorld上达到了68.7%的新高,超越了参数量大四倍的竞品。这一方法强调了数据质量的重要性,证明了在CUA领域,数据效率优于模型参数规模。
阿里巴巴达摩院推出了WebSwarm,一个渐进式递归多Agent搜索框架,显著提升了复杂搜索任务的效率。WebSwarm通过递归委派和动态协作模式,优化了搜索策略,增强了信息覆盖率和准确性。
EvoSOP框架旨在解决AI智能体工具集静态化问题,通过构建、合并、评估、剪枝四个模块,将重复原子操作合成为可复用SOP,并迭代优化工具集,从而提升任务成功率与效率,同时探讨了其局限性与未来方向。
加州大学伯克利分校和斯坦福大学的研究发现,AI Agent在持续学习中安全对齐逐渐退化,误对齐率高达70.71%。清华大学提出的四轴决策框架为评估提供新维度,强调合规风险和因果归因的重要性,推动安全成为AI Agent设计的核心要素。
南京大学的研究揭示了工具使用智能体在开放世界中的泛化脆弱性,提出了四级分层偏移框架,分析了SFT和RL训练范式的结构性弱点,并提出PAFT方法,通过引入扰动增强微调,提升模型的鲁棒性和泛化能力。
香港科技大学与京东合作的论文《SkillCoach》提出了一种自进化评分框架,用于评估和增强智能体的技能使用能力。该框架自动推导评分标准,并通过验证门控机制提升评分的有效性和可用性。此外,该框架还能够筛选高质量训练数据,填补智能体技能使用过程质量评估的研究空白。
本文探讨了AI智能体编排的最新进展,重点介绍了MCP(模型上下文协议)与PI(计划-执行)架构的结合。MCP提供标准化的上下文管理和工具调用,而PI架构强调全局规划和动态执行。两者结合后,智能体在处理多工具任务时效率显著提升,成功率提高。建议开发者采用MCP SDK并迁移至PI模式,以优化智能体性能。
AI智能体的生成能力迅速提升,但验证能力未能跟上,导致“生成-验证差距”。这一差距使得模型在自我修正时无法识别错误,甚至可能放大错误信念,影响系统的可靠性。为解决此问题,建议引入外部验证机制和多样性验证,并限制自我修正的轮数,以提升模型的输出质量和安全性。
研究表明,基于 LLM 的代码修复 Agent 在纯视觉模式下修复准确率显著下降,而混合文本与视觉模式则提高了准确率并降低了 Token 成本。SeeRepo 提供了一种有效的仓库结构可视化管线,结合文本和视觉信息,优化了编码 Agent 的输入接口设计。
伊利诺伊大学的研究团队首次量化了AI代理在工具链路被阻断时的规划脆弱性。研究发现,当关键工具失效时,模型的准确率显著下降,GPT-5.4的准确率从51.90%降至11.36%。这表明当前AI代理在复杂任务中存在系统性缺陷,强调了改进工具选择和恢复能力的重要性。建议引入失败感知机制和回溯策略,以提升代理在不确定环境中的表现。
HarnessFix 提出了从失败轨迹到自动修复的闭环,解决了传统方法无法修复 Agent 失败的问题。通过将执行轨迹编译为标准中间表示 HTIR,精确归因到具体步骤,生成可执行的修复方案,从而提高了诊断准确率和修复覆盖率,推动了 Agent 可靠性工程的进步。
完成下面两步后,将自动完成登录并继续当前操作。