➡️
继续阅读
-
LoHoSearch 开源后,搜索智能体评测该往真实任务靠一靠了
美团开源 LoHoSearch,把搜索智能体评测从刷高分拉回到复杂任务和证据链上。对工程团队来说,重点不是模型会不会搜索,而是它在真实查询、外部依赖、成本...
-
不是模型变慢了,是任务变大了 - 肘子的 Swift 周报 #146
最近,即便是一些我认为并不算复杂的工作,AI 交付结果也常常需要几分钟,甚至几十分钟。这让我产生了一种错觉:难道随着模型能力不断增强,速度只能越来越慢?
-
简单的信息不对齐就能让一个团队崩溃
一直以来,我都在从事项目上的工作,项目制有很多好处,特别是现在行业内卷,效益面临巨大考验的前提下,项目是企业生存下去的根本所在,其他任何职能都能被舍弃,但...
-
基于大模型推理与MCP工具调用,斯坦福大学AI X射线科学家在同步辐射光源自主完成单晶衍射对准
AI X 射线科学家」的意义,并不在于取代实验人员,而是让 AI 从数据分析工具进一步走进实验现场,参与设备操作、状态判断和策略调整。尽管目前仍受限于样品...
-
什么是对齐?团队对齐率仅60%,三种权力模型让决策效率翻倍
会议室里,十个人点头说“明白”;散会后,八个方向分头干;这不叫协作,这是集体迷路。 企业最贵的成本不是工资,是信息不对称。高层定下策略,中层转达任务,基层...
-
全球首个Agentic扩散模型来了:边行动边纠错,128K上下文追平自回归
扩散模型首次打通长程Agent任务