内容提要
Apodex 1.1是陈天桥投资的AI系统,专攻复杂科研任务,通过异步代理团队(最多150个子代理)和三层验证机制,处理原始数据、代码执行等全流程。它开源了36B模型和FrontierAgent框架,在基准测试中领先竞品。TRACES基准评估发现式AI的过程而非仅答案,但验证器递归问题仍待解。
延伸解读
从“生成报告”到“执行科研”:AI角色的转变
文章指出,传统AI深度研究工具以生成报告为终点,而Apodex 1.1则强调在原始数据环境中执行完整科研流程,包括数据清洗、代码运行和结果验证。这种转变意味着AI从“信息整理者”变为“科研执行者”,更贴近真实科研中处理异构数据和迭代调整的需求。读者需注意,这种能力依赖于模型对文件操作和工具调用的深度集成,而非简单的文本生成。
异步代理团队:效率与验证的平衡
Apodex 1.1通过最多150个子代理的异步团队处理复杂任务,但文章提到重型模式的实际步数反而少于基础模式,原因是验证器过滤了低效步骤。这揭示了AI效率提升的关键在于“知道什么不用做”,而非单纯增加计算量。然而,验证器判断“信息增益”的标准可能出错,若误删关键步骤,可能影响最终结果,这是读者需要警惕的潜在风险。
开源策略与本地部署的实用价值
Apodex 1.1开源了36B参数的mini模型和FrontierAgent框架,支持本地运行和多种量化版本。FrontierAgent提供ReAct和Agent Team两种工作流,并设计了沙盒文件系统、检查点和恢复功能,便于长时任务的容错。这一策略降低了高级AI工具的使用门槛,使研究团队能在本地部署并定制流程,但需注意开源版本可能性能弱于旗舰版,且本地部署需一定的技术能力。
验证机制的局限:递归问题未解
Apodex 1.1的三层验证机制和全局验证器旨在独立评估结果,但文章指出验证器本身也是模型,其判断可能出错,且“谁来验证验证器”的递归问题尚未解决。TRACES基准试图通过过程评估缓解此问题,但评估者仍是模型,无法完全摆脱主观性。这提醒读者,即使AI声称可验证,其结论仍需人类专家复核,尤其在科研等高风险领域。
Q&A
Apodex 1.1是什么?它由谁投资?
Apodex 1.1是陈天桥投资的AI公司Apodex(前身为MiroMind)于2026年8月24日发布的AI系统,专攻复杂科研任务,通过异步代理团队和三层验证机制处理原始数据、代码执行等全流程。陈天桥通过盛大集团承诺投入20亿美元于“发现式智能”方向,对MiroMind的直接投资已超1亿美元。
Apodex 1.1的核心机制是什么?它如何解决复杂科研任务?
Apodex 1.1的核心机制是异步代理团队,主Agent将任务拆解为子问题,异步派发给最多150个专门化的子Agent,每个子Agent有独立上下文和工具集,通过共享报告池协作。系统还内置三层自我验证机制(冲突审查员、事实检查员、草稿审查员)和全局验证器,确保结论可验证。
Apodex 1.1在基准测试中的表现如何?
Apodex 1.1在FrontierScience-Research上Agent Team模式得分63.3,超过DeepSeek V4 Flash的55.0;在FrontierFinance上得分54.3,超过Claude Fabio 5的49.2。Agent Team模式比ReAct模式平均高7-8个百分点,比Apodex 1.0翻倍。
Apodex 1.1开源了哪些内容?
Apodex 1.1开源了36B参数的mini模型(提供FP8、NVFP4、GPTQ-Int4等量化版本)和FrontierAgent研究框架,后者支持本地部署,提供ReAct和Agent Team两种工作流。
TRACES基准测试是什么?它如何评估AI?
TRACES是Apodex于2026年8月18日推出的基准测试,用于评估“发现式AI”的过程而非仅答案。它将AI放入可执行环境,评估六个维度:工具选择、错误修正、假设考量、逻辑一致性、结论扎根性、适用范围界定。TRACES已汇编423个高价值问题,来自16个行业的561个产业领域。
Apodex 1.1的验证机制存在什么潜在问题?
Apodex 1.1的验证机制存在递归问题:全局验证器可以推翻前面的结论,但谁来验证全局验证器?如果验证器错误过滤关键步骤,可能导致错误。TRACES试图通过过程验证解决,但评估者本身也是模型,循环尚未打破。