内容提要
Balyasny资产管理公司管理约380亿美元资产,其首席AI官预测2026年AI将从搜索转向实际工作。公司自建评估体系,用数千真实金融任务测试模型,Claude Fable 5得分89.4%,优于前代86.1%,能完成复杂规划与代理执行。公司构建BAMAgent平台,支持数千自主代理全天候运行,并强调安全控制、权限管理与人工审核。
延伸解读
自建评估体系:从通用基准到真实任务
Balyasny没有依赖公开基准,而是用数千个真实金融任务测试模型,覆盖股票、宏观和商品,且每个任务都有可验证的结果。这种方法能揭示模型在具体业务场景中的实际表现,比如数值错误、覆盖遗漏或检索问题。对于企业而言,投资于此类评估体系可以数据驱动地选择模型和路由,避免被演示效果误导。
代理执行的关键:模型与运行框架的协同
文章强调,仅靠模型本身不够,还需要围绕模型的运行框架(如Claude Code)来支持长时间、多步骤的任务。BAM自建了执行框架、数据访问和审查控制,使代理能规划工作、使用工具、分析证据并从错误中恢复。Fable在复杂规划和代理执行上表现突出,但最终产出仍需人工审核,确保投资判断和责任由人承担。
安全治理:控制围绕模型,而非依赖模型
BAM将安全视为产品与运营模式问题,而非一次性模型选择。他们实施数据边界、最小权限、工具级权限、日志追溯和人工审核,并测试对抗与故障场景。更强大的模型不会自动获得更广权限,模型只能使用经批准的工具和数据源。这种治理框架在部署数千自主代理时尤为重要,确保代理在受控环境中运行。
从工具到队友:代理工作流的实际影响
BAMAgent平台支持数千代理全天候运行,将多步骤研究分析从数天缩短至数小时甚至30分钟。例如,税务亏损收割分析探索了9万张数据库表,结果比传统方法更全面;首席经济学家将央行分析从两天压缩到30分钟。这些案例显示,代理能承担重复性分析工作,但人类仍保留审查和判断权,从而提升效率并减少遗漏。
Q&A
Balyasny资产管理公司如何评估Claude Fable 5?
BAM使用数千个真实金融任务(覆盖股票、宏观、大宗商品)测试模型,既单独测试模型,也测试其在代理环境中的表现。Fable 5在相关子集上得分89.4%,优于前代生产模型的86.1%,尤其在复杂规划、分析和代理执行方面表现突出。
Claude Fable 5在BAM的并购套利分析中带来了什么改变?
以前并购套利分析需要三到五天,现在代理能在不到一天内完成,代理运行约30分钟,之后由人工审核。代理会构建初始交易分析包,评估交易完成概率和时间,提取关键经济与法律条款,识别条件和里程碑,并标记需要投资者判断的领域。
BAM如何确保使用前沿AI模型时的安全性?
BAM将安全视为产品和运营模式问题,在模型周围设置控制措施,包括批准的数据边界、最小权限访问、工具级权限、日志和可追溯性、对重要输出的人工审核以及边缘情况的升级路径。模型只能使用经批准的工具和数据源,不能自行授予更多访问权限。
BAMAgent平台是什么?它有什么作用?
BAMAgent是BAM内部平台,用于安全地将代理部署到经批准的企业工作流中。它支持数千个自主代理全天候运行,能执行多步骤研究和分析,可运行数小时或数天,代理并行工作,最终产出可供人工审核的研究成果、模型或决策支持包。
BAM在2026年对前沿AI的定位发生了什么变化?
BAM的首席AI官指出,2026年是从AI系统做搜索转向AI系统做工作的年份。关键变化不仅是模型,还有围绕模型的工具(如Claude Code),使AI能承担更复杂、更长期的任务,可以给AI一个结果而非提示,让它持续工作直到完成。
Claude Fable 5为BAM解锁了哪些具体能力?
例如,一个BAMAgent运行了税收损失收割分析,探索了90,000个数据库表,找到相关共同基金持仓数据,并构建了自己的加权系统,经团队审核后结果比传统方法更全面。此外,首席经济学家配置的代理工作流将经常性的央行分析从约两天缩短到约30分钟。