内容提要
谷歌发布旗舰模型Gemini 4 Argon,多数基准测试大幅领先OpenAI和Anthropic的顶级模型,尤其擅长知识工作,AutomationBench领先近9分。输出上限提升至100万token,具备自主发现和修补漏洞能力,已用于Wiz扫描。编码表现参差,部分测试落后。目前仅限Fairwind计划测试,定价未公布。
延伸解读
基准领先但编码表现参差
在谷歌公布的18项基准测试中,Gemini 4 Argon在13项上领先Anthropic的Opus 5.5、Fable 5.1和OpenAI的GPT-6 Astra。然而编码能力并非全面占优:DeepSWE v1.1达77.9%创纪录,但在FrontierSWE v2和Terminal-Bench 4.0上垫底,分别落后领先者10.5和9分。Vibe Code Bench虽获91.9%,但四款模型均超89%,优势微弱。
知识工作与长输出成亮点
Argon在知识工作任务上优势明显:Zapier的AutomationBench得分51.3%,领先Opus 5.5近9分;GraphWalks测试(256K至1M token输入)达84.2%,超GPT-6 Astra逾12分。其输出上限提升至100万token,远超前代Gemini的64K,谷歌称这能让模型在单次轨迹中生成数十万token,为复杂推理提供更大空间。
网络安全能力与访问限制
谷歌训练Argon自主发现、验证和修补软件漏洞,并在Fairwind计划及内部团队中取消网络安全护栏。Wiz已将其用于Scan for Good计划,发现了一个早期前沿模型遗漏的全球医院软件关键漏洞。但Argon目前仅限Fairwind计划测试,定价未公布,API客户和AI Ultra订阅者将优先获得访问权。
Q&A
Gemini 4 Argon 是什么?它和谷歌之前的模型有什么关系?
Gemini 4 Argon 是谷歌发布的旗舰模型,本质上就是谷歌在 I/O 开发者大会上宣布的新 Pro 模型。原计划 6 月推出,但当时只发布了一系列 Flash 模型,现在 Argon 终于面世。
Gemini 4 Argon 在基准测试中的表现如何?
在谷歌的基准测试中,Argon 在 18 项测试中的 13 项击败了 Anthropic 的 Opus 5.5、Fable 5.1 以及 OpenAI 的 GPT-6 Astra。它在知识工作方面表现突出,例如在 Zapier 的 AutomationBench 上得分 51.3%,领先 Opus 5.5 近 9 分;在 GraphWalks 测试(输入 256K 到 1M token)中得分 84.2%,领先 GPT-6 Astra 超过 12 分。但编码表现参差不齐,在 FrontierSWE v2 和 Terminal-Bench 4.0 上落后于竞争对手。
Gemini 4 Argon 目前可以使用吗?如何获取访问权限?
目前 Gemini 4 Argon 仅限 Fairwind 计划测试,尚未公开发布。谷歌表示会收集早期测试者的反馈并迭代护栏,之后才会在 Fairwind 计划之外提供。届时 API 客户和 AI Ultra 订阅者将首先试用,然后才会向开发者、企业和消费者发布。
Gemini 4 Argon 在网络安全方面有什么能力?
谷歌训练 Argon 自主发现、验证和修补软件漏洞,并在 Fairwind 参与者及内部团队中发布无网络护栏的模型。Wiz 已在其 Scan for Good 计划中使用 Argon,该模型发现了一个全球医院使用的医疗软件中的关键漏洞,而之前的前沿模型都未能发现。Argon 在谷歌内部漏洞发现基准上得分 85.8%,在 Wiz 的渗透测试基准上得分 70.9%。
Gemini 4 Argon 的输出 token 限制是多少?有什么意义?
Gemini 4 Argon 可以生成最多 100 万个输出 token,而之前 Gemini 模型的输出上限是 64,000 个 token。谷歌表示,当模型有足够的空间深入思考并在单次轨迹中生成数十万个 token 时,能为一次性解决难题增加新的推理深度。
Gemini 4 Argon 的定价是多少?
谷歌尚未公布 Gemini 4 Argon 的定价。作为参考,Anthropic 对 Opus 5.5 每百万输出 token 收费 20 美元,而 Argon 现在能在单次响应中写入多达 100 万 token,因此价格对开发者来说可能与基准测试同样重要。