内容提要
谷歌发布Gemini 4 Argon,在多项榜单登顶,性能超越Claude Opus 5.5和GPT-6 Astra,成本约为对手一半,支持百万Token输出,主打编程、金融、法律及网络安全防御。目前仅向审核过的网络安全团队开放。内部评价不一,有人质疑其编程实际表现和刷榜,谷歌予以否认。
延伸解读
性能登顶但实际表现存疑
Gemini 4 Argon在多个榜单上表现亮眼,如DeepSWE v1.1得分77.9%,超过Claude Opus 5.5和GPT-6 Astra,并在Text Arena以1525分位居第一。然而,谷歌内部员工对模型的实际编程能力提出质疑,认为其前端界面设计仍是短板,且可能存在过度刷榜的嫌疑。谷歌对此予以否认,但模型真实水平仍需用户实际检验。
成本优势明显,但开放范围有限
Argon在价格上具有显著优势,优惠期间单题成本约为Astra的一半,每百万输入Token仅2美元,输出Token为10美元,是目前最具性价比的模型之一。不过,目前Argon仅面向经过审核的网络安全团队开放,普通用户暂时无法使用,其他订阅用户需逐步开放。
专注长任务与网络安全防御
Argon支持百万Token输出上限,适合软件工程、金融、法律等复杂长任务。在网络安全方面,它能够自主发现、验证并修补20多种语言的关键漏洞,并在Wiz内部黑箱渗透测试中展现高效能力。为防止滥用,谷歌通过Fairwind计划仅向受信任的防御团队开放部分限制。
Q&A
谷歌Gemini 4 Argon是什么时候发布的?
谷歌在假期第一天突然发布了Gemini 4 Argon。
Gemini 4 Argon在哪些评测中排名第一?
它在DeepSWE v1.1上以77.9%排名第一,在CWE-bench v1上以68%并列第一,在Vals Index上以68.90%登顶,在Text Arena上以1525分位居第一。
Gemini 4 Argon的价格如何?
优惠期间单题成本约比GPT-6 Astra低四成,每百万输入Token为2美元,输出Token为10美元,是目前最具性价比的模型之一。
Gemini 4 Argon目前对哪些用户开放?
目前只开放给部分经过筛选的网络安全团队使用,其他订阅用户需要逐步开放。
Gemini 4 Argon在网络安全方面有什么优势?
它能够自主发现、验证并修补20多种语言的关键软件漏洞,在Wiz内部黑箱渗透测试中,可以在无源代码下实时分析网络系统,高效发现攻击面、识别漏洞以及生成概念验证证据。
谷歌内部对Gemini 4的评价如何?
内部评价不一:一些员工认为模型在实际编程任务中并没有跑分那么亮眼,前端界面设计仍是短板,甚至存在过度刷榜的嫌疑;另一名员工则表示内部普遍认为Gemini 4已达到前沿水平。谷歌回应称,说它编程表现不佳并不准确。