Gemini 4 Argon:我们下一个前沿智能时代

💡 原文英文,约1400词,阅读约需5分钟。
📝

内容提要

谷歌发布Gemini 4 Argon前沿模型,先向可信网络防御者开放。该模型擅长长周期复杂任务,在软件工程、法律金融等企业工作及网络安全防御中表现领先,可自主发现并修补漏洞。输出上限提至100万token,定价每百万输入2美元、输出10美元。发布前强化防滥用、防提示注入等四类安全措施,后续将逐步向开发者、企业和消费者开放。

🔎

延伸解读

分阶段发布与安全考量

Gemini 4 Argon 首先通过 Fairwind 计划向可信网络防御者开放,并参与美国政府的前沿模型预发布访问流程。这种分阶段发布策略旨在收集早期测试者反馈,迭代防护措施,再逐步扩展到开发者、企业和消费者。文章强调,在广泛可用前,谷歌在防滥用、防提示注入、监控失准和系统加固四方面加强了前沿安全保障,以平衡能力释放与风险控制。

长周期任务与输出能力提升

Argon 专为长周期复杂工作流设计,输出上限从 64K 大幅提升至 100 万 token,使其能在单次轨迹中生成数十万 token,深入推理并一次性解决难题。这支持了软件工程、法律金融等企业任务中的多步骤操作,例如大规模代码迁移和算法优化。文章指出,Argon 在 DeepSWE v1.1 上达到 77.9% 的新最优水平,并在 Vals Index 等经济影响评估中领先。

网络安全防御的突破与局限

Argon 在网络安全防御上表现突出,能自主发现、验证和修补关键漏洞。在 CWE-bench v1 上以 68% 并列第一,并在 Wiz 的黑盒渗透测试基准中超越 3.8 Flash Cyber。实际案例中,它发现了医院软件中一个先前前沿模型遗漏的严重漏洞。但文章也指出,这些能力目前仅向可信防御者开放,且需在严格审计和测试后才会部署到生产环境,凸显了能力与风险并存的现状。

定价与内部应用实效

Argon 的定价为每百万输入 token 2 美元、输出 10 美元,缓存输入可享 95% 折扣。文章透露,该模型已在谷歌内部驱动数千名员工的工作流,并在量子算法优化、内存效率提升和大型代码库迁移中产生实际效益。例如,在内存优化中释放了超过 300 TiB 内存,预计总节省可达 500 TiB 至 1 PiB。这些案例表明,Argon 不仅停留在基准测试,已开始解决真实工程问题。

❓

Q&A

Gemini 4 Argon 是什么?它主要面向哪些用户开放?

Gemini 4 Argon 是谷歌发布的新前沿模型,首先通过 Fairwind 计划向一组可信的网络防御者开放,后续将逐步向开发者、企业和消费者开放。

Gemini 4 Argon 的定价是多少?

输入每百万 token 2 美元,输出每百万 token 10 美元,缓存输入 token 享受输入 token 价格 95% 的折扣。

Gemini 4 Argon 在输出 token 限制上有什么突破?

输出 token 上限从之前的 64K 提升到行业领先的 100 万 token,使模型能在单次轨迹中生成数十万 token,从而深入推理并一次性解决复杂问题。

Gemini 4 Argon 在网络安全防御方面有哪些具体能力?

Argon 能自主发现、验证和修补关键软件漏洞。在 CWE-bench v1 上以 68% 的得分并列第一,并在 Wiz 的内部黑盒渗透测试基准中优于 3.8 Flash Cyber,能发现攻击面、识别漏洞并生成概念验证证据。

谷歌在发布 Gemini 4 Argon 前采取了哪些安全措施?

谷歌在四个主要领域加强了前沿安全保障:防御滥用(拒绝有害请求并监控内部激活)、防御提示注入攻击(通过自动化红队和对抗训练提升鲁棒性)、监控失准(监控思维链和行动并在必要时停止执行)、加固系统(隔离和密封沙盒环境)。

Gemini 4 Argon 在软件工程和知识工作方面表现如何?

在软件工程上,它在 DeepSWE v1.1 上达到 77.9% 的新 SOTA;在知识工作上,它在 Vals Index 上领先,并在 Vals Finance Agent v2、Harvey 法律代理基准和 Zapier 的 AutomationBench 上排名第一(51.3%)。

🏷️

标签

➡️

继续阅读