推出Gemini 3.8 Flash与3.8 Flash Cyber
内容提要
谷歌发布Gemini 3.8 Flash及3.8 Flash Cyber模型,提升推理与编码能力,价格与3.7 Flash相同。Flash版擅长软件工程和智能体任务,Cyber版专攻漏洞检测与自动修复,已在谷歌内部应用,如Chrome安全团队效率提升2.6倍。模型注重安全防护,Cyber版仅限可信防御者使用。
延伸解读
定价策略与性能定位
Gemini 3.8 Flash 的输入输出价格与 3.7 Flash 相同,但性能显著提升,接近更高成本的模型。这表明谷歌试图以相同成本提供更强能力,可能加剧市场竞争。开发者需注意,模型在复杂任务中可能消耗更多 token,但可通过降低 effort 水平来控制成本。
Cyber 版的安全限制与访问条件
3.8 Flash Cyber 因具备更强的漏洞检测与修复能力,仅通过 Fairwind 计划向可信防御者开放,如政府、关键基础设施运营者。这体现了对滥用风险的管控,但也限制了其广泛应用。普通开发者无法直接使用,需申请并通过审核。
实际应用效果与基准测试
文章提到 Chrome 安全团队使用 Cyber 版后,正确补丁数量是其他商业模型的 2.6 倍;Wiz 的测试显示,在降低 2.3-5.2 倍成本的同时,召回率提升 7.5-9.7%。这些数据表明模型在真实场景中具有成本效益优势,但需注意这些结果来自特定环境,可能不具普遍性。
Q&A
Gemini 3.8 Flash 和 3.8 Flash Cyber 有什么区别?
Gemini 3.8 Flash 是通用模型,擅长软件工程、智能体任务和复杂推理;3.8 Flash Cyber 是专为网络安全设计的模型,专注于漏洞检测和自动修复,仅向可信防御者提供。
Gemini 3.8 Flash 的定价是多少?
Gemini 3.8 Flash 的定价与 3.7 Flash 相同,为每百万输入 tokens 0.75 美元,每百万输出 tokens 3.75 美元。
Gemini 3.8 Flash 在哪些基准测试中表现优异?
在 DeepSWE v1.1 上,3.8 Flash 在自主解决复杂工程问题方面超越大多数大型前沿模型;在 Vals Finance Agent V2 和 Harvey's Legal Agent Benchmark 上表现优于 3.7 Flash 和其他前沿模型;在 HLE-Verified 上达到 54.9%。
Gemini 3.8 Flash Cyber 在漏洞发现和修复方面表现如何?
在 CyberGym 基准上,3.8 Flash Cyber 在自主漏洞发现方面达到前沿水平,超过 3.5 Flash Cyber 和更大的模型;在内部基准上,跨 20 种编程语言的漏洞发现成功率超过 70%。在 CWE-Bench 上,其 pass@1 为 47.2%,接近领先前沿模型的 47.8%,但成本更低。
Gemini 3.8 Flash Cyber 在 Google 内部有哪些实际应用案例?
Chrome 安全团队使用 3.8 Flash Cyber 生成的正确补丁数量是其他大型商业模型的 2.6 倍;Wiz 发现其内部渗透测试基准的召回率提高 7.5-9.7%,成本降低 2.3-5.2 倍;Google 云漏洞研究团队用它发现了一个关键基础漏洞,耗时不到 2 小时,而通常需要数月。
Gemini 3.8 Flash Cyber 的访问限制是什么?
3.8 Flash Cyber 仅通过 Fairwind Program 向可信的防御者提供,包括政府机构、关键基础设施运营商和软件维护者,以确保安全。
Gemini 3.8 模型在安全方面有哪些措施?
3.8 Flash 内置了针对化学、生物、放射性和核(CBRN)以及网络攻击的滥用防护,同时支持有益用途;3.8 Flash Cyber 具有更宽松的网络安全缓解措施,因此仅限可信防御者使用。此外,3.8 模型在提示注入鲁棒性方面有显著提升。
开发者如何开始使用 Gemini 3.8 Flash?
开发者可以通过 Google Antigravity、Gemini API(通过 Google AI Studio 和 Android Studio)或 Stitch 生成 UI 来开始使用。企业可以在 Gemini Enterprise 中访问,消费者可以在 Gemini 应用、AI Mode 和 Google Sheets 中使用。