内容提要
谷歌发布Gemini 3.6 Flash等三款模型,主打效率与成本优化,输出token减少17%,价格降至每百万7.5美元。3.5 Flash-Lite以高吞吐量抢占市场,3.5 Flash Cyber专注安全自动化。但基准测试仅对比自家产品,旗舰缺席及产品矩阵混乱引发开发者不满,未来寄望于Gemini 4。
延伸解读
效率提升的实际价值
3.6 Flash通过减少输出token和推理步骤,降低了完成单个代理任务的总成本。对于处理大量文档分析和报表生成的企业,如Hebbia和Harvey,新模型在解析图表和起草报告时不仅更准确,速度也显著提升,改变了开发者的工作习惯。
Flash-Lite的性价比优势
3.5 Flash-Lite以每百万输入token 0.3美元、输出2.5美元的价格,提供了每秒350个token的高吞吐量,并在SWE-Bench Pro和OSWorld-Verified测试中超越了3.0 Flash。对于处理大批量简单任务的企业,如Palo Alto Networks和Ramp,它既能节省成本,又能提升效率。
安全模型的受限发布
3.5 Flash Cyber专注于漏洞检测与修复,与CodeMender代理结合,在CyberGym基准测试中达到前沿水平。出于双重用途的担忧,Google仅通过试点项目向政府和受信任合作伙伴提供,这种策略在商业竞争和社会责任之间寻求平衡。
基准测试的局限性
文章中的所有基准测试均与自家旧款模型对比,缺乏与GPT-5.6、Kimi K3等竞品的直接比较。开发者社区对此表示质疑,认为这种“自嗨式”宣传缺乏说服力,并猜测Gemini 3.5 Pro可能因性能不达标而被推迟或取消。
Q&A
谷歌在2026年7月22日发布了哪些新AI模型?
谷歌DeepMind发布了三款新模型:Gemini 3.6 Flash、3.5 Flash-Lite和3.5 Flash Cyber。
Gemini 3.6 Flash相比上一代在输出token和性能上有哪些提升?
Gemini 3.6 Flash比3.5 Flash减少了17%的输出token用量,在DeepSWE代码修复测试中任务完成率从37%提升到49%,在ML Research基准测试中从49.7%跃升至63.9%,在OSWorld-Verified测试中得分83.0%(3.5 Flash为78.4%)。
Gemini 3.6 Flash的定价是多少?
Gemini 3.6 Flash的输入token定价为每百万1.5美元,输出token为每百万7.5美元。
3.5 Flash-Lite在速度和成本上有何优势?
3.5 Flash-Lite的输出速度达到每秒350个token,是3.5系列中最快的。定价为每百万输入token 0.3美元,输出token 2.5美元。在SWE-Bench Pro编程基准中通过率54.2%,超过3.0 Flash的49.6%;在OSWorld-Verified测试中得分74.0%,超过3.0 Flash的65.1%。
3.5 Flash Cyber的主要功能和限制是什么?
3.5 Flash Cyber专注于识别和修补网络安全漏洞,与CodeMender代码安全代理深度绑定,实现漏洞检测与修复的全链路自动化。在CyberGym基准测试中达到与前沿模型竞争的性能。但出于安全考虑,该模型未完全开放,仅通过限量试点项目提供给政府和受信任的合作伙伴。
开发者对谷歌这次发布的主要不满有哪些?
开发者不满主要集中在:基准测试仅对比自家旧款模型,缺乏与GPT-5.6、Kimi K3等竞品的对比;旗舰模型Gemini 3.5 Pro缺席,引发对其性能的猜测;产品矩阵混乱,如Antigravity IDE订阅政策突变、Gemini Enterprise与个人版功能割裂等。
谷歌对Gemini 4有何计划?
谷歌已启动Gemini 4的预训练,并称之为“最具雄心的尝试”。这暗示谷歌将未来的竞争力押注在下一代架构革新上。