刚刚,Gemini 3.6 Flash 正式发布,但网友笑得更大声了

刚刚,Gemini 3.6 Flash 正式发布,但网友笑得更大声了

💡 原文中文,约4000字,阅读约需10分钟。
📝

内容提要

Google发布三款新模型(3.6 Flash、3.5 Flash-Lite、3.5 Flash Cyber),主打高效省token、低成本,但网友实测性能提升有限,甚至不如竞品。旗舰3.5 Pro跳票,传闻代码能力未达标,Google转而宣传Gemini 4。用户吐槽性价比低、质量差,质疑Google为省成本牺牲智能,前景堪忧。

🔎

延伸解读

性价比争议:省token不等于省心

官方强调3.6 Flash比3.5 Flash少用17%输出token,价格也下调,但网友实测发现其智能水平与3.5 Flash持平,甚至不如竞品。有用户指出,3.6 Flash的使用成本高于GPT-5.6 Sol medium,智能却更低,性价比优势存疑。这提醒我们,省token和降价未必能转化为实际体验的提升,性能才是关键。

旗舰跳票与战略转向

3.5 Pro迟迟未发布,据媒体报道其代码能力未达预期,甚至可能重训。Google转而宣传Gemini 4,被解读为转移视线。这一系列动作显示,Google可能在调整战略,优先推出低成本模型以抢占市场份额,但旗舰产品的缺席可能影响其高端竞争力。

安全限制与可用性

3.5 Flash Cyber专攻安全漏洞,但仅对可信合作伙伴限量开放,普通用户无法使用。这种限制虽出于安全考虑,但也意味着其实际效果难以被广泛验证。对于开发者而言,选择模型时需考虑可用性,避免依赖受限功能。

Q&A

Google 最新发布的 Gemini 3.6 Flash 相比上一代 3.5 Flash 有哪些改进?

Gemini 3.6 Flash 是 3.5 Flash 的小版本迭代,主要改进包括:输出 token 减少 17%,在 DeepSWE 等场景可节省 65% 的 token;价格降低,输出从 9 美元/百万 token 降至 7.5 美元;代码能力提升,DeepSWE 从 37% 升至 49%,MLE Bench 从 49.7% 升至 63.9%;计算机操作能力增强,OSWorld-Verified 从 78.4% 升至 83%;知识截止日期从 2025 年 1 月更新至 2026 年 3 月;安全防护升级,重点防范 CBRN 和网络攻击。

Gemini 3.5 Flash-Lite 的定价和性能如何?

Gemini 3.5 Flash-Lite 定位为快速、便宜的模型,输入 0.3 美元/百万 token,输出 2.5 美元/百万 token,每秒可生成 350 个 token。它支持调整推理档位,在代码和 agent 任务上表现提升明显,例如 Terminal-Bench 2.1 从 31% 升至 54%,GDM-MRCR v2 从 60.1% 升至 72.2%,GDPval-AA v2 从 642 升至 1140。在部分任务上甚至超越了 3 Flash。

Gemini 3.5 Flash Cyber 是做什么的?为什么限制访问?

Gemini 3.5 Flash Cyber 是专门用于查找和修复代码安全漏洞的模型,基于 3.5 Flash 微调,配合 CodeMender 工具使用。它在 CyberGym 基准上达到第一梯队水平,且更省 token。由于该能力具有双刃剑性质,Google 仅对可信合作伙伴限量开放内测,以防止滥用。

为什么 Gemini 3.5 Pro 没有发布?

据媒体报道,3.5 Pro 的代码生成能力未达到内部预期,Google 曾更新训练数据但效果不佳,甚至传闻推翻了训练方案从头重训。因此官方推迟发布,转而宣传 Gemini 4 的预训练计划。

网友对 Gemini 3.6 Flash 的主要吐槽点有哪些?

网友吐槽主要集中在:3.6 Flash 在 Artificial Analysis 上的智能指数与 3.5 Flash 相同,没有提升,且不如 Meta Spark 1.1、GLM-5.2 等竞品;使用成本比 GPT-5.6 Sol medium 高但智能更低;实测性能差,包括基础解码错误、中文选词离谱、生成图片视频质量差、记忆混乱等。

Gemini 3.6 Flash 在代码和计算机操作方面的基准测试成绩如何?

在代码方面,DeepSWE 从 37% 提升至 49%,MLE Bench 从 49.7% 提升至 63.9%;在计算机操作方面,OSWorld-Verified 从 78.4% 提升至 83%。此外,计算机操作已成为 Gemini API 和企业版的内置工具。

🏷️

标签

➡️

继续阅读