内容提要
Google发布Gemini 3.8 Flash,六周内第三款Flash模型,主打长程软件工程和Agent任务,跑分接近Claude Opus 5,但实测细节粗糙,能力依赖推理超频。Google因3.5 Pro失败转向快速迭代策略,放弃前沿竞争,以低成本模型服务十亿用户,但Flash在真实任务中仍与旗舰模型有差距。
延伸解读
跑分与实测的落差从何而来
官方跑分显示3.8 Flash在长程软件工程等任务上逼近Claude Opus 5,但社区反馈和简单测试却显示其细节粗糙。这种落差可能源于测试方式不同:官方演示通常配合专门的Agent框架、工具环境和多轮测试标准,而用户往往只给一次性自然语言指令。因此,跑分反映的是模型被整套技术栈托举后的上限,而用户接触到的则是模型单独工作时的下限。
“更努力”的代价:推理超频与Token消耗
Google解释3.8 Flash能力提升主要来自“更加努力”——执行更多推理步骤、反复调用工具并检查工作。但这意味着它可能比3.7 Flash消耗更多Token,Google甚至建议注重计算效率时可降低推理档位或继续用3.7 Flash。可见,其性能提升有相当部分来自推理上的“强制超频”,实际使用中需权衡成本与效果。
Google的战略转向:放弃前沿,押注Flash
Gemini 3.5 Pro交付失败后,Google短期内不再押注超大规模模型,转而以快速迭代的Flash守住用户和收入。Gemini App月活已超10亿,增长并不依赖最强模型。对多数用户而言,速度快、成本低比排行榜第一更重要。退出前沿竞争可能让Google在商业上更轻松,但也意味着在Gemini 4出现前,Flash需强行承担代言技术力的角色。
Q&A
Gemini 3.8 Flash 是什么时候发布的?
Gemini 3.8 Flash 于今天凌晨正式上线,是 Google 在六周内发布的第三款 Flash 模型。
Gemini 3.8 Flash 的主要定位是什么?
官方称其目标是编写和修改大型项目、反复调用工具、独立完成持续数小时的复杂工作,主要面向长程软件工程、自主 Agent 和复杂企业工作流。
Gemini 3.8 Flash 在 DeepSWE v1.1 上的得分是多少?
Gemini 3.8 Flash 在 DeepSWE v1.1 上得分 71.0%,相比 3.7 Flash 的 65.3% 提高了近 6 个百分点,距离 Claude Opus 5 的 74.0% 还有差距。
Gemini 3.8 Flash 的价格是多少?
Gemini 3.8 Flash 与 3.7 Flash 价格一致:每百万 Token 输入 0.75 美元,输出 3.75 美元。这是限时优惠价,2027 年 1 月 1 日起将恢复为输入 1.5 美元、输出 7.5 美元。
为什么 Gemini 3.8 Flash 的能力提升被认为部分来自“强制超频”?
Google 解释称 3.8 Flash 能完成更困难任务是因为它“更加努力”,即执行更多推理步骤、反复调用工具并检查工作,但这会消耗更多 Token。因此其能力提升有相当一部分来自推理上的“强制超频”。
Gemini 3.8 Flash 在实际测试中的表现如何?
实际测试中,3.8 Flash 生成速度很快,但结果细节粗糙。例如用 Three.js 搭建空客 H145 直升机模型,功能齐全但机身细节和运动方式粗糙;3D 水流模拟也出现漏水问题。社区反馈也显示它容易草率理解需求,形式完整但细节不佳。
Google 为什么转向 Flash 模型的快速迭代策略?
因为 Gemini 3.5 Pro 交付失败,Google 短期内不再押注超大规模模型,而是转向成本更低、迭代更快的 Flash,以守住用户、产品、开发者和收入,同时 Gemini 4 仍承担重返前沿的长期目标。
Gemini 3.8 Flash Cyber 是什么?
Gemini 3.8 Flash Cyber 是专为网络安全机构和网络基础设施维护者设计的模型,用于发现和修复漏洞。在一项覆盖 20 种编程语言的内部漏洞发现测试中,其成功率超过 70%,但仅通过 Fairwind Program 提供给可信机构。