内容提要
谷歌发布Gemini 3.8 Flash,六周内迭代三版,DeepSWE跑分73.7%超Claude Opus 5,但Terminal-Bench 4.0仅19.1%,显示基准测试可能被刷。定价低但成本高,Cyber版仅限政府等“可信防御者”。谷歌以快速迭代和低价抢市场,但知识截止混乱,普通用户难用上新版。
延伸解读
基准测试的“水分”与泛化隐忧
3.8 Flash在Terminal-Bench 2.1上得分89.4%,但在4.0版本上仅19.1%,差距悬殊。文章指出,2.1版本的数据可能已泄露进训练集,模型或是在“背答案”而非真正解题。DeepSWE等公开基准也可能被刷。这提醒读者,单一基准的高分不足以证明模型真实能力,需关注跨基准的稳定性。
低价策略背后的成本陷阱
3.8 Flash的API定价看似低廉(输入0.75美元/百万token),但文章揭示其每任务成本比3.7 Flash高出40%,达到0.58美元。原因是模型在复杂任务上会消耗更多token,导致总费用上升。此外,该价格仅为“introductory price”,2027年1月起将翻倍。开发者需警惕低价背后的隐性成本与未来涨价风险。
Cyber版的安全悖论
3.8 Flash Cyber在漏洞检测和自动打补丁上表现亮眼,但仅向政府、关键基础设施等“可信防御者”开放,普通开发者无法使用。文章指出,这形成悖论:最擅长防御的AI被严格限制,而真正需要它的人可能无法获得。同时,谷歌强调“优先修复漏洞而非利用”,但安全缓解措施的放宽也意味着潜在风险,需权衡其可用性与安全性。
快速迭代下的产品策略与用户脱节
谷歌六周内连发三个Flash模型,但3.5 Pro却因预训练问题跳票,显示其产品线策略失衡。更关键的是,模型更新虽快,但普通用户难以触及:Gemini App免费用户仅能使用3.6 Flash,3.7和3.8需订阅Pro或Ultra。此外,知识截止日期混乱,不同领域信息新旧不一,可能误导开发者。这种发布与分发的脱节,削弱了快速迭代的实际价值。
Q&A
Gemini 3.8 Flash在DeepSWE基准测试上的得分是多少?
Gemini 3.8 Flash在DeepSWE v1.1软件工程基准上的得分为73.7%,比3.7 Flash的65.3%高出8.4个百分点。
Gemini 3.8 Flash的定价是多少?
Gemini 3.8 Flash的API定价为每百万输入token 0.75美元,每百万输出token 3.75美元。但这是限时优惠价,从2027年1月1日起将翻倍至输入1.50美元、输出7.50美元。
为什么Gemini 3.8 Flash在Terminal-Bench 2.1和4.0上的得分差异巨大?
Gemini 3.8 Flash在Terminal-Bench 2.1上得分89.4%,但在4.0上仅19.1%。这种巨大差异很可能是因为2.1版本的数据已经泄露到训练集中,模型是在背答案而非真正解题,导致在更新版本上表现不佳。
Gemini 3.8 Flash Cyber版本有什么特点?为什么普通用户无法使用?
Cyber版本专注于漏洞检测和自动打补丁,在CyberGym基准上得分86.2%,在CWE-Bench上得分47.2%,处理真实Chrome漏洞时生成的正确补丁是更大模型的2.6倍。但该版本仅通过Fairwind Program向政府机构、关键基础设施运营商等“可信防御者”开放,普通开发者无法使用,因为其配备了更宽松的安全缓解措施,可能造成更大破坏。
谷歌为什么快速迭代Flash系列模型?
谷歌在六周内发布了3.6、3.7、3.8三个Flash版本,目的是通过快速迭代、低价策略和广泛覆盖来抢占市场,而不是像OpenAI和Anthropic那样只追求模型的天花板。Flash系列面向开发者和企业,强调实用性和效率。
Gemini 3.8 Flash的知识截止日期有什么问题?
Gemini 3.8 Flash的知识截止日期混乱,官方表示某些领域知识截止到2026年3月,其他领域可能只到2025年1月。这导致模型在不同领域的新鲜度不一致,可能给开发者提供过时信息,造成困扰。
Gemini 3.8 Flash与Claude Opus 5在定价和性能上有何对比?
Gemini 3.8 Flash的定价远低于Claude Opus 5,输出价格仅为Opus 5的15%(3.75美元 vs 25美元每百万token)。在DeepSWE基准上,3.8 Flash得分73.7%,略低于Opus 5的74.0%,但差距很小。