谷歌发布Gemini 3.8 Flash,六周内迭代三版,DeepSWE跑分73.7%超Claude Opus 5,但Terminal-Bench 4.0仅19.1%,显示基准测试可能被刷。定价低但成本高,Cyber版仅限政府等“可信防御者”。谷歌以快速迭代和低价抢市场,但知识截止混乱,普通用户难用上新版。
谷歌发布Gemini 3.7 Flash,专为编码代理和自动化工作流设计,性能优于3.6 Flash,代码得分提升,且不易卡住。API初始价格减半,但2027年将翻倍。支持低中高思考级别,需注意迁移调整。虽改进显著,但测试可靠性仍待验证,3.5 Pro仍未发布。
DeepSWE测试显示,GPT-5.5在编程能力上超越Claude Opus 4.8,表现出更高的效率和可靠性。新考试更真实,反映了AI在实际工作中的能力,用户普遍认为GPT-5.5更实用。
完成下面两步后,将自动完成登录并继续当前操作。