Gemini 4 正式发布,我们终于有了一个写作强于代码的前沿模型

Gemini 4 正式发布,我们终于有了一个写作强于代码的前沿模型

💡 原文中文,约3100字,阅读约需8分钟。
📝

内容提要

Gemini 4 Argon 发布,主打知识与长文本处理,在18项测试中13项领先,输出上限提升至100万token,幻觉率仅15%。API定价为每百万token输入2美元、输出10美元,性价比高。但编程与终端能力偏弱,目前仅限少量合作伙伴试用,内部对其真实性能存疑。

🔎

延伸解读

写作与知识能力突出,编程终端成短板

文章指出,Gemini 4 Argon 在18项测试中13项领先,尤其知识工作与长文本处理优势明显,但编程和终端任务表现垫底。Arena.ai 评分也显示其文本能力第一,而工程类排名第八。这种能力分布意味着它更适合写作、分析和长文档处理,而非代码生成或系统操作。

百万输出token与低幻觉率:长文本推理的升级

Gemini 4 将输出上限从6.4万token提升至100万token,官方称这能让模型在单次推理中生成数十万词元,从而深入思考复杂问题。同时,其幻觉率仅15%,为前沿模型最低,表明它更倾向于承认不确定而非编造。这两点结合,可能提升长文本生成与知识问答的可靠性。

定价策略与可用性:性价比高但尚未公开

API 定价为每百万token输入2美元、输出10美元,缓存命中仅0.1美元,优惠期后价格翻倍。以优惠价计算,其价格约为部分竞品的五分之一,性价比突出。但模型目前仅通过 Fairwind 计划向少量网络安全合作伙伴开放,全面公开时间未定,普通用户需等待。

跑分亮眼但内部存疑,实际表现待验证

尽管官方跑分显示 SOTA 水平,但彭博社报道称 Google 内部员工对 Gemini 4 实际性能持怀疑态度,认为其难以处理某些编码任务。文章也提到 Gemini 3.8 Flash 跑分与实测落差大,暗示可能存在跑分优化。因此,最终用户体验可能不如跑分所示,需等待实际测试。

❓

Q&A

Gemini 4 Argon 什么时候正式发布的?

Gemini 4 Argon 于文章发布时正式发布,结束了长达七个半月的旗舰模型停更期。

Gemini 4 Argon 在哪些方面表现突出?

它在知识工作、长文本处理和写作方面表现突出,在18项测试中13项领先,尤其在金融分析和法律工作测试中领先其他模型两档,长上下文测试领先超过10%。

Gemini 4 Argon 的编程能力怎么样?

编程能力起伏不定:在DeepSWE v1.1上达到77.9%,领先GPT-6 Astra和Claude Opus 5.5近4个百分点,但在FrontierSWE v2和Terminal-Bench 4.0上垫底,整体特性为知识/写作>编程>终端。

Gemini 4 Argon 的幻觉率是多少?

在Artificial Analysis测试中,Gemini 4的幻觉率仅为15%,是所有前沿模型中最低的,面对不确定回答时更倾向于说“不知道”。

Gemini 4 Argon 的API定价如何?

官方API定价为每百万token输入2美元、输出10美元,命中缓存价格为0.1美元。首发优惠期后价格会翻倍,但预计优惠期会持续到下一代模型发布前。

Gemini 4 Argon 目前如何开放使用?

目前仅通过Fairwind计划对少量网络安全合作伙伴开放,官方未公布全面公开时间,只说明届时首先向付费API用户和Google AI Ultra订阅者开放,普通订阅用户还需等待。

Gemini 4 Argon 的输出上限提升到了多少?

输出上限从上一代的6.4万token提升到了100万token,可一口气输出约70万到100万个汉字,对思维链构建是史诗级升级。

内部对Gemini 4 Argon的真实性能有何看法?

彭博社报道称Google内部员工对Gemini 4的实际性能持怀疑态度,认为其在真实任务中效果不尽如人意,难以处理某些编码任务,尽管Google方面迅速反驳。

🏷️

标签

➡️

继续阅读