内容提要
Gemini 4 Argon 发布,主打知识与长文本处理,在18项测试中13项领先,输出上限提升至100万token,幻觉率仅15%。API定价为每百万token输入2美元、输出10美元,性价比高。但编程与终端能力偏弱,目前仅限少量合作伙伴试用,内部对其真实性能存疑。
延伸解读
写作与知识能力突出,编程终端成短板
文章指出,Gemini 4 Argon 在18项测试中13项领先,尤其知识工作与长文本处理优势明显,但编程和终端任务表现垫底。Arena.ai 评分也显示其文本能力第一,而工程类排名第八。这种能力分布意味着它更适合写作、分析和长文档处理,而非代码生成或系统操作。
百万输出token与低幻觉率:长文本推理的升级
Gemini 4 将输出上限从6.4万token提升至100万token,官方称这能让模型在单次推理中生成数十万词元,从而深入思考复杂问题。同时,其幻觉率仅15%,为前沿模型最低,表明它更倾向于承认不确定而非编造。这两点结合,可能提升长文本生成与知识问答的可靠性。
定价策略与可用性:性价比高但尚未公开
API 定价为每百万token输入2美元、输出10美元,缓存命中仅0.1美元,优惠期后价格翻倍。以优惠价计算,其价格约为部分竞品的五分之一,性价比突出。但模型目前仅通过 Fairwind 计划向少量网络安全合作伙伴开放,全面公开时间未定,普通用户需等待。
跑分亮眼但内部存疑,实际表现待验证
尽管官方跑分显示 SOTA 水平,但彭博社报道称 Google 内部员工对 Gemini 4 实际性能持怀疑态度,认为其难以处理某些编码任务。文章也提到 Gemini 3.8 Flash 跑分与实测落差大,暗示可能存在跑分优化。因此,最终用户体验可能不如跑分所示,需等待实际测试。
Q&A
Gemini 4 Argon 什么时候正式发布的?
Gemini 4 Argon 于文章发布时正式发布,结束了长达七个半月的旗舰模型停更期。
Gemini 4 Argon 在哪些方面表现突出?
它在知识工作、长文本处理和写作方面表现突出,在18项测试中13项领先,尤其在金融分析和法律工作测试中领先其他模型两档,长上下文测试领先超过10%。
Gemini 4 Argon 的编程能力怎么样?
编程能力起伏不定:在DeepSWE v1.1上达到77.9%,领先GPT-6 Astra和Claude Opus 5.5近4个百分点,但在FrontierSWE v2和Terminal-Bench 4.0上垫底,整体特性为知识/写作>编程>终端。
Gemini 4 Argon 的幻觉率是多少?
在Artificial Analysis测试中,Gemini 4的幻觉率仅为15%,是所有前沿模型中最低的,面对不确定回答时更倾向于说“不知道”。
Gemini 4 Argon 的API定价如何?
官方API定价为每百万token输入2美元、输出10美元,命中缓存价格为0.1美元。首发优惠期后价格会翻倍,但预计优惠期会持续到下一代模型发布前。
Gemini 4 Argon 目前如何开放使用?
目前仅通过Fairwind计划对少量网络安全合作伙伴开放,官方未公布全面公开时间,只说明届时首先向付费API用户和Google AI Ultra订阅者开放,普通订阅用户还需等待。
Gemini 4 Argon 的输出上限提升到了多少?
输出上限从上一代的6.4万token提升到了100万token,可一口气输出约70万到100万个汉字,对思维链构建是史诗级升级。
内部对Gemini 4 Argon的真实性能有何看法?
彭博社报道称Google内部员工对Gemini 4的实际性能持怀疑态度,认为其在真实任务中效果不尽如人意,难以处理某些编码任务,尽管Google方面迅速反驳。