内容提要
SpaceXAI 发布 Grok 4.7,参数增至 2.1 万亿,主打长周期 Agent 任务,Terminal-Bench 等得分提升。但实测 Token 消耗为前代 2.25 倍,缓存读取价格为竞品两倍,综合跑分仅微涨甚至倒退,速度偏慢。日常使用性价比低,仅适合重度 Agent 场景。
延伸解读
参数增长不等于性能提升
Grok 4.7参数从1.5万亿增至2.1万亿,增长40%,但Artificial Analysis Intelligence Index得分仅从44分升至46分,Vals AI排名反而从第14名降至第24名。这表明参数增加并未带来广泛推理能力的提升,而是针对长周期Agent任务进行了优化。读者需注意,参数规模并非衡量模型智能的唯一标准,实际任务表现和效率同样关键。
Token效率下降导致实际成本翻倍
尽管API标价与Grok 4.6相同,但Grok 4.7完成同一任务平均消耗8.1万输出Token,是前代3.6万的两倍多。缓存读取价格每百万Token 0.5美元,是Claude Fable 5的两倍。在长周期Agent任务中,缓存读取占成本大头,这意味着实际账单可能远超标价。用户需警惕隐性成本,尤其是高频或长上下文场景。
Agent任务表现提升但综合能力存疑
Grok 4.7在Terminal-Bench 4.0上得分从20.3%跃升至38.0%,AA-Briefcase提升111 Elo,显示其在长周期、多步骤Agent任务上的进步。然而,综合跑分微涨甚至倒退,且速度仅39.3 Token/秒,被标注为明显慢。这表明其优化方向狭窄,仅适合重度Agent场景,日常使用性价比低。
竞争对比缺失引发透明度质疑
发布对比图中未包含GPT-6 Astra,因OpenAI撤回了Astra在Cursor平台的使用权。但Astra在Terminal-Bench上得分57.9%,远超Grok 4.7的38.0%。此外,Grok 4.7缓存读取价格是Fable 5的两倍,在Agent场景下成本优势被侵蚀。读者应关注官方对比的局限性,并参考独立评测以全面评估模型能力。
Q&A
Grok 4.7 的参数规模是多少?相比上一代增加了多少?
Grok 4.7 的参数规模为 2.1 万亿,比 Grok 4.6 的 1.5 万亿增长了 40%。
Grok 4.7 的 API 定价和 Grok 4.6 一样吗?实际使用成本如何?
基础定价相同:每百万输入 Token 2 美元,输出 6 美元。但 Grok 4.7 完成同一任务消耗的 Token 是 Grok 4.6 的 2.25 倍,且缓存读取价格为每百万 Token 0.5 美元,是 Claude Fable 5 的两倍,因此实际使用成本远高于标价。
Grok 4.7 在跑分上的表现相比 Grok 4.6 有提升吗?
提升非常有限甚至倒退。在 Artificial Analysis Intelligence Index 上,Grok 4.7(xhigh)得分 46,仅比 Grok 4.6(high)的 44 分高 2 分;在 Vals AI 独立评测中,Grok 4.7 得分 54.2%,反而比 Grok 4.6 的 59.2% 低了 5 个百分点。
Grok 4.7 在 Agent 任务上有哪些具体进步?
在 Terminal-Bench 4.0 上得分从 20.3% 提升到 38.0%,几乎翻倍;DeepSWE v1.1 得分 71.0%;AA-Briefcase v1.1 得分 1657 Elo,比 Grok 4.6 提升 111 分,其中分析质量从 1690 Elo 涨到 1994 Elo。
Grok 4.7 的推理速度怎么样?官方宣传是否属实?
官方宣称推理速度是同类模型两倍,但 Artificial Analysis 实测速度仅为 39.3 Token 每秒,被标注为“明显慢”。这可能是由于官方测试均使用 xhigh 高推理档位,导致生成更长的推理链,速度下降。
Grok 4.7 适合哪些使用场景?日常使用划算吗?
Grok 4.7 仅适合重度 Agent 场景,如自动化代码审查、长周期数据处理、复杂文档生成等需要长时间、高难度、多步骤的任务。对于日常对话、写代码、问问题等,Grok 4.6 在同样价格下 Token 消耗更经济,Grok 4.7 的 Agent 优化用不上,性价比低。