内容提要
SpaceXAI发布Grok 4.6,距4.5不到一个月。新模型强化自我纠错,在长任务中更频繁检查工作,提升代码生成与代理性能。基准测试显示其多数得分超4.5,但部分仍落后于Anthropic Fable 5 Max和OpenAI GPT-5.6 Sol Max。API定价不变,成本效率突出,并已集成至Cursor和Grok Build,支持长期代理任务。
延伸解读
自我纠错成为新训练重点
Grok 4.6的训练不再只追求首轮生成正确代码,而是通过强化学习奖励完成整体任务,鼓励模型在长任务中暂停检查工作。这种训练方式的转变反映了编码模型竞赛的新方向:不仅要求生成质量,更要求模型具备发现并修正错误的能力,以维持长任务的连贯性。
基准测试的解读需谨慎
虽然Grok 4.6在多个基准上超越前代,但在DeepSWE、Terminal-Bench等测试中仍落后于Anthropic Fable 5 Max和OpenAI GPT-5.6 Sol Max。不同基准侧重不同能力,如CursorBench与Cursor环境相关,而DeepSWE和Terminal-Bench评估仓库操作和终端使用。开发者选择模型时应结合具体应用场景,而非仅看单一分数。
成本效率不能只看token价格
Grok 4.6的API定价与4.5相同,标准版每百万输入token 2美元、输出6美元,低于GPT-5.6 Sol Max。但长期代理任务的总成本还取决于工具调用、文件重读和任务重启次数。一个token价格低的模型可能因低效而增加总成本,反之亦然。因此,衡量完成整个任务的成本比单纯比较token价格更有意义。
Q&A
Grok 4.6 相比 Grok 4.5 有哪些主要改进?
Grok 4.6 强化了自我纠错能力,在长任务中更频繁地检查工作,提升了代码生成与代理性能。训练上采用了更长的补充训练,结合模型生成的推理和技术材料与工程数据,并改变了优化器和训练配方。
Grok 4.6 在基准测试中的表现如何?
Grok 4.6 在多数基准测试中得分超过 Grok 4.5,例如 CursorBench v3.2 得分 69.9%(4.5 为 66.7%),DeepSWE v1.1 从 54% 升至 65.9%,FrontierCode v1.1 Extended 得分 61.3%,Terminal-Bench v3.0 从 15.7% 升至 26%,APEX-Agents 从 47.1% 升至 57.5%。但部分测试仍落后于 Anthropic Fable 5 Max 和 OpenAI GPT-5.6 Sol Max。
Grok 4.6 的 API 定价是多少?
Grok 4.6 的 API 定价与 Grok 4.5 相同:每百万输入 token 2 美元,每百万输出 token 6 美元。更快的变体价格翻倍。
Grok 4.6 在成本效率方面表现如何?
Grok 4.6 的标准模型 API 成本不到 GPT-5.6 Sol Max 的一半。在 Artificial Analysis 的 Intelligence-versus-Cost-per-Task 帕累托前沿上,Grok 4.6 每任务成本为 0.84 美元。在 AA-Briefcase 测试中,Grok 4.6 完成评估约需 53 轮,消耗约 5 亿输入 token,而 Claude Opus 5 Max 需要约 103 轮和 20 亿 token。
Grok 4.6 在哪些平台可用?
Grok 4.6 可通过 SpaceXAI API、OpenRouter、Vercel 和 Cloudflare 使用,也可通过 Grok Build 和 Cursor 访问。
Grok 4.6 与竞争对手(如 GPT-5.6 Sol Max 和 Fable 5 Max)相比如何?
Grok 4.6 在 CursorBench 上领先 GPT-5.6 Sol Max(69.9% vs 67.2%),但落后于 Fable 5 Max(70.5%)。在 DeepSWE 上落后于两者(65.9% vs 73% 和 70%)。在 FrontierCode 上略超 Sol(61.3% vs 60.6%),但低于 Fable(63.6%)。在 Terminal-Bench 上明显落后(26% vs 34.6% 和 34.1%)。总体而言,Grok 4.6 在部分测试中具有竞争力,但在某些编码和终端测试上仍不如对手。
Grok 4.6 的训练方法有何特别之处?
Grok 4.6 采用了更长的补充训练,结合模型生成的推理和技术材料与工程数据,并改变了优化器和训练配方。使用 Grok 4.5 重新生成监督微调轨迹,覆盖不同推理设置、代理框架和领域(如 STEM、软件工程和知识工作),并通过基于模型的检查移除有问题的轨迹。强化学习扩展到通用编码、内核优化、Web 开发和计算机辅助设计,奖励完成整个任务而非仅生成代码块。
Grok 4.6 在长任务中的表现如何?
Grok 4.6 在长任务中更频繁地检查工作,自我纠错能力增强。在 APEX-Agents 上得分从 47.1% 提升至 57.5%,在 AA-Briefcase 上完成评估约需 53 轮,消耗约 5 亿输入 token,而 Claude Opus 5 Max 需要约 103 轮和 20 亿 token。