Grok 4.5 对比 Claude Opus 4.8:成本与实效,而非规格表

Grok 4.5 对比 Claude Opus 4.8:成本与实效,而非规格表

💡 原文英文,约1500词,阅读约需6分钟。
📝

内容提要

xAI发布Grok 4.5,宣称在编码任务上以约四分之一token数匹配Claude Opus 4.8,价格更低。测试显示两者代码结果几乎相同,但Grok用23%的token、三分之一时间完成,成本仅约2美元,而Opus需5.14美元。尽管Opus在文档上更细致,Grok在效率和成本上优势明显,适合关注token消耗的开发者。

🔎

延伸解读

测试方法说明

本文的对比基于三个具体任务,且使用了Cursor的混合token计数,而非原始API数据。Grok运行在“快速”档,Opus在“思考”档,后者会消耗更多token用于推理。此外,Grok的价格享受了50%的促销折扣。因此,实际成本差异可能略小于文中数据,但即便按全价计算,Grok仍具成本优势。

基准测试的局限

虽然xAI宣称Grok 4.5在编码上匹配Opus 4.8,但SWE-Bench Pro(更难的基准)显示Opus仍占优。本文的测试也发现,在小型任务上Opus更快更省token,而Grok在中大型任务上优势明显。这表明模型性能因任务而异,单一基准或少量测试不足以全面评估。

成本与效率的权衡

在三个任务中,Grok使用约23%的token、三分之一的时间完成了与Opus几乎相同的代码,成本约为2美元(含促销)对比Opus的5.14美元。对于关注token消耗的开发者,Grok可能更具吸引力。但Opus在文档和测试覆盖上更细致,若项目对文档要求高,Opus的额外成本或许值得。

Q&A

Grok 4.5 在编码任务上相比 Claude Opus 4.8 的 token 消耗和成本优势有多大?

在测试中,Grok 4.5 完成相同编码任务所用的 token 数约为 Opus 的 23%,时间约为三分之一,成本约为 2 美元(含 50% 促销),而 Opus 需要 5.14 美元。

Grok 4.5 和 Claude Opus 4.8 在代码质量上有什么不同?

在三个编码任务中,两者生成的代码几乎相同,但 Opus 在文档方面更细致,例如在添加新功能时更新了 man page,而 Grok 没有。

Grok 4.5 的定价是多少?

Grok 4.5 的定价为每百万输入 token 2 美元,每百万输出 token 6 美元。

Grok 4.5 在哪些基准测试中表现如何?

在 Terminal-Bench 2.1 上,Grok 4.5 得分 83.3%,高于 Opus 4.8 的 78.9%;但在 SWE-Bench Pro 上,Opus 仍然领先。

xAI 发布 Grok 4.5 的市场定位是什么?

xAI 的定位是“以更低的成本提供与 Opus 4.8 相当的编码能力”,旨在吸引关注 token 消耗的开发者,并可能抢占 Anthropic 的市场份额。

测试中 Grok 4.5 和 Claude Opus 4.8 在具体任务上的表现如何?

在 bug 修复任务中,两者给出了相同的修复,但 Opus 更快;在重构任务中,两者结果相同,但 Grok 更高效;在添加新功能任务中,Opus 更细致,但 Grok 更节省 token 和成本。

🏷️

标签

➡️

继续阅读