内容提要
Fireworks于9月23日发布研究预览版Ember-1,基于Kimi K3构建,宣称用约少40%的token达到同等质量。实测三轮任务中,Ember-1准确率与Kimi K3几乎持平(15次中14次正确),推理token少23%,速度快3.4倍,Fireworks上总成本低24%。但Kimi K3可经其他供应商以更低价格调用,反而更便宜。
延伸解读
速度优势明显,但成本优势并非绝对
Ember-1在测试中比Kimi K3快3.4倍,且总成本低24%,但这基于Fireworks的定价。Kimi K3可通过其他供应商以更低价格调用,最低每百万输入token 1美元、输出9美元,相同任务成本仅1.96美元,低于Ember-1的2.48美元。因此,若对速度要求不高,Kimi K3可能更经济。
准确率几乎持平,但Ember-1出现一次算术失误
在15次运行中,Kimi K3全部正确,Ember-1仅一次失误,源于概率测试中的算术错误(0.94619 vs 0.94629),并影响后续答案。尽管失误率低,但在高精度场景下,这种小错误可能被放大,需关注模型在复杂计算中的稳定性。
推理token减少,但未达宣传的40%
Ember-1平均减少23%的推理token,低于其宣称的40%。在三个测试中,减少比例分别为18%、16%和35%,说明节token效果因任务难度而异。对于简单任务,节省比例较低,用户需根据实际负载评估成本收益。
适用场景:速度优先选Ember-1,成本优先选Kimi K3
若需要快速响应且能接受略高成本,Ember-1是更好选择;若时间充裕且追求最低成本,可通过OpenRouter选择Kimi K3的廉价供应商。但需注意,廉价供应商的速度未经验证,可能更慢。用户应根据自身对延迟和预算的敏感度权衡。
Q&A
Ember-1 是什么?它和 Kimi K3 有什么关系?
Ember-1 是 Fireworks Research 于 9 月 23 日发布的研究预览版模型,基于 Moonshot 的开源权重模型 Kimi K3 构建。它声称能用大约少 40% 的 token 达到与 Kimi K3 相同的质量。
Ember-1 相比 Kimi K3 在速度和成本上具体表现如何?
在 Fireworks 上实测,Ember-1 完成每轮测试的速度比 Kimi K3 快 3.4 倍,推理 token 少 23%,总成本低 24%(2.48 美元 vs 3.26 美元)。但 Kimi K3 可通过其他供应商以更低价格调用,最低每百万输入 token 1 美元、输出 9 美元,此时相同任务成本仅 1.96 美元,反而比 Ember-1 便宜。
Ember-1 的准确性是否真的与 Kimi K3 几乎相同?
在 15 次测试中,Kimi K3 全部正确,Ember-1 正确 14 次。Ember-1 唯一一次错误是在概率测试中因算术失误(0.94619 写成 0.94629)导致后续两个答案也出错。总体准确率几乎持平。
Ember-1 减少推理 token 的原理是什么?
Fireworks 表示 Ember-1“学会了削减不必要的推理,同时保留重要的思考”。由于推理 token 按输出计费,减少推理 token 可以降低成本。
在什么情况下应该选择 Ember-1 而不是 Kimi K3?
如果你想要与 Kimi K3 几乎相同的结果,但速度要快得多,就选择 Ember-1。如果你有足够时间且想支付更少费用,Kimi K3 通过更便宜的供应商调用可能更划算。
Ember-1 的测试是如何进行的?
测试通过 OpenRouter 调用两个模型,均路由到 Fireworks 以公平比较速度。使用相同提示和默认推理设置,每个测试运行五次,分别记录推理 token 和其他输出。答案在模型看到之前用两种独立方法确认。