内容提要
Fireworks 在 AI Gateway 上线研究预览模型 Ember-1,基于 Kimi K3,面向编程与智能体工作流。其生成 token 比 Kimi K3 少约 40%,质量相当,可降低输出成本与上下文负担。支持 100 万 token 上下文、文本图像输入、工具调用和隐式提示缓存,端点支持零数据保留与不训练提示,预览期两周。
延伸解读
更少 token 对编程智能体的实际意义
Ember-1 在质量相当的情况下,生成 token 比 Kimi K3 少约 40%。对于需要反复调用模型的编程智能体,更短的推理轨迹能直接降低输出成本,并减少后续步骤需要携带的上下文量。这意味着在长链条任务中,累积的 token 开销和上下文压力都会更小,有助于控制整体使用成本。
研究预览期的限制与数据策略
Ember-1 目前是研究预览模型,初始窗口仅两周。Fireworks 端点支持零数据保留和不训练提示,这对关注数据隐私的团队是一个重要保障。但预览期较短,模型可能随时调整或下线,不适合直接用于对稳定性要求高的生产环境,建议先在小范围测试中评估其表现。
接入方式与现有工作流的兼容性
Ember-1 可通过 API、Claude Code、Codex 和 fx 等渠道调用,模型名称为 fireworks/ember-1。使用 Vercel CLI 的 setup 命令能自动检测已安装的智能体并配置网关连接,之后在智能体中选择该模型即可。AI Gateway 还提供统一的用量与成本跟踪、API 密钥预算和路由规则,方便团队管理调用。
Q&A
Ember-1 是什么模型?
Ember-1 是 Fireworks 推出的研究预览推理模型,基于 Kimi K3 构建,面向编程和智能体工作流。
Ember-1 相比 Kimi K3 有什么优势?
Fireworks 报告称,在质量相当的情况下,Ember-1 生成的 token 比 Kimi K3 少约 40%,可降低输出成本并减少后续步骤携带的上下文量。
Ember-1 支持哪些功能?
Ember-1 支持 100 万 token 上下文窗口、文本和图像输入、工具调用以及隐式提示缓存。
Ember-1 在数据隐私方面有什么保障?
Fireworks 端点支持零数据保留(Zero Data Retention)和不训练提示(No Prompt Training)。
Ember-1 的预览期有多长?
Ember-1 作为研究预览提供,初始窗口为两周。
如何在编程智能体中使用 Ember-1?
使用 Vercel CLI 运行设置命令:npm i -g vercel@latest 和 vercel ai-gateway setup,该命令会检测已安装的智能体、配置 AI Gateway API 密钥并建立连接,然后在智能体模型配置中选择 fireworks/ember-1。