推出支持全多模态的 Clef-omni,以及更快的 Clef 和更便宜的 Clef-flash
内容提要
Cloudflare发布多模态决策模型Clef-omni,基于Qwen3-Omni架构,支持文本、图像、音频和视频输入,单次API调用即可完成跨模态判断。Clef-flash降价至每百万输入token 0.038美元,低于Jev,但上下文窗口缩至24k。Clef经SGLang优化后速度提升约1.7至2倍。
延伸解读
多模态决策模型的实际意义
Clef-omni 支持文本、图像、音频和视频输入,单次 API 调用即可完成跨模态判断。这意味着开发者无需再搭建语音转文本、视频抽帧等级联管道,可直接将原始媒体数据送入模型。对于需要同时处理多种媒体类型的场景,如设备安装审核、内容审核等,能显著简化流程并降低延迟。
Clef-flash 降价与上下文窗口的权衡
Clef-flash 价格从每百万输入 token 0.09 美元降至 0.038 美元,但托管版本的上下文窗口从 64k 缩减至 24k。根据 Cloudflare 的使用数据,仅 0.24% 的请求超过 24k token,因此这一调整对大多数用户影响有限。若需处理更长上下文,可改用 Clef(64k)或自行托管权重(支持 256k)。
Clef 速度提升的技术细节
Clef 通过迁移至 SGLang 服务框架,在托管版本上实现了约 1.7 至 2 倍的速度提升。例如,约 800 token 的输入中位延迟从 262 毫秒降至 152 毫秒。这些优化主要在服务基础设施层,未改变模型权重或架构,因此自托管用户也可通过更新 SGLang 启动命令获得类似收益。
基准测试表现与适用场景
在多项基准测试中,Clef-omni 在部分任务上表现优于 Clef 和 Clef-flash,例如 BANKING77 宏 F1 达 94.8,CLINC150+OOS 达 97.7。但在家电、When2Call 等任务上,Clef-flash 反而更优。这表明不同模型各有侧重,用户应根据具体任务选择,而非盲目追求多模态或低价版本。
Q&A
Clef-omni 支持哪些输入模态?
Clef-omni 支持文本、图像、音频(wav 或 mp3)和视频(mp4 或 webm)输入,单次 API 调用即可完成跨模态判断。
Clef-flash 现在的价格是多少?
Clef-flash 的价格已从每百万输入 token 0.09 美元降至 0.038 美元,现在比 Jev 更便宜。
Clef-flash 的上下文窗口有什么变化?
为了降低价格,托管版 Clef-flash 的上下文窗口从 64k 缩减至 24k。但 Hugging Face 上的模型权重未改动,仍支持 256k 上下文,适合自托管。
Clef 模型的速度提升了多少?
经过优化,Clef 模型的速度提升了约 1.7 至 2 倍。例如,约 800 token 的输入中位延迟从 262 毫秒降至 152 毫秒,约 3400 token 的输入从 616 毫秒降至 305 毫秒。
Clef-omni 是基于什么架构构建的?
Clef-omni 基于 Qwen3-Omni-30B-A3B-Instruct 混合专家(MoE)架构,采用其理解主干,并去除了文本转语音输出组件。
Clef 模型在 Cloudflare 内部有哪些应用案例?
Cloudflare 内部团队使用 Clef 进行多种任务:GitHub 文档仓库用其检测并关闭垃圾问题;EmDash 内容管理系统用其审核插件库中的钓鱼内容;数据丢失防护团队用其扫描潜在的个人身份信息(PII);威胁情报团队用其检测恶意域名。