推出 Clef:我们的开源决策模型,以及全新的强化学习微调平台
内容提要
Cloudflare 在 Workers AI 上发布开源决策模型 Clef 与 Clef-flash,可快速输出带概率的结构化分类结果,用于智能体决策,速度约为通用大模型两倍,支持图像与 64k 上下文。模型以 Qwen 为基座,采用非自回归直接评分,在多项基准测试中领先。Cloudflare 同时推出强化学习微调服务,支持客户定制模型。
延伸解读
决策模型与通用大模型的分工
文章指出,决策模型如Clef专注于输出带概率的结构化分类结果,适合智能体在需要快速决策的环节使用;而通用大模型则擅长开放式推理和生成。两者并非替代关系,而是互补。Clef在延迟和确定性上优势明显,但通用大模型在复杂推理和工具调用上仍不可替代。读者应根据任务需求选择合适模型,或将两者结合,例如用Clef做快速分类,再用大模型执行后续动作。
Clef在性能与功能上的差异化
相比同类决策模型,Clef具备视觉编码器,可处理图像分类,而Jev目前仅支持文本。Clef的上下文窗口为64k,高于Jev的32k,能容纳更多输入状态。在多项基准测试中,Clef和Clef-flash表现领先,尤其在延迟上优势显著。但文章也显示,在某些特定任务如When2Call和PhishNChips上,其他模型可能更优。因此,选择时需结合具体场景权衡。
强化学习微调服务的价值与限制
Cloudflare推出强化学习微调服务,允许客户基于自有数据定制Clef,以提升特定领域准确率。微调可能牺牲部分通用性能,但换来更精准的决策。该服务目前通过前向部署工程师团队提供,未来将推出自助平台。微调依赖客户数据,且需通过AI Gateway等组件构建流程。对于有大量标注数据且需求明确的企业,这能显著提升自动化效率,但初期门槛较高。
Q&A
Clef 是什么?它和普通大语言模型有什么区别?
Clef 是 Cloudflare 训练并开源的决策模型,托管在 Workers AI 上。它输出带概率的结构化分类结果,用于智能体决策,速度约为通用大模型两倍。与 LLM 不同,Clef 是非自回归的,直接对有效模式选项进行评分,不生成中间文本,因此更快、更确定。
Clef 和 Clef-flash 在性能上有什么差异?
Clef 是更强大的精度模型,适合需要高准确率的场景;Clef-flash 则针对延迟关键型决策优化,速度更快。例如在延迟基准中,Clef-flash 的中位延迟为 38.8 毫秒,而 Clef 为 209.3 毫秒。两者在多项基准测试中表现各异,Clef-flash 在某些任务上甚至优于 Clef。
Clef 模型是如何训练的?
Clef 以 Qwen 为基座(Clef 使用 Qwen3.8-27B,Clef-flash 使用 Qwen3.5-9B),冻结基座后联合优化路由头和 rank-256 低秩适配器。训练采用标签平滑交叉熵和 Brier 损失来校准概率,并使用内部合成数据集。此外,还开发了强化学习校准决策(RLCD)作为二次优化目标,提升准确性和泛化能力。
Clef 支持哪些输入类型和上下文长度?
Clef 具有视觉编码器,可以处理图像分类,同时支持文本分类。它的上下文窗口为 64k,比 Jev 的 32k 更大,允许用户输入更多状态信息供模型分类。
Cloudflare 提供的强化学习微调服务是什么?
Cloudflare 推出强化学习(RL)微调服务,允许客户定制 Clef 模型以适应特定用例。初期由前向部署工程师(FDE)团队提供手把手服务,后续将推出自助平台,客户可以捕获数据、微调并重新部署模型,全部在 Cloudflare 平台上完成。该服务利用 AI Gateway、Workers AI、Containers 和 Trainer 等组件。
Clef 在基准测试中的表现如何?
Clef 在 Jev Decision Index 上领先,并在多项基准测试中表现优异。例如,在 BFCL 案例精确度上 Clef 达到 98.47,Clef-flash 达到 98.76;在 API-Bank 准确率上分别为 91.93 和 93.11。在 43 项评估中,Clef 模型在延迟上击败了大多数决策模型(除 Laya 外),中位延迟为 209.3 毫秒(Clef)和 38.8 毫秒(Clef-flash)。