开源Nimble:一个号称“开放式Jev”决策模型

开源Nimble:一个号称“开放式Jev”决策模型

💡 原文中文,约4100字,阅读约需10分钟。
📝

内容提要

Bespoke Labs开源9B决策模型Nimble,采用“系统一”方式,一次前向传播直接输出类型化答案及概率,两天训练完成,在324条样本上准确率90.12%,超过未微调27B模型,可在MacBook本地运行。但其概率未经校准,评测集小且为合成数据,模式扁平、字段独立评分,并非真正的Jev替代品。

🔎

延伸解读

概率输出不等于置信度

Nimble 输出的概率来自模型内部 logits 的 softmax 归一化,并非经过校准的真实正确率。README 明确说明 0.9 的概率不意味着 90% 正确。如果正确答案不在候选选项中,模型仍会给出高概率,因为它只在给定选项间分配权重。因此,使用时应将概率视为相对偏好,而非可靠置信度,必要时加入“以上都不是”选项。

评测集小且为合成数据,泛化能力存疑

Nimble 的评测仅基于 324 条留出样本,且全部由模型生成并校验,未经人工复审。训练集覆盖 10 个类别,但留出集只覆盖 6 个。90.12% 的准确率只能说明微调在特定合成数据上有效,无法证明在真实场景或未见类别上的泛化能力。评测的“正确答案”本身也可能存在错误。

扁平模式与独立评分限制复杂决策

Nimble 的模式必须是扁平的,不支持嵌套字段,每个枚举字段最多 26 个选项,每个提示最多 2048 token。更关键的是,每个字段独立评分,一个字段看不到另一个字段的答案。如果决策逻辑需要跨字段一致性检查(如 A 为真则 B 应为假),模型无法处理,必须由外部代码实现。

与开源 Jev 替代品的核心差异

多数开源 Jev 替代项目只提供推理框架,不训练模型,直接读取现有模型的 logits。Nimble 则发布了微调后的 9B 模型权重,因此其 90.12% 的准确率是微调后的成绩,而非即插即用的通用结果。这既是它的核心资产,也意味着其性能高度依赖特定训练数据和任务家族,迁移到其他领域的效果未知。

Q&A

Nimble是什么?它和Jev有什么关系?

Nimble是Bespoke Labs开源的一个9B类型化决策模型,号称是“开放式Jev”的替代方案。它采用“系统一”方法,一次前向传播直接输出类型化答案及概率,无需生成推理过程。

Nimble的准确率如何?和更大模型相比怎么样?

在324条留出样本上,Nimble准确率达到90.12%,超过未微调的27B模型Qwen3.8的84.88%,也比未微调的9B底座模型Qwen3.5-9B的66.36%高出近24个百分点。

Nimble输出的概率可以直接当作置信度使用吗?

不能。Nimble的概率只是将候选答案的logits通过softmax归一化,并非校准过的正确率。0.9的概率不意味着90%的正确率,如果正确答案不在选项中,概率依然会显示。建议添加“以上都不是”选项。

Nimble有哪些使用限制?

Nimble只能处理文本,模式必须扁平无嵌套,每个枚举字段最多26个选项,每个提示最多2048个token。每个字段独立评分,无法检查字段间的一致性。

Nimble的评测集有多大?评测结果可靠吗?

评测集只有324条样本,来自6个源家族,且全部为合成数据,未经人工复审。虽然能说明微调有效,但不足以证明泛化能力,且正确答案本身可能包含错误。

Nimble可以在本地运行吗?速度如何?

可以。Nimble支持MLX(苹果芯片)和CUDA(NVIDIA GPU)。在M5 Pro 64GB上,324条样本的中位延迟为444毫秒;在H100上为106毫秒。

Nimble和其他开源Jev替代项目有什么不同?

其他项目如openjev、mini-jev等大多是基于现有模型的推理框架,不训练模型。Nimble则发布了微调过的9B模型(基于Qwen3.5-9B),其评测成绩是微调后的结果,而非即插即用的推理框架。

🏷️

标签

➡️

继续阅读