内容提要
开源项目 open-jev 用谷歌扩散模型 DiffusionGemma 复现 TypeSafe 闭源 Jev 的结构化决策能力。其核心是 JSON 画布机制:预先冻结 JSON 固定结构,仅在变量槽位注入噪声,经一两步去噪生成合法 JSON,无需逐 token 语法约束。在 Jev 评测集上,两步去噪准确率达 87.8%,接近 Jev 的 90.8%,速度快近 5 倍,GPU 成本降低约八成。分组并行将同文档多问题合并画布,输入 token 减少 86%。
延伸解读
扩散模型做结构化决策的取舍
open-jev用扩散模型并行去噪生成JSON,绕开了自回归模型逐token语法约束的开销,但代价是牺牲了问题间的隔离性。分组并行将同文档多问题合并画布,输入token减少86%,却导致相邻问题的logit相互影响,准确率略低于独立推理。这种取舍在批量分类场景中通常划算,但在需要严格独立判断的任务中可能引入偏差。
准确率差距与统计口径
open-jev两步去噪在Jev评测集上准确率87.8%,与闭源Jev的90.8%相差3个百分点。但open-jev排除了54个无参考答案和17个答案并列的问题,实际评分基数为337,而Jev官方90.8%是否基于相同排除规则并未说明。因此,两者准确率差距可能部分源于统计口径不同,直接对比需谨慎。
概率校准的缺失
open-jev目前只能给出候选之间的相对排序,无法输出校准概率。受限softmax分数因扩散模型logit分布与自回归模型不同,不能当作贝叶斯后验概率使用。而TypeSafe Jev的商业卖点之一正是输出校准概率,这意味着在需要概率阈值决策的场景中,open-jev尚不能直接替代Jev。
速度与成本优势的适用边界
open-jev分组两步方案处理408个问题耗时51秒,GPU成本0.056美元,相比原始方案快近5倍、成本降约八成。但Jev官方8.87秒和0.00846美元是API端到端延迟,包含分支选择和工作流编排,而open-jev的51秒是裸推理时间。因此,速度与成本对比需考虑实现范围差异,open-jev的优势在批量分类场景中更明显。
Q&A
open-jev 是什么?它想解决什么问题?
open-jev 是一个开源实验性推理框架,由独立开发者 JoshuaSP 发布。它利用 Google 的扩散语言模型 DiffusionGemma 进行类型化 JSON 决策,目标是探索开源扩散模型在结构化判断任务上能否接近 TypeSafe AI 的闭源 Jev 系统。
open-jev 的 JSON 画布机制是怎么工作的?
JSON 画布机制预先将固定 JSON 结构 tokenize 并冻结不变部分,只在变量槽位注入随机噪声。去噪过程仅发生在变量槽位,经一两步扩散后,最后用 trie 约束从合法候选路径中挑选 logit 最高的 token,从而保证输出一定是预定义候选之一,无需逐 token 语法约束。
open-jev 在 Jev 评测集上的准确率和速度表现如何?
在 Jev 评测集 337 个有参考答案的问题上,一步去噪准确率 86.1%,两步去噪 87.8%,接近闭源 Jev 的 90.8%。速度方面,分组两步方案跑完 408 个问题仅需 51 秒,比原始方案的 248 秒快近 5 倍,GPU 成本从 0.27 美元降至 0.056 美元,降幅约八成。
分组并行优化是如何降低 token 消耗和成本的?
分组并行将同一文档上的多个决策问题合并到同一张 JSON 画布,文档上下文只编码一次,一次前向传播同时去噪所有字段的变量槽位。例如发票处理案例中,输入 token 从 221 万骤降到 30 万,减少 86%。在吞吐量实验中,单张 H100 达到每秒 30.41 个文档、182.44 个判断,处理 1000 个文档的 GPU 成本仅 0.036 美元。
open-jev 与闭源 Jev 相比还有哪些差距?
主要差距包括:Jev 官方端到端延迟 8.87 秒、API 成本 0.00846 美元,而 open-jev 裸推理 51 秒、0.056 美元;Jev 实现了独立问题隔离和跨画布 KV 缓存复用,open-jev 未实现;Jev 能输出校准概率,open-jev 的受限 softmax 分数只能做相对排序,不能当概率解读;此外,open-jev 排除了 54 个无参考答案和 17 个答案并列的问题,评分基数 337 而非 408,与 Jev 的统计口径可能不一致。
open-jev 在哪些场景下适用?有什么权衡?
open-jev 适用于智能客服路由、发票处理、安全事件分级等批量分类场景。其权衡在于:分组并行共享注意力机制,一个问题去噪时的 token 分布会影响相邻问题的 logit,导致准确率略低于单独推理,牺牲了 Jev 那样的独立问题隔离性,但换来了吞吐量和成本优势,在批量分类场景中通常划算。