内容提要
Jev模型在OpenRouter分类请求中占27%份额,超过DeepSeek V4 Flash。它不生成文本,仅返回结构化判断,延迟低且成本为对手六分之一。创始人Diogo Almeida针对RLHF模式坍缩问题,用RLCD训练出概率校准的决策模型。但开源小模型可蒸馏其能力,纽约大学测试显示其在14/18个任务上落后于大模型。
延伸解读
分类任务专用化的价值
Jev在OpenRouter分类请求中占据27%份额,超过DeepSeek V4 Flash,核心原因在于分类任务只需判断而非生成。大语言模型逐Token生成文本的方式在分类场景中浪费了时间和成本,而Jev直接返回结构化判断,延迟70-500毫秒,输入成本仅为对手六分之一。这提示开发者,在自动化决策场景中,专用决策模型可能比通用大模型更合适。
RLCD训练与概率校准的意义
Jev创始人Diogo Almeida针对RLHF的模式坍缩问题,采用RLCD训练,使模型输出的概率与真实频率对齐。例如,模型说20%概率的事情,实际应在20%情况下正确。这种校准能力让开发者可以设置阈值,高概率自动处理,低概率转交大模型复核。与RLHF追求人类满意不同,RLCD让模型更适合被代码可靠调用,这为自动化流程提供了可量化的决策依据。
蒸馏风险与开源替代
Jev的能力可被蒸馏到小模型。有开发者用Jev训练微型贪吃蛇AI,一致率达93%,速度快800倍,成本为零。开源模型Laya在Hugging Face热门榜登顶,本地运行速度比云端Jev快近20倍。但蒸馏会丢失概率校准能力,小模型只给硬标签而非概率分数。这意味着Jev的27%份额可能被自训练小模型蚕食,其市场地位面临开源替代的挑战。
性能局限与混合方案
Jev并非万能。官方文档指出其在数字、日期和对抗性内容上表现不佳。纽约大学阿布扎比团队在18个计算社会科学分类任务中发现,Jev在14个上输给最强LLM,中位数差距11.6个macro-F1点,甚至在共情判断任务中高置信度却接近随机准确率。但研究也显示,决策模型配合大模型的两段式标注,成本仅为纯大模型的四分之一到一半,准确率持平或更好。这提示分类任务可能走向混合方案。
Q&A
Jev在OpenRouter分类请求中占多少份额?超过了哪个模型?
Jev占据OpenRouter分类请求每周请求量的27%,超过了此前排名第一的DeepSeek V4 Flash,后者份额约为Jev的一半。
Jev模型和传统大语言模型在分类任务上的工作方式有什么不同?
Jev不生成任何文本,直接返回结构化的判断结果(如选项、分数或概率值),延迟70到500毫秒,输入每百万Token仅0.042美元,输出免费。而传统大语言模型如DeepSeek V4 Flash需要逐Token生成文本,再从文本中提取答案,成本更高、延迟更大。
Jev创始人Diogo Almeida为什么要开发Jev?他看到了RLHF的什么缺陷?
Diogo Almeida是OpenAI早期RLHF核心贡献者,他发现RLHF存在模式坍缩问题:模型学会讨好人类而非诚实回答,且概率校准严重失真(说90%确定时实际准确率可能只有60%)。这导致模型在自动化决策场景中不可靠。他因此开发Jev,采用RLCD训练,让模型输出校准的概率,适合被软件直接调用。
什么是RLCD?它和RLHF在训练目标上有什么根本区别?
RLCD全称“面向校准决策的强化学习”,训练目标是让模型输出的概率等于真实发生的频率,即说20%概率的事情就在20%的情况下是对的。而RLHF的训练目标是让模型输出人类喜欢的回答,导致模型依赖人类做最终判断。RLCD把代码放进了训练目标,让模型天生适合被软件直接调用。
用Jev蒸馏训练小模型有什么好处和风险?
好处:小模型可以继承Jev的判断能力,推理速度极快(如快800倍)、成本为零,在特定任务上表现甚至超过Jev(如贪吃蛇游戏得分高5倍)。风险:小模型只学会表面判断,学不会Jev的概率校准能力,只能输出硬标签而非概率分数,在需要阈值决策的场景中价值降低。
Jev在分类任务上有什么局限性?纽约大学的测试结果如何?
Jev官方文档坦承在数字、日期和对抗性内容上表现不佳。纽约大学阿布扎比团队在18个计算社会科学分类任务上测试,Jev在14个任务上输给同任务最强LLM,中位数差距达11.6个macro-F1点。在“同伴支持对话中的共情判断”任务上,Jev报告高置信度但准确率接近随机水平。
OpenRouter的Auto Router是如何工作的?Jev的份额可能受什么影响?
Auto Router先将请求分类为约30种任务类型,再根据过去七天各模型在每类任务中的消费份额,将请求路由给该类别中开发者花钱最多的模型。Jev在分类请求中占27%,但OpenRouter自身可能也在用类似决策模型做路由。此外,开源小模型如Laya可能蚕食Jev份额,纽约大学研究显示决策模型配合大模型的两段式流程成本更低、准确率持平,可能影响未来份额。