TypeSafe推出专用判别模型Jev,放弃文本生成,专注分类、评分、路由等判断题,成本比大模型低40至400倍。支持Choice、Score、Noul三种问题类型,可一次请求并行多问。实测与Claude一致率91.5%,但存在不能弃权、不解释、上下文腐烂三大短板。文章还给出其与Langfuse联动自动打分的代码,并讨论System 1与System 2分工。
完成下面两步后,将自动完成登录并继续当前操作。