内容提要
“Jev工程学”提出智能体三层架构:大模型负责生成,Jev负责决策,代码负责执行。Jev是专用决策模型,通过Choice、Score、Noul三种类型化接口输出带概率与置信度的结构化答案,消除解析歧义。核心方法包括状态即证据、问题即契约、置信度门控、闭环验证及七大工程法则。实战显示其可大幅提速降本,如0.7秒完成777项审查、3.5美分处理500封邮件。
延伸解读
决策层独立的价值:从黑盒到可调试
文章指出,将生成、决策、执行混在同一模型调用中,会导致故障无法定位。Jev 将决策职能剥离为类型化接口,使每次失败都能归因到具体层级。这种解耦不仅提升可调试性,也让各层可独立测试与替换。对开发者而言,这意味着架构设计时应优先明确决策边界,而非依赖单一模型的通用能力。
类型化契约如何消除解析脆弱性
Choice、Score、Noul 三种原语强制输出结构化答案,附带概率与置信度,从根源上避免了自由文本解析失败。文章强调,问题必须原子化且准则客观可观测,否则路由会模棱两可。这提示工程实践中,应把提示词工程转化为契约设计,用显式字段替代隐含指令,从而提升系统稳定性。
置信度门控与闭环验证的工程纪律
文章提出按风险分级设置置信度阈值,低风险可自动放行,高危操作必须人工审批。同时强调“无证据完工”是最大反模式,模型声称完成不等于事实完成,必须物理探查外部状态。这要求系统设计时保留兜底分支,并将验证作为独立环节,而非依赖模型自我报告。
成本与适用边界:并非万能解
文章通过反例说明,若前置数据处理膨胀,整体成本可能不降反升。Jev 适用于答案空间有界且高频重复的决策,而开放式创作、确定性计算仍应交给大模型或代码。开发者需以端到端单任务总成本为评估指标,避免仅关注单次决策单价,同时注意类型化输出不能免疫提示词注入。
Q&A
Jev工程学提出的智能体三层架构分别是什么?
三层架构为:大模型负责生成,Jev负责决策,代码负责执行。大模型负责深入研究、起草内容与生成摘要;Jev负责评估选项、对相关性打分并把控执行门控;代码负责路由转发、逻辑检查、接口执行与状态验证。
Jev的三种类型化决策接口分别是什么,各自返回什么?
Choice(单选)返回唯一胜出项加概率分布和置信度;Score(评分)返回标尺评分区间加概率分布和置信度;Noul(二值概率)返回为“是”的概率值(0到1)。
Jev工程学的七大工程法则有哪些?
1.传递证据,而非提示词;2.将问题写成契约;3.每步执行后重建选项;4.单次调用合并提问;5.基于置信度进行门控;6.在代码中做检查,而非在模型中;7.按完整任务核算成本。
Jev的置信度门控如何根据风险设置阈值?
低风险内部打标分类达到0.70即可自动放行;浏览器端自动化操作通常需0.85以上;涉及公开发布、支付或删除数据的高危操作,必须要求确定性代码规则检查加上人工最终审批。
Jev在规模化内容质量审查中的表现如何?
在27篇真实文章与10个合成样本、21项质量检查规则下,Jev在不到0.7秒内产出777项判断结果。处理每个段落的延迟中位数仅0.35秒,比Fable在高推理模式下快约25倍,成本便宜580倍。
Jev工程学中最大的反模式是什么,如何修复?
最大反模式是“无证据完工”(DONE Without Proof),即仅因模型声称任务完成就采纳。修复方案是每次模型主张完工后,必须重新读取外部产物并强制运行自动化验收测试。
Jev与通用大模型调用在输出形式和解析开销上有何区别?
Jev输出数值概率、分布区间和置信度,无解析开销;通用大模型输出自由格式的非结构化散文,需要繁复的正则表达式、JSON字段提取和解析重试。
Jev在邮件自动分流案例中的最终成效如何?
系统在数秒内完整处理了500封邮件,总API成本仅3.5美分。人工审核队列大幅收缩,技术人员只需聚焦于真正模棱两可的棘手个案。