CAR Bench Challenge 技术方案

💡 原文中文,约21300字,阅读约需51分钟。
📝

内容提要

CAR-bench是车载语音Agent基准,含254个任务、58个工具,分为Base、Hallucination、Disambiguation三类。作者提出的“Ground, then Act”方案采用DeepSeek V4 Flash,通过schema、偏好、策略三道门拦截错误,隐藏集Pass³达53.3%,成本极低。冠军方案TRACE利用离线蒸馏技能库,Pass³达70%。文章详述了两种方案的机制、效果及HarnessX框架的进化流程。

🔎

延伸解读

“Ground, then Act”方案的核心思路

作者提出的方案强调在工具调用前通过三道门(schema、偏好、策略)拦截错误,而非依赖更大模型。其核心原则是将策略、schema、状态约束用代码实现,语义边界用小型LLM判别,且被拦截的调用绝不dispatch。这种设计在隐藏集上达到53.3%的Pass³,成本仅为其他方案的1~3%,体现了在有限资源下通过工程手段提升可靠性的思路。

冠军方案TRACE的离线蒸馏与在线注入

TRACE方案与作者方案不同,它不依赖运行时叠加guardrail,而是离线从评测轨迹中蒸馏技能库,在线按对话状态注入相关技能。其关键机制包括:技能按task、type、operation分层组织,通过对比改写实现进化,并设置防过拟合约束(如禁止硬编码任务ID)。这种离线学习与在线检索的结合,使其Pass³达到70%,显著高于作者方案,但成本也更高。

HarnessX框架的进化机制与风险

HarnessX通过meta-agent迭代改进harness配置,其核心是严格的文件契约和决策规程,强调区分harness缺陷与模型能力差距,避免用prompt补丁伪装能力提升。在τ²-bench上,badcase loop在retail任务上从80.7%提升至约96.5%,但该结果基于未全量重跑的估算,且存在过拟合风险。其案例也展示了reward hacking、灾难性遗忘等失败模式,提示进化式方法需谨慎验证。

❓

Q&A

CAR-bench是什么?它主要评估什么?

CAR-bench是车载语音Agent基准,包含254个任务、58个工具和19条车载策略,分为Base、Hallucination、Disambiguation三类,要求Pass³(3次全过)。它评估的不是偶尔成功,而是能否每次都守住边界。

“Ground, then Act”方案的核心思路是什么?

该方案采用DeepSeek V4 Flash,在工具调用前通过schema、偏好、策略三道门拦截错误,将高确定性错误拦在harness中,不依赖更大模型。隐藏集Pass³达53.3%,成本极低。

“Ground, then Act”方案中三道门分别是什么?

三道门包括:schema gate(参数必须符合实际工具接口)、偏好判别器(区分有依据与猜测,猜测则先读偏好)、policy gate(确定性检查策略、顺序和级联后的预测状态)。

“Ground, then Act”方案在公共训练集上的效果如何?

相比官方baseline(47.7%),三门harness将Pass³提升至60.4%,其中Hallucination提升25pp,Disambiguation提升13pp,Base持平,延迟仅增加1.06倍,成本约$0.0011/trial。

冠军方案TRACE的核心机制是什么?

TRACE的核心是离线从评测轨迹中蒸馏一组可检索技能(skill bank),在线时按对话状态注入相关技能。它通过Actor和Curator两个角色,实现技能的创建、改写和选择,最终在隐藏集Pass³达70%。

TRACE如何防止过拟合?

TRACE通过两条约束防止过拟合:operation-level organization(技能写怎样执行一类操作,不写某个task的答案)和de-hardcoding(禁止task id、环境专属取值、记忆答案,只保留可迁移的工具与决策原则)。

HarnessX框架的meta-agent是如何工作的?

HarnessX的meta-agent是一个简单loop,它读取任务说明、历史memo和轨迹,分析失败模式,写出候选假设,然后生成下一版config/processor/prompt,并通过外层runner真实评测,保留或回退。它强调修harness deficiency,不把model capability gap伪装成prompt补丁。

HarnessX在τ²-bench上的效果如何?

HarnessX adapter在telecom上达到86.0%(leaderboard 84.9%),airline 74.0%(72.0%),retail 71.1%(72.4%)。meta-harness badcase loop在retail 114题上从80.7%提升到约96.5%(推算),但需注意该结果未全量重跑验证。

🏷️

标签

➡️

继续阅读