内容提要
Databricks团队在401个真实任务上评估了Genie Code与三款主流编码代理,结果显示Genie Code准确率最高(76.6%),成本最低(每任务0.55美元),约为竞争对手一半。其优势在于通过语义搜索和持久记忆高效定位数据,平均仅需8.3次工具调用,避免了低效探索。研究挑战了“更高成本带来更高准确性”的传统观念,强调数据代理需适应动态环境。
延伸解读
成本与准确率并非必然权衡
传统观点认为,更高的准确性需要更多探索和token消耗,但该评测显示,Genie Code在准确率最高(76.6%)的同时,每任务成本仅为0.55美元,约为最接近竞争对手的一半。这打破了“高成本换高准确率”的常规认知,表明在数据代理场景中,效率提升可以同时改善准确性和成本。
数据代理的核心挑战:发现与记忆
数据代理面临动态工作区中数百上千资产(如表、笔记本、仪表板)的发现难题,且元数据可能过时或矛盾,缺乏编码代理依赖的可验证测试。Genie Code通过语义搜索和持久记忆,平均仅需8.3次工具调用即可定位数据,而通用编码代理常陷入低效探索,导致超时和成本飙升。
评测方法的关键细节
评测基于401个真实内部任务,每个代理有20分钟墙钟时间,超时即失败。成本为估算值,相对意义更大。Genie Code的p99成本为2.72美元,最贵任务3.87美元,仅4%任务超过2美元;而其他代理有33-40%任务超过1美元,最贵达9.49美元。这些差异主要源于发现任务的效率。
Q&A
Genie Code在Databricks的评估中准确率和成本表现如何?
在401个真实任务上,Genie Code的准确率为76.6%,平均每个任务成本为0.55美元,均优于三款主流编码代理。
为什么Genie Code比通用编码代理更高效?
Genie Code利用语义搜索、持久记忆和对企业上下文的深度理解,能够快速定位数据资产,平均仅需8.3次工具调用,避免了通用代理低效的探索过程。
数据代理面临哪些独特挑战?
数据代理需要在动态变化的工作区中(如Databricks)发现正确的资产,处理过时或矛盾的元数据,并确定数据源的真实性,且缺乏编码代理依赖的可验证测试。
评估中其他编码代理的表现如何?
三款编码代理的准确率分别为72.1%、55.9%和56.1%,平均每任务成本为1.09美元、0.91美元和1.16美元,均高于Genie Code。
Genie Code的成本分布是怎样的?
中位数任务成本为0.34美元,p99为2.72美元,最贵任务为3.87美元,仅4%的任务超过2美元。
Genie Code在发现类任务中如何避免低效探索?
Genie Code通过语义搜索和持久记忆直接定位所需资产,无需像通用代理那样进行随机探索,从而减少了工具调用次数和成本。
Genie Ontology在评估中是否被使用?
Genie Ontology在评估中被禁用,因为尚未对所有客户开放,但预计会进一步增强Genie Code的优势。