内容提要
DeepSeek V4 Flash通过Autoprompt自动生成提示词,在Terminal-Bench 2.1测试中完成率从67.42%升至82.02%,提升14.61个百分点。Autoprompt规划、构建、测试、审查、修复提示词,减少人工翻译意图的循环,但耗时增3倍、Token翻倍。官方82.7分因框架不同不可直接比较,提升稳定性待验证。
延伸解读
提示词工程的价值被低估
文章数据显示,DeepSeek V4 Flash在模型、参数、训练数据均未改变的情况下,仅通过Autoprompt自动生成提示词,完成率就从67.42%提升至82.02%。这表明提示词的质量对模型表现有显著影响,甚至可能释放模型被低质量提示词锁住的潜力。对于开发者而言,优化提示词或使用自动提示工具,可能比更换模型更具性价比。
框架差异导致分数不可直接比较
Autoprompt在OpenCode框架下测得82.02%,而DeepSeek官方在自研Harness框架下公布82.7%,两者相差0.68个百分点。官方文档明确指出,DeepSeek的分数来自其自身测试设置,不能作为直接比较的第三次运行。因此,读者在对比不同来源的基准分数时,需注意测试框架和配置的差异,避免误读。
自动提示的代价与适用场景
Autoprompt的官方文档估算,使用该工具耗时约为原来的3倍,Token消耗约为2倍。这意味着在追求更高完成率的同时,需付出时间和成本代价。文章建议,对于紧急生产环境bug修复等场景,额外开销可能值得;但对于简单函数编写等低风险任务,则可能得不偿失。开发者应根据任务重要性和资源预算权衡是否使用自动提示。
提升的稳定性尚待验证
Autoprompt带来的14.61个百分点提升,是在Terminal-Bench 2.1的89道题上实现的。但该基准测试本身仍在进化,2.1版本修复了2.0的28道问题。官方也承认小任务上的结果可能相差很大。因此,这一提升在更严格或不同的测试环境下能否保持,尚无数据支持。读者应谨慎看待当前结果,等待更多验证。
Q&A
Autoprompt是什么?它如何提升DeepSeek V4 Flash的编码任务完成率?
Autoprompt是一个自动生成提示词的工具,它通过规划、构建、测试、审查、修复的流程自动生成提示词,而不是直接写代码。在Terminal-Bench 2.1测试中,DeepSeek V4 Flash使用Autoprompt后,完成率从67.42%提升到82.02%,提升了14.61个百分点。
DeepSeek V4 Flash在Terminal-Bench 2.1上的官方分数82.7%与Autoprompt的82.02%有何区别?
DeepSeek官方公布的82.7%是在其自研的Harness框架下测试的,而Autoprompt的82.02%是在OpenCode框架下测试的。两者测试框架不同,不能直接比较。官方文档也指出,82.7%来自DeepSeek自己的测试设置,不能当作可直接比较的第三次运行。
使用Autoprompt的代价是什么?
使用Autoprompt的代价是耗时约为原来的3倍,Token消耗约为原来的2倍。这意味着任务执行时间更长,成本更高。官方也承认这些数字是基于用户体验报告的规划估算,并非实测基准数据。
Autoprompt是如何工作的?它需要用户提供什么?
Autoprompt需要用户提供目标、约束条件和成功标准,例如“修复注册竞态问题并添加回归测试”。它会自动规划、构建、测试、审查和修复提示词,并在遇到需要授权或无法解决的阻塞时停下来询问用户。它接管了将用户意图翻译成提示词的过程。
Autoprompt带来的14.61%提升是否稳定可靠?
目前尚不确定。官方表示小任务上的结果可能相差很大,且Terminal-Bench 2.1本身还在进化,未来更严格的测试环境下提升幅度可能变化。目前还没有实验验证其稳定性。
在什么场景下适合使用Autoprompt?
适合在紧急的生产环境bug修复等场景使用,因为多花时间和Token比宕机强。但对于简单函数编写等小任务,使用Autoprompt可能得不偿失,属于杀鸡用牛刀。