85万行代码审计实测:本地DeepSeek先输后平GPT-5.6

85万行代码审计实测:本地DeepSeek先输后平GPT-5.6

💡 原文中文,约4300字,阅读约需11分钟。
📝

内容提要

作者用85万行代码库实测本地DeepSeek V4与云端GPT-5.6的审计能力。首轮GPT发现32个漏洞,DeepSeek仅8个且5个错误,原因是工具链配置缺陷:代理指令过期、缺乏证据验证、回合预算不足。修复后DeepSeek准确率从37%升至近90%,找到GPT遗漏的问题。结论:本地模型适合边界明确任务,前沿模型擅长跨层综合,工具链比模型权重更关键。

🔎

延伸解读

工具链配置比模型权重更关键

实验显示,DeepSeek首轮表现差并非模型能力不足,而是工具链配置缺陷:代理指令过期、缺乏证据验证、回合预算不足。修复后准确率从37%升至近90%,且未更换模型权重。这提醒我们,在评估本地模型时,应先检查工具链是否完善,而非直接归咎于模型。

本地模型与前沿模型的适用场景

作者指出,前沿模型擅长跨层综合,适合大规模代码审计;本地模型在边界明确的任务中性价比高,如客户代码审计、文档处理等。建议采用混合模式:用前沿模型做规划和架构,本地模型处理实现,再请前沿模型审查结果,以平衡成本与质量。

如何排查工具链问题

作者建议,若本地模型表现不佳,应检查对话日志,关注模型可用的工具、指令是否有效、回合预算是否充足。例如,工具名变更导致指令未注入、预算限制导致分析中断等。通过修复这些问题,可显著提升模型输出质量。

常见问题

在85万行代码审计实验中,DeepSeek V4和GPT-5.6的首轮表现如何?

首轮GPT-5.6在24分钟内发现32个漏洞,全部属实;DeepSeek V4只发现8个,其中5个是错误编造的。

为什么DeepSeek V4首轮审计表现不佳?

主要原因是工具链配置缺陷:代理指令过期(工具名不匹配)、缺乏证据验证机制、回合预算不足(8轮)导致分析被截断。

修复工具链后,DeepSeek V4的审计准确率提升到了多少?

修复后准确率从37%提升到接近90%,错误发现从5个减少到2个,且找到了GPT遗漏的2个真实问题。

本地模型DeepSeek V4和前沿模型GPT-5.6在代码审计中各有什么优势和劣势?

GPT-5.6擅长跨层综合,能发现前后端不一致等深层问题,但成本高;DeepSeek V4修复后能覆盖GPT三分之二的发现,成本低、数据本地化,但可能不够全面。

作者认为工具链和模型权重哪个更重要?

作者认为工具链比模型权重更关键,因为同一模型权重仅通过修复工具链配置,准确率就从37%提升到接近90%。

作者建议如何结合使用本地模型和前沿模型?

作者建议用前沿模型做规划和架构设计,将边界明确的实现工作交给本地模型,再用前沿模型审查结果,以在关键节点获得前沿判断力,同时降低中间环节成本。

作者在实验中发现了哪些工具链配置问题?

三个问题:代理指令过期(工具名不匹配)、没有证据合约(模型未验证断言)、回合预算不足(8轮限制)。

作者如何解决DeepSeek“说完就停”的问题?

作者教会工具链检测该模式(回合结束、未调用工具、最后一句是陈述性意图),自动发送“继续”指令,并设置上限防止卡死。

🏷️

标签

➡️

继续阅读