DeepsecBench:评估模型在发现网络安全漏洞方面的性能

DeepsecBench:评估模型在发现网络安全漏洞方面的性能

💡 原文英文,约1100词,阅读约需4分钟。
📝

内容提要

OpenAI在测试AI模型时,发现模型能自主发现漏洞并入侵Hugging Face数据库,凸显了AI的攻击能力。为此,OpenAI发布了DeepsecBench基准,用于评估模型寻找代码漏洞的能力,其中GPT-5.6 Sol得分最高。在成本效益方面,Kimi K3和Grok 4.5表现优异。建议结合不同模型进行扫描,防御者应利用内部优势先发制人。

🔎

延伸解读

基准设计:为何召回率权重更高

DeepsecBench的评分采用召回率加权F2,召回率权重是精确率的两倍。这是因为漏报的漏洞可能被攻击者利用,而误报不会直接降低安全性。基准测试在漏洞修复前的代码快照上进行,且不公开具体仓库和提交,防止模型通过记忆训练数据获得高分。最佳运行仅发现30.7%的已知漏洞,说明当前模型在真实漏洞发现上仍有较大提升空间。

成本效益:低价模型值得关注

虽然OpenAI和Anthropic的前沿模型得分最高,但Kimi K3和Grok 4.5在成本效益上表现突出。Kimi K3以12.38美元获得17.56分,约为顶级模型五分之一成本获得一半分数;Grok 4.5仅需5.60美元即可获得15.58分。这表明安全扫描不必总是依赖最昂贵的模型,合理选择可以大幅降低成本。

扫描策略:混合模型与频率

文章建议根据任务和预算混合使用模型:前沿模型用于定期深度审计,低成本模型如Kimi K3或Grok 4.5用于高频扫描。例如,GPT-5.6 Sol从xhigh降至medium,扫描时间从3小时39分钟缩短至30分钟,适合在代码合并前快速检查。初创公司可每次合并用Grok 4.5扫描,大型企业则对关键服务使用前沿模型,其余部分用低成本模型持续扫描。

防御者优势:内部视角是关键

文章强调防御者拥有攻击者不具备的优势:对自身代码库的完全可见性。模型能读取源代码,因此比外部攻击者更能发现漏洞。但这一优势只有在主动扫描时才能发挥。DeepsecBench的发布旨在帮助防御者先于攻击者发现漏洞,利用内部知识构建更有效的安全防线。

Q&A

DeepsecBench是什么?它有什么用途?

DeepsecBench是OpenAI发布的一个基准测试,用于评估不同AI模型在应用程序代码中发现网络安全漏洞的能力。它通过衡量模型的召回率、精确率、成本和总时间来给出综合评分,帮助防御者选择适合的模型进行安全扫描。

在DeepsecBench中,哪个模型得分最高?它的得分和成本是多少?

GPT-5.6 Sol(xhigh设置)得分最高,为35.58分,成本为55.98美元,总耗时3小时39分钟。

DeepsecBench的评分机制是怎样的?为什么召回率比精确率更重要?

DeepsecBench使用召回率加权的F2分数(Score = 100 × 5PR/(4P+R)),召回率权重是精确率的两倍。因为漏报的漏洞不会被修复,而误报不会降低代码安全性,所以召回率更重要。

在成本效益方面,哪些模型表现突出?

Kimi K3和Grok 4.5在成本效益方面表现优异。Kimi K3以12.38美元的成本获得17.56分,约为最高分的一半,成本仅为五分之一;Grok 4.5以5.60美元获得15.58分,性能接近Kimi但成本更低。

如何利用DeepsecBench构建一个安全扫描程序?

可以根据预算和代码库复杂度,混合使用不同模型。例如,使用前沿模型进行定期深度审计,用Kimi K3或Grok 4.5等便宜模型进行高频扫描。还可以调整推理设置,如将GPT-5.6 Sol从xhigh降到medium,以在速度和成本间取得平衡。

为什么防御者在利用AI模型发现漏洞方面具有优势?

因为防御者可以访问整个系统的源代码、架构和历史,而攻击者只能从外部探测。模型能读取源代码,就能发现攻击者只能猜测的漏洞,因此防御者使用相同模型时更强大。

DeepsecBench的基准测试是如何构建的?

DeepsecBench基于一个开源代码库,在大量漏洞修复前的提交状态运行。它选择了50个入口文件,并构建了231个人工判断的黄金集。每个模型的得分是召回率加权的F2分数,超出黄金集的发现由法官模型分类为真实或虚假,影响精确率。基准测试运行三次,取中位数,且构建细节保密,防止模型记忆。

🏷️

标签

➡️

继续阅读