内容提要
CISPA团队在S&P 2024发表论文,调查六年间150余篇顶会模糊测试论文,发现可复现性差:仅26%提交工件并获徽章,多数自选测试目标且未用统计工具,部分论文实验环境有偏、数据不可靠。报告批评了MemLock、SoFi、DARWIN等论文的评测问题,呼吁采用FuzzBench等公开透明机制。
延伸解读
可复现性危机:数据背后的警示
调查显示,仅26%的论文提交了工件并获得徽章,74%开源了工具,但只有11%公开测试数据。这意味着大多数论文的实验结果难以被独立验证。可复现性差不仅影响研究可信度,也阻碍领域进步。读者应关注论文是否提供完整工件和开放数据,这是评估研究质量的重要指标。
测试目标与基线选择:隐藏的偏差
61%的论文自选测试目标,而非使用FuzzBench等公共测试套件,且平均仅测试9个目标,76%的目标只被一篇论文使用。这导致结果缺乏可比性。此外,35%的论文以AFL为基线,23%未与SOTA比较。选择过时或非代表性目标可能夸大工具效果,读者需警惕实验设计的合理性。
统计方法缺失:随机性下的可靠性挑战
模糊测试具有高随机性,但63%的论文未使用统计工具分析数据,73%未提供置信区间或标准差,15%的论文重复实验少于5次。缺乏统计分析使得结果可能由随机波动导致,而非真实改进。读者应关注论文是否报告多次实验的统计显著性,这是判断结果可靠性的关键。
公开透明机制:FuzzBench与竞赛的启示
报告呼吁采用FuzzBench等公开测试平台,提供公平环境,避免自选目标带来的偏差。参与SBFT等开放竞赛也能验证工具实际效果,如2023年冠军Hastefuzz仅关闭sanitizer就取得优势,凸显部分论文声称的改进可能被夸大。公开仲裁有助于区分真正有价值的研究与炒作。
Q&A
CISPA团队在S&P 2024上发表的论文主要调查了什么?
该论文调查了六年间150余篇顶会模糊测试论文,分析了它们的可复现性、测试目标选择、对比基线、实验环境和数据统计等方面,发现许多论文存在可复现性差、实验设计有偏等问题。
顶会模糊测试论文的可复现性如何?
调查显示,仅26%的论文提交了工件并获得至少一个徽章;74%的论文开源了工具,但只有11%公开了测试数据;36%的论文未提交工件,37%提交了工件但未获徽章。
模糊测试论文在测试目标选择上存在哪些问题?
平均每篇论文仅测试9个目标;76%的目标只被一篇论文测试过,缺乏验证;61%的论文不使用公共测试套件而自选目标,可能导致选择过时或无代表性的目标。
论文中常用的对比基线有哪些?
35%的论文与AFL对比,6%与AFL++对比,5%与libFuzzer对比,23%未与SOTA对比。常用的学术工具包括FairFuzz、Qsym和MOpt。
实验环境方面存在哪些偏差?
15%的论文未描述实验环境;5%使用了有偏的资源分配;5%使用了有偏的初始种子。这些偏差可能导致实验结果不可靠。
数据统计方面有哪些不足?
63%的论文未使用统计工具分析数据;15%的论文重复实验少于5次;73%的论文未提供置信区间或标准差。
报告批评了哪些具体论文?
报告批评了MemLock(使用unique crashes指标)、SoFi(发现的漏洞被作者拒绝)、DARWIN(未提供基线,实际提升仅1.73%)、FUZZJIT(声称33%提升实际低12%)、EcoFuzz(路径数指标但分支覆盖低)、PolyFuzz(初始种子优势273%)、FishFuzz(不公平插桩,实际提升1.69%)。
报告对模糊测试领域提出了哪些建议?
建议采用公开透明的仲裁机制,如Google的FuzzBench项目,提供开放公平的测试环境;参与开放模糊测试竞赛;所有发表的模糊测试论文应在FuzzBench上公开测试。