告别糟糕的基准测试:面向生产级研究的工具

告别糟糕的基准测试:面向生产级研究的工具

💡 原文英文,约1100词,阅读约需4分钟。
📝

内容提要

Qdrant发布全球最大开源向量搜索基准数据集Qdrant-FineWeb-10B,含约25TB向量数据及精确ground truth,并开源Supernova框架,支持分布式嵌入生成、暴力KNN计算和性能评测,旨在替代合成基准,推动生产级向量搜索的可靠性与可复现性。

🔎

延伸解读

为什么需要10亿级基准

文章指出,真实生产环境中的向量搜索往往涉及数十亿向量、高吞吐和低延迟要求,而现有基准多基于合成数据或小规模数据集,难以反映实际挑战。例如,90%的召回率在需要二次排序的电商场景中可能不够。因此,Qdrant推出10亿级基准数据集,旨在提供更贴近真实生产环境的测试标准,帮助开发者评估系统在极端规模下的表现。

精确ground truth的计算成本

生成10亿级基准的精确ground truth需要巨大的计算资源。文章提到,Qdrant-FineWeb-10B的计算涉及超过一千万亿次距离计算,这解释了为何此前缺乏此类数据集。通过GPU加速和分布式计算,Supernova框架使得这一过程变得可行,但用户自行生成类似规模的数据集仍需考虑高昂的计算成本和时间。

Supernova框架的模块化设计

Supernova将基准测试流程分为四个阶段:嵌入生成、暴力KNN计算、数据加载和压力测试,每个阶段由独立模块(如nova-embed、nova-bf)负责,并通过YAML配置实现灵活定制。这种模块化设计允许用户根据需求替换或调整各环节,同时支持多种后端(如Qdrant、Milvus)和云环境,提高了框架的通用性和可扩展性。

多模态与混合检索的覆盖

除了文本基准,Qdrant还发布了PubMed-Multi-Vector和Coyo-Vector-Embeddings,分别针对混合检索和多模态检索。这些数据集提供了密集、稀疏及多向量表示,反映了现代生产架构的多样性。对于需要评估混合检索或多模态系统的团队,这些资源提供了更全面的测试基础,但用户需注意其规模(如PubMed的8.37亿多向量token)可能带来的存储和计算需求。

Q&A

Qdrant-FineWeb-10B 数据集有多大?

Qdrant-FineWeb-10B 是最大的开源向量搜索基准数据集,包含约 24.47 TB 的向量数据和 28.66 TB 的源文本及元数据,总向量数超过 100 亿。

Supernova 框架包含哪些核心模块?

Supernova 包含四个核心模块:nova-embed(嵌入生成)、nova-bf(暴力 ground truth 计算)、nova-load(数据加载)和 nova-storm(评估基准测试)。此外,还有 nova-dist 用于分布式计算管理。

Qdrant-FineWeb-10B 的 ground truth 是如何计算的?

使用 Supernova 的 nova-bf 模块,在 GPU 加速硬件上并行计算了超过 100 万次查询的精确 top-1000 最近邻,总计超过 1 千万亿次距离计算。

除了 Qdrant-FineWeb-10B,还发布了哪些数据集?

还发布了 PubMed-Multi-Vector 和 Coyo-Vector-Embeddings。PubMed-Multi-Vector 用于混合检索,包含密集、稀疏和 ColBERT 风格的多向量表示;Coyo-Vector-Embeddings 用于多模态检索,使用 Qwen3-VL-Embedding-2B 模型生成图像-文本对的嵌入。

Supernova 如何实现分布式计算?

Supernova 通过 nova-dist 模块集成 SkyPilot,实现集群配置、任务调度、容错和云抽象,支持在 AWS、GCP、Azure、Kubernetes 和 Slurm HPC 集群上线性扩展,无需手动管理基础设施。

为什么需要新的基准测试数据集?

现有基准测试存在数据合成、查询隐藏、引擎付费等问题,无法反映真实生产环境。Qdrant-FineWeb-10B 提供真实数据、精确 ground truth 和开源工具,支持 95%+ 召回率、高吞吐量和低延迟等生产级要求。

🏷️

标签

➡️

继续阅读