Qdrant发布全球最大开源向量搜索基准数据集Qdrant-FineWeb-10B,含约25TB向量数据及精确ground truth,并开源Supernova框架,支持分布式嵌入生成、暴力KNN计算和性能评测,旨在替代合成基准,推动生产级向量搜索的可靠性与可复现性。
Qdrant支持将向量、HNSW图、量化向量等分配到不同内存层级(固定、缓存、冷存储),以平衡速度与成本。建议在RAM紧张时固定量化向量,冷存储时配合量化减少磁盘读取,避免缓存全精度与压缩副本共存。HNSW内联存储需测试,并随扩展持续检查RAM余量。
本文通过基准测试,量化了Qdrant优化器配置对搜索延迟的影响。连续索引虽在加载后需恢复期,但稳态延迟可降180倍;启用prevent_unoptimized能大幅降低排空期延迟,但新点暂不可见。单段配置稳态最快但恢复慢,限制段大小则相反。串行化优化线程可平滑延迟但延长排空。提高删除阈值可避免真空干扰。建议根据负载权衡配置。
Qdrant 1.10引入了新的查询API,允许用户通过组合不同的搜索方法来构建混合搜索系统。查询API支持创建嵌套的多阶段查询,并支持每个点的多个向量。用户可以使用标准指标(如precision@k、MRR或NDCG)评估其搜索系统的效果。文章还讨论了构建混合搜索系统的选项,包括融合和重新排序方法。Qdrant 1.10中的新查询API提供了灵活性,可以尝试不同的设置。
本文介绍Qdrant向量数据库在集合超出内存时的优化方法。通过量化压缩向量(如TurboQuant bits4)并固定压缩副本在RAM中,原始向量移至磁盘,可减少内存占用。重打分(rescore)虽增加磁盘读取,但能恢复精度,尤其对低比特量化(如bits1)效果显著。建议从bits4开始,根据测试调整参数,并验证召回率与延迟。
本文介绍Qdrant中混合搜索的调优方法。混合搜索结合稠密与稀疏检索,通过融合算法排序。调优前需确认融合优于单一检索,并比较RRF与DBSF融合方法。根据查询相关文档数量选择k值,最后调整权重。需在保留查询集上验证配置,确保效果稳定。调优顺序:确认融合优势、选择融合方法、设定k值、调整权重、验证结果。
调整Qdrant集合前,需明确检索目标(如排名、延迟或内存),并确保向量和负载索引正确。检查稀疏向量IDF修饰符和BM25平均长度等设置,避免无效结果。根据症状选择调整方向,如混合搜索或重排序。使用带标签的查询集和合适指标(如nDCG@10)评估,确保标签能检测改进,并在新查询上验证结果。
Qdrant与Minima联合优化智能体RAG,通过混合检索、重排序和模型压缩,将每GPU小时成功任务数从1081提升至3158,提升2.92倍。首轮检索成功率增至87%,上下文减少56%,延迟从21.3秒降至7.7秒,同时保持任务质量,显著降低推理成本。
拜耳基于Qdrant构建企业级搜索引擎myGenAssist,服务11.6万员工,月处理超150万条消息。系统采用混合云部署,支持混合检索、多模态搜索和智能体记忆,通过语义缓存控制成本,实现约20%效率提升。Qdrant作为可组合检索层,直接向AI代理暴露API,支撑从聊天机器人到自主代理的演进。
Qdrant向量集合增长会暴露重复、过期数据等问题,导致检索结果质量下降。通过去重、混合搜索优化和添加时效性过滤,可提升答案正确率。评估需结合多个指标,并检查数据源完整性,避免单一指标掩盖问题。
Qdrant对比了两种过滤向量搜索修复方案:Filterable HNSW在索引时添加额外边,ACORN在查询时检查邻居的邻居。基准测试显示,单一过滤器下Filterable HNSW表现更优,但AND组合过滤器两者都失效。Qdrant的查询规划器结合两者,在默认配置下多数过滤器保持高召回率,ACORN仅在特定场景(如无额外边的字段)值得启用,但会增加延迟。
Qdrant在向量搜索中采用过滤内置于搜索的方式,而非预过滤或后过滤。预过滤成本高,后过滤可能返回不足。Qdrant通过HNSW图遍历时检查过滤条件,并用Filterable HNSW和ACORN修复严格过滤导致的路径断裂。查询规划器按过滤匹配度选择路径,如过滤索引或全扫描,确保高效准确。
Qdrant 1.19发布,主要新功能包括:TurboQuant数据类型将向量压缩至4位,存储减少九倍;统一内存层级配置(固定、缓存、冷);支持按租户计算IDF统计;新增关键词前缀匹配和切片过滤;Web UI增强,支持实时分片进度、大规模可视化及索引管理。另有资源配额、副本读取亲和性等改进。
文章讨论了向量数据库在人工智能中的重要性,尤其是在检索增强生成(RAG)中的应用。尽管大型语言模型(LLM)如Google的Gemini 1.5提供了更大的上下文窗口,但依赖上下文并不总是有效且成本高昂。向量搜索提供更高的精度和效率,能够实时获取最新信息,适合企业使用。Qdrant的向量数据库在成本和性能上具有显著优势,帮助企业优化AI系统的运行。
本文介绍了如何使用LangChain和Qdrant构建问答应用。通过将事实转化为向量并存储在Qdrant中,系统能够进行语义搜索并提取相关文档。使用两个模型,一个用于特征提取,另一个用于文本生成。配置知识库后,用户可以通过简单代码实现问答功能,LangChain会自动处理大部分流程。
FastEmbed是一个高效的Python库,旨在简化文本嵌入生成。它通过量化模型和ONNX Runtime实现快速嵌入,支持多种文本模型,适合大规模数据处理,提升性能和速度。
本文评测了Qdrant中ACORN与Filterable HNSW两种过滤向量搜索方案。ACORN在查询时修补图,但延迟高、召回有限;Filterable HNSW在索引时加边,更高效。单过滤时后者胜出,双过滤时ACORN仅在无额外边的字段占优。建议为过滤字段建索引,并视情况启用ACORN。
构建电商搜索时,混合检索(密集向量+BM25)优于单一方法;过滤应在查询内进行,避免结果稀疏。嵌入文本比模型大小更关键,量化内存可省去重排序。个性化应作用于排序而非检索,商品运营用权重调整。评估需多指标互补,注意分片融合陷阱。
在使用Qdrant进行大规模数据上传时,需要关注内存使用、磁盘写入和搜索可用性。最佳实践包括选择合适的上传策略、批量上传、并行处理和分片。处理密集向量和稀疏向量时需根据工作负载调整配置,以确保上传过程高效稳定。
本文对比了Milvus 2.6.x与Qdrant在向量检索引擎中的架构和部署方式。Milvus强调存算分离,采用多组件架构,而Qdrant则提供单节点的简化部署,适合中小规模应用。两者在分布式部署、数据过滤和扩展性方面存在显著差异,选择时需考虑团队需求和运维复杂度。
完成下面两步后,将自动完成登录并继续当前操作。