小红花·文摘
  • 首页
  • AI Tokens🪙
  • 排行榜🏆
  • 直播
  • FAQ
倒排索引遍历的P-完全性:论布尔查询DAG评估的复杂性

本文探讨了倒排索引遍历的P-完全性,指出标准查询评估在处理复杂布尔查询时面临指数级时间或空间开销。作者提出ComputePN算法,通过正负双表示和DAG记忆化,将评估时间限制在O(|Q|·|U_active|),避免树展开和全量扫描,为计算检索奠定理论基础。

倒排索引遍历的P-完全性:论布尔查询DAG评估的复杂性

Apple Machine Learning Research Apple Machine Learning Research · 2026-08-19T00:00:00Z

本文是「全文检索引擎」系列的第一篇,探讨了倒排索引的架构与实现,分析了Lucene与Elasticsearch的关系,阐述了文本如何处理成可搜索的词项,以及查询在倒排列表中的执行方式。文章还区分了不同类型的搜索引擎,强调了全文检索引擎在文本与查询处理中的复杂性和重要性。

【全文检索引擎】全文引擎全景:架构叙事与 Lucene 内核之间的一层

土法炼钢兴趣小组的博客 土法炼钢兴趣小组的博客 · 2026-07-15T00:00:00Z

本文探讨了Apache Lucene中有限状态转换器(FST)在段文件中的作用,如何通过词典快速定位倒排索引的postings。FST通过共享前缀压缩词典,减少内存占用,并支持高效查找与遍历。文章比较了Lucene的词典结构与PostgreSQL的GIN Entry Tree,强调两者在存储引擎假设上的不同,并讨论了FST的实现细节及其在查询中的应用。

【全文检索引擎】词项词典 FST:前缀压缩与 TermsEnum

土法炼钢兴趣小组的博客 土法炼钢兴趣小组的博客 · 2026-07-15T00:00:00Z

本文探讨了全文检索引擎的架构,重点分析了Lucene和Elasticsearch的设计与实现,包括倒排索引、文档模型、分析链、BM25打分机制和近实时刷新等关键概念,适合搜索引擎工程师和研究生深入理解搜索系统的内部运作。

【全文检索引擎】Lucene · BM25 · Segment · Elasticsearch NRT

土法炼钢兴趣小组的博客 土法炼钢兴趣小组的博客 · 2026-07-15T00:00:00Z

搜索引擎的倒排索引需要高效的整数压缩以节省存储和提高查询速度。文章介绍了多种压缩算法,如varint、PForDelta、SIMD-BP128和Roaring Bitmap,分析了它们的优缺点及应用场景。选择合适的算法需考虑数据特性和性能需求。

整数压缩:varint → PForDelta → SIMD-BP128

土法炼钢兴趣小组的博客 土法炼钢兴趣小组的博客 · 2026-05-12T00:00:00Z

某电商平台的搜索系统从MySQL迁移到Elasticsearch,查询延迟从800ms降至15ms,但分片数激增至8000,导致超时率上升。文章探讨了生产级搜索系统的架构组件,强调倒排索引的重要性,并介绍了查询解析、分词、分布式索引等关键环节。还讨论了分片策略、相关性排序及Elasticsearch集群架构,指出运维挑战如分片膨胀和映射爆炸,最后提出了搜索系统的整体架构和优化策略。

【系统架构设计】搜索引擎架构:倒排索引之上的系统设计

土法炼钢兴趣小组的博客 土法炼钢兴趣小组的博客 · 2026-04-13T00:00:00Z
保罗·拉姆齐:Postgres JSONB 列与 TOAST:性能指南

GIN索引是一种倒排索引,适用于可变数量值的对象,常用于索引数组类型列,便于查找特定值的数组。对于JSON,GIN索引适合精确查找项值,如查找“item_name”等于“laborum”的对象。

保罗·拉姆齐:Postgres JSONB 列与 TOAST:性能指南

Planet PostgreSQL Planet PostgreSQL · 2026-02-25T15:05:00Z
从零构建一个真正工作的简单搜索引擎

本文介绍如何用 Python 构建简单搜索引擎,重点在倒排索引、文本切分和权重系统。通过实现精确、前缀和 N-gram 三种切词方法,结合权重计算,提高搜索结果的相关性和准确性。最终实现的搜索引擎代码简洁,逻辑清晰。

从零构建一个真正工作的简单搜索引擎

lucifer的网络博客 lucifer的网络博客 · 2025-11-29T16:00:00Z
rabbit-mq初探

Elasticsearch 是一个支持高可用性和可伸缩性的分布式搜索与分析引擎,通过集群、节点、索引和文档等概念实现数据存储与检索,利用倒排索引加速搜索过程。

rabbit-mq初探

Sekyoro的博客小屋 Sekyoro的博客小屋 · 2025-07-21T12:36:01Z
PostgreSQL可以成为搜索引擎吗?是的,你可能不需要Elasticsearch

倒排索引是搜索引擎的核心,通过关键词快速检索文档,适合全文搜索。PostgreSQL中的GIN索引加速全文搜索,支持复杂数据类型,并具备压缩特性,节省存储空间。

PostgreSQL可以成为搜索引擎吗?是的,你可能不需要Elasticsearch

DEV Community DEV Community · 2025-05-09T04:31:13Z
深入探讨Apache Doris索引

Apache Doris的索引系统包括前缀索引、倒排索引、ZoneMap索引和BloomFilter索引。前缀索引通过排序快速定位数据,倒排索引支持全文检索,ZoneMap索引利用统计信息跳过无关数据块,BloomFilter索引加速等值查询和LIKE查询。了解这些索引的原理和应用场景有助于优化查询性能。

深入探讨Apache Doris索引

DEV Community DEV Community · 2025-03-31T09:48:05Z
打造我自己的搜索引擎(算是)

作者最初计划爬取整个互联网以建立搜索引擎,但意识到过于雄心勃勃,最终决定为自己硬盘上的PDF文档构建搜索引擎。通过提取文本、使用OCR技术、清理数据并建立倒排索引,成功实现了搜索功能,尽管与谷歌相比还有差距,但成功管理了自己的文档库。

打造我自己的搜索引擎(算是)

DEV Community DEV Community · 2025-03-30T14:35:51Z
理解倒排索引:高效搜索的支柱

倒排索引是一种数据结构,通过将唯一词汇映射到相关文档,快速定位包含特定词汇的文档,显著提高搜索效率,广泛应用于搜索引擎和数据库。

理解倒排索引:高效搜索的支柱

DEV Community DEV Community · 2024-12-09T18:39:30Z

传统数据库通过表扫描查找搜索词,效率低。搜索优化数据库利用索引、词干提取和分词技术提升查询速度,构建倒排索引。分词将词语简化为词根,词干提取将任务分解为单词,帮助映射到相关文档。倒排索引将词语映射到包含它们的文档。许多搜索优化数据库支持模糊搜索,处理拼写错误。ElasticSearch是其中一种流行的搜索优化数据库。

今日学习:系统设计中的搜索优化数据库(全文搜索)

DEV Community DEV Community · 2024-10-16T01:16:58Z

搜索引擎通过索引和检索算法快速找到信息。Apache Lucene是一个用Java编写的开源库,是ElasticSearch和Solr的基础。Lucene的搜索技术包括查询预处理、倒排索引搜索、文档评分和结果排序。查询经过分词、标准化、去除停用词和词干提取,然后根据TF-IDF权重检索相关文档,并按得分排序显示最相关结果。

使用Python探索Apache Lucene:理解搜索引擎机制

DEV Community DEV Community · 2024-10-09T03:41:46Z

该研究比较了HNSW、Flat和倒排索引三种常见的检索方法,分析了它们在性能、内存使用和索引构建方面的权衡,并提供了选择每种方法的指导。HNSW适用于高维数据和快速近似搜索,Flat适用于较小的数据集或内存受限的应用,倒排索引适用于大型文本语料库的精确关键词检索。该论文为开发人员和研究人员提供了有价值的操作建议。

构建搜索或推荐系统时,明智选择检索器:HNSW vs. Flat vs. 倒排索引

DEV Community DEV Community · 2024-09-12T08:33:06Z
MySQL全文索引源码剖析之Insert语句执行过程

本文介绍了MySQL中的全文索引及其插入过程。全文索引基于倒排索引,支持关键词搜索文档。插入时,文档分词并缓存,分为写入行记录、事务提交和刷脏三个阶段。事务提交时,分词结果添加到缓存,达到阈值后刷新到磁盘,系统崩溃后可恢复缓存数据。

MySQL全文索引源码剖析之Insert语句执行过程

华为云官方博客 华为云官方博客 · 2024-05-20T02:33:15Z

倒排索引是全文检索系统的索引方法,现代搜索引擎常用。它通过逆向运算将物品属性信息映射到物品,帮助用户快速定位目标信息。倒排索引由倒排表和词项字典组成,使用压缩算法节约内存。词项字典使用fst算法映射词项字段和词项索引,节省内存空间。

倒排索引关键点普及

京东科技开发者 京东科技开发者 · 2024-03-20T06:35:17Z
GreptimeDB v0.6 发布 - 支持在数据节点之间迁移表的区域

Greptime团队宣布开源时间序列数据库GreptimeDB v0.6的新版本,包含区域迁移、默认时区配置项和PromQL中的OR逻辑运算符等重大改进。未来计划推出全新的索引模块,实现倒排索引以提高大数据集查询性能。

GreptimeDB v0.6 发布 - 支持在数据节点之间迁移表的区域

DEV Community: Greptime DEV Community: Greptime · 2024-01-17T08:30:54Z

Redis Search是Redis模块,使用倒排索引实现快速索引和低内存占用。它支持精确短语匹配、模糊搜索、数值过滤、地理空间筛选等功能。与elasticsearch相比,Redis Search基于内存,提供更高性能和低延迟,无需额外安装和配置。Redis Search还支持多种扩展模块,如RedisJSON、RedisGraph、RedisTimeSeries等。安装Redis Search可使用Redis Stack Docker镜像。使用Redis Search需先声明索引,然后使用RediSearch查询语言进行查询、更新和删除文档。在C#中使用Redis Search可使用NRediSearch和StackExchange.Redis库。

C#+Redis Search:如何用Redis实现高性能全文搜索

dotNET跨平台 dotNET跨平台 · 2023-07-23T00:03:29Z
  • <<
  • <
  • 1 (current)
  • 2
  • >
  • >>
👤 个人中心
在公众号发送验证码完成验证
登录验证
在本设备完成一次验证即可继续使用

完成下面两步后,将自动完成登录并继续当前操作。

1 关注公众号
小红花技术领袖公众号二维码
小红花技术领袖
如果当前 App 无法识别二维码,请在微信搜索并关注该公众号
2 发送验证码
在公众号对话中发送下面 4 位验证码
小红花技术领袖俱乐部
小红花·文摘:汇聚分发优质内容
小红花技术领袖俱乐部
Copyright © 2021-
粤ICP备2022094092号-1
公众号 小红花技术领袖俱乐部公众号二维码
视频号 小红花技术领袖俱乐部视频号二维码