小红花·文摘
  • 首页
  • 广场
  • 排行榜🏆
  • 直播
  • FAQ
Dify.AI

本文讨论了Apache Lucene中的PostingsFormat及其在短语查询中的重要性。短语查询需要位置信息以验证词语相邻关系,单靠docID不足。文章介绍了Postings的四层信息、块编码、跳跃列表和impacts的作用,强调这些技术如何提高查询效率和准确性。

【全文检索引擎】Postings 与 codec:freqs、positions、skip 与 impacts

土法炼钢兴趣小组的博客
土法炼钢兴趣小组的博客 · 2026-07-15T00:00:00Z
Haki Benita:如何在PostgreSQL中通过非分区列实现修剪

分区表的一个重要优势是修剪,数据库可以根据查询条件排除整个分区。虽然修剪通常依赖于分区键,但通过一些技巧,即使在非分区键列上也能实现修剪。本文展示了如何利用检查约束向优化器传达数据范围,从而提高查询效率。选择合适的分区键具有挑战性,但通过约束排除,可以在非分区键列上实现修剪,简化分区键的选择。

Haki Benita:如何在PostgreSQL中通过非分区列实现修剪

Planet PostgreSQL
Planet PostgreSQL · 2026-07-08T21:00:00Z
基于学习支持函数的摊销最大内积搜索

本文提出了一种新的最大内积搜索(MIPS)方法,称为摊销MIPS。该方法通过训练支持函数的回归模型(SupportNet)和优化键的向量值网络(KeyNet)来提高查询效率。实验结果表明,学习的SupportNet和KeyNet在文档嵌入上显著提高了匹配率,并优化了计算资源的使用。

基于学习支持函数的摊销最大内积搜索

Apple Machine Learning Research
Apple Machine Learning Research · 2026-07-02T00:00:00Z

本文探讨了Parquet文件的结构与性能优化,包括数据的物理切分(行组、列块、页面)、元数据存储方式,以及通过裁剪元数据(如列索引、偏移索引、布隆过滤器)提高查询效率。Parquet采用“先写数据、后写元数据”的设计,文件尾部包含所有统计信息,支持高效的谓词下推和投影下推,显著减少读取数据的IO量。

【数据湖与开放表格式】Parquet 文件格式深拆

土法炼钢兴趣小组的博客
土法炼钢兴趣小组的博客 · 2026-06-30T00:00:00Z

第二阶段的OLAP专注于列式存储,设计了RowGroups和ColumnSegments结构,以优化数据的磁盘存储和读取。RowGroups将表水平分区,每组最多包含122,880行;ColumnSegments存储每列的数据,并附带最小/最大区间图。该模型支持按需读取列、跳过不匹配的行组,并独立压缩每个段,提升查询效率。

OLAP – 第二阶段列式存储

Kimserey Lam’s website, Software Development blog posts, videos and tutorials
Kimserey Lam’s website, Software Development blog posts, videos and tutorials · 2026-06-27T05:00:00Z

本文讨论了ClickHouse中的MergeTree引擎,重点介绍了Part的合并和变更机制。合并通过将小Part归并为大Part来控制读放大,提升查询效率;变更则用于异步更新数据,但需谨慎使用以避免性能问题。文章还提到不同类型的MergeTree(如ReplacingMergeTree和CollapsingMergeTree)及其适用场景,强调了合并和变更的调度与管理。

【列存引擎内核】Merge 与 Mutation

土法炼钢兴趣小组的博客
土法炼钢兴趣小组的博客 · 2026-06-18T00:00:00Z

B+树索引是一种高效的数据结构,通过将键值映射到行的物理位置,实现O(log n)的查找速度。其叶子节点存储实际数据,内部节点用于导航。B+树是PostgreSQL的默认索引类型,支持快速查询和范围扫描,旨在提高大表的查询效率。未来将加入写前日志以增强数据持久性。

OLTP – 第8阶段 B+树索引

Kimserey Lam’s website, Software Development blog posts, videos and tutorials
Kimserey Lam’s website, Software Development blog posts, videos and tutorials · 2026-06-13T05:00:00Z

本文探讨了查询设计的重要性,强调查询应被视为“设计”而非“构建”。通过属性、操作符和值的三元组简化查询结构,避免复杂拼接逻辑。Nilsson的模型强调领域结构的清晰性,并支持两阶段执行以优化查询效率。Clojure实现展示了如何通过简洁代码处理查询,强调设计约束能提升可理解性和一致性。

读:Querying Without a Query Language——不用查询语言的查询

暗无天日
暗无天日 · 2026-05-25T00:00:00Z

Cloudflare在使用ClickHouse时遇到性能瓶颈,导致账单处理变慢。通过优化查询计划中的锁竞争和数据复制,最终实施了基于命名空间的分区方案,显著提升了查询效率,解决了账单系统危机。

我们的账单处理管道突然变慢。罪魁祸首是ClickHouse中的一个隐藏瓶颈。

The Cloudflare Blog
The Cloudflare Blog · 2026-05-14T13:00:00Z

本文探讨了提高PostgreSQL中JSONB数据查询效率的方法,介绍了三种索引:GIN索引、表达式索引和生成列。生成列在存储和写入性能上优于GIN索引,适合已知字段查询;表达式索引是快速迁移的低成本选择;而对于灵活查询,GIN索引仍然有效。总的来说,针对已知字段的查询,B树索引更具优势。

理查德·燕:通过生成列提高JSONB的可查询性

Planet PostgreSQL
Planet PostgreSQL · 2026-05-11T06:00:00Z
关系复杂性如何压制实时仪表盘

文章讨论了大规模数据处理中的关系数据库性能瓶颈,指出随着数据量增加,复杂连接查询导致查询速度下降。建议通过扁平化数据和预先连接元数据来提高查询效率,降低I/O负担。提供了SQL示例以支持实时分析和高并发用户访问。

关系复杂性如何压制实时仪表盘

Timescale Blog
Timescale Blog · 2026-05-08T15:33:00Z

openclaw.net 正在优化其 AI 对话平台,推出基础向量存储与搜索服务,确保对话历史的自动持久化和时序知识图谱的实时提取。通过事件驱动架构和性能监控,提升系统的可靠性和查询效率,支持复杂推理任务。

为 openclaw.net 集成 ElBruno.MempalaceNet 记忆系统

dotNET跨平台
dotNET跨平台 · 2026-05-05T00:01:48Z
近似答案,精确决策:用于分析的新草图功能

Databricks推出四种新草图功能,利用Apache DataSketches提高查询效率并降低计算成本。KLL草图用于近似分位数,Theta草图支持集合运算,近似Top-K草图追踪频繁项,Tuple草图结合独特计数和指标聚合。这些草图在ETL过程中构建,存储在Delta表中,适用于需要近似答案的分析场景,提供1-2%的可配置误差,显著提升查询速度。

近似答案,精确决策:用于分析的新草图功能

Databricks
Databricks · 2026-04-29T20:01:22Z
优化与架构:了解区别

数据库性能问题分为优化问题和架构问题。优化问题可通过调整配置或添加索引解决,而架构问题会随着数据增长而恶化。对于高容量、追加重的数据,架构不匹配会导致性能下降。解决方案包括使用TimescaleDB的混合存储引擎和自动分区功能,以提高查询效率和降低维护成本。识别问题类型有助于避免不必要的优化和迁移成本。

优化与架构:了解区别

Timescale Blog
Timescale Blog · 2026-04-29T02:21:18Z
在 Elastic Cloud Serverless 中引入跨项目搜索

Elastic Cloud Serverless推出跨项目搜索功能,允许用户在单一管理平台上即时查询多个项目的数据。该功能支持项目间的数据链接,确保数据隔离的同时,快速访问和分析分布式数据。用户可通过简单设置实现跨项目搜索,提升查询效率,减少运营摩擦。该功能将于2026年4月16日进入技术预览阶段。

在 Elastic Cloud Serverless 中引入跨项目搜索

Elastic Blog
Elastic Blog · 2026-04-20T00:00:00Z

PostgreSQL 索引通过排序提高查询效率,但会增加写入成本和占用空间。复合索引的顺序需注意,使用函数可能导致索引失效。可以使用 EXPLAIN 诊断查询性能。函数索引、部分索引和覆盖索引是优化特定场景的有效工具。

PostgreSQL 索引:从基础到你可能不知道的高级用法

暗无天日
暗无天日 · 2026-04-19T00:00:00Z
关系数据库设计指南

关系数据库设计的关键在于设计思维,而非SQL语法。设计时需考虑信息的表格划分、表间引用及冗余程度。正确的设计确保数据一致性和查询效率,错误则可能导致长期问题。本文探讨表格、键、关系、规范化及连接等核心概念。

关系数据库设计指南

ByteByteGo Newsletter
ByteByteGo Newsletter · 2026-04-16T15:31:26Z
穆罕默德·阿基尔:生产环境中的pg_semantic_cache:标签、驱逐、监控与Python集成

本文介绍了PostgreSQL中的语义缓存,强调如何将其应用于生产环境。通过标签组织缓存条目、监控缓存健康状况和实施驱逐策略,确保数据的新鲜度和有效性。示例展示了如何在Python应用中集成语义缓存,以提高查询效率和降低API调用成本。

穆罕默德·阿基尔:生产环境中的pg_semantic_cache:标签、驱逐、监控与Python集成

Planet PostgreSQL
Planet PostgreSQL · 2026-03-03T04:20:12Z
哈基·贝尼塔:非常规PostgreSQL优化

文章探讨了PostgreSQL中的非常规优化技术,如启用约束排除以避免全表扫描,以及使用哈希索引提升大值的唯一性和查询效率。这些方法能有效节省存储空间并加快查询速度。

哈基·贝尼塔:非常规PostgreSQL优化

Planet PostgreSQL
Planet PostgreSQL · 2026-01-19T22:00:00Z
2026年Tiger Data客户使用的9大PostgreSQL扩展

PostgreSQL功能强大,支持多种扩展,适用于时间序列、向量搜索和地理空间分析。常用扩展包括TimescaleDB、PL/pgSQL和pg_stat_statements,能够提升查询效率、简化代码和增强安全性,满足AI时代的需求。

2026年Tiger Data客户使用的9大PostgreSQL扩展

Timescale Blog
Timescale Blog · 2026-01-14T14:21:59Z
  • <<
  • <
  • 1 (current)
  • 2
  • 3
  • >
  • >>
👤 个人中心
在公众号发送验证码完成验证
登录验证
在本设备完成一次验证即可继续使用

完成下面两步后,将自动完成登录并继续当前操作。

1 关注公众号
小红花技术领袖公众号二维码
小红花技术领袖
如果当前 App 无法识别二维码,请在微信搜索并关注该公众号
2 发送验证码
在公众号对话中发送下面 4 位验证码
小红花技术领袖俱乐部
小红花·文摘:汇聚分发优质内容
小红花技术领袖俱乐部
Copyright © 2021-
粤ICP备2022094092号-1
公众号 小红花技术领袖俱乐部公众号二维码
视频号 小红花技术领袖俱乐部视频号二维码