小红花·文摘
  • 首页
  • AI Tokens🪙
  • 排行榜🏆
  • 直播
  • FAQ

本文讨论了Apache Lucene中的PostingsFormat及其在短语查询中的重要性。短语查询需要位置信息以验证词语相邻关系,单靠docID不足。文章介绍了Postings的四层信息、块编码、跳跃列表和impacts的作用,强调这些技术如何提高查询效率和准确性。

【全文检索引擎】Postings 与 codec:freqs、positions、skip 与 impacts

土法炼钢兴趣小组的博客 土法炼钢兴趣小组的博客 · 2026-07-15T00:00:00Z
Haki Benita:如何在PostgreSQL中通过非分区列实现修剪

分区表的一个重要优势是修剪,数据库可以根据查询条件排除整个分区。虽然修剪通常依赖于分区键,但通过一些技巧,即使在非分区键列上也能实现修剪。本文展示了如何利用检查约束向优化器传达数据范围,从而提高查询效率。选择合适的分区键具有挑战性,但通过约束排除,可以在非分区键列上实现修剪,简化分区键的选择。

Haki Benita:如何在PostgreSQL中通过非分区列实现修剪

Planet PostgreSQL Planet PostgreSQL · 2026-07-08T21:00:00Z
基于学习支持函数的摊销最大内积搜索

本文提出了一种新的最大内积搜索(MIPS)方法,称为摊销MIPS。该方法通过训练支持函数的回归模型(SupportNet)和优化键的向量值网络(KeyNet)来提高查询效率。实验结果表明,学习的SupportNet和KeyNet在文档嵌入上显著提高了匹配率,并优化了计算资源的使用。

基于学习支持函数的摊销最大内积搜索

Apple Machine Learning Research Apple Machine Learning Research · 2026-07-02T00:00:00Z

本文探讨了Parquet文件的结构与性能优化,包括数据的物理切分(行组、列块、页面)、元数据存储方式,以及通过裁剪元数据(如列索引、偏移索引、布隆过滤器)提高查询效率。Parquet采用“先写数据、后写元数据”的设计,文件尾部包含所有统计信息,支持高效的谓词下推和投影下推,显著减少读取数据的IO量。

【数据湖与开放表格式】Parquet 文件格式深拆

土法炼钢兴趣小组的博客 土法炼钢兴趣小组的博客 · 2026-06-30T00:00:00Z

第二阶段的OLAP专注于列式存储,设计了RowGroups和ColumnSegments结构,以优化数据的磁盘存储和读取。RowGroups将表水平分区,每组最多包含122,880行;ColumnSegments存储每列的数据,并附带最小/最大区间图。该模型支持按需读取列、跳过不匹配的行组,并独立压缩每个段,提升查询效率。

OLAP – 第二阶段列式存储

Kimserey Lam’s website, Software Development blog posts, videos and tutorials Kimserey Lam’s website, Software Development blog posts, videos and tutorials · 2026-06-27T05:00:00Z

本文讨论了ClickHouse中的MergeTree引擎,重点介绍了Part的合并和变更机制。合并通过将小Part归并为大Part来控制读放大,提升查询效率;变更则用于异步更新数据,但需谨慎使用以避免性能问题。文章还提到不同类型的MergeTree(如ReplacingMergeTree和CollapsingMergeTree)及其适用场景,强调了合并和变更的调度与管理。

【列存引擎内核】Merge 与 Mutation

土法炼钢兴趣小组的博客 土法炼钢兴趣小组的博客 · 2026-06-18T00:00:00Z

B+树索引是一种高效的数据结构,通过将键值映射到行的物理位置,实现O(log n)的查找速度。其叶子节点存储实际数据,内部节点用于导航。B+树是PostgreSQL的默认索引类型,支持快速查询和范围扫描,旨在提高大表的查询效率。未来将加入写前日志以增强数据持久性。

OLTP – 第8阶段 B+树索引

Kimserey Lam’s website, Software Development blog posts, videos and tutorials Kimserey Lam’s website, Software Development blog posts, videos and tutorials · 2026-06-13T05:00:00Z

本文探讨了查询设计的重要性,强调查询应被视为“设计”而非“构建”。通过属性、操作符和值的三元组简化查询结构,避免复杂拼接逻辑。Nilsson的模型强调领域结构的清晰性,并支持两阶段执行以优化查询效率。Clojure实现展示了如何通过简洁代码处理查询,强调设计约束能提升可理解性和一致性。

读:Querying Without a Query Language——不用查询语言的查询

暗无天日 暗无天日 · 2026-05-25T00:00:00Z

Cloudflare在使用ClickHouse时遇到性能瓶颈,导致账单处理变慢。通过优化查询计划中的锁竞争和数据复制,最终实施了基于命名空间的分区方案,显著提升了查询效率,解决了账单系统危机。

我们的账单处理管道突然变慢。罪魁祸首是ClickHouse中的一个隐藏瓶颈。

The Cloudflare Blog The Cloudflare Blog · 2026-05-14T13:00:00Z

本文探讨了提高PostgreSQL中JSONB数据查询效率的方法,介绍了三种索引:GIN索引、表达式索引和生成列。生成列在存储和写入性能上优于GIN索引,适合已知字段查询;表达式索引是快速迁移的低成本选择;而对于灵活查询,GIN索引仍然有效。总的来说,针对已知字段的查询,B树索引更具优势。

理查德·燕:通过生成列提高JSONB的可查询性

Planet PostgreSQL Planet PostgreSQL · 2026-05-11T06:00:00Z
关系复杂性如何压制实时仪表盘

文章讨论了大规模数据处理中的关系数据库性能瓶颈,指出随着数据量增加,复杂连接查询导致查询速度下降。建议通过扁平化数据和预先连接元数据来提高查询效率,降低I/O负担。提供了SQL示例以支持实时分析和高并发用户访问。

关系复杂性如何压制实时仪表盘

Timescale Blog Timescale Blog · 2026-05-08T15:33:00Z

openclaw.net 正在优化其 AI 对话平台,推出基础向量存储与搜索服务,确保对话历史的自动持久化和时序知识图谱的实时提取。通过事件驱动架构和性能监控,提升系统的可靠性和查询效率,支持复杂推理任务。

为 openclaw.net 集成 ElBruno.MempalaceNet 记忆系统

dotNET跨平台 dotNET跨平台 · 2026-05-05T00:01:48Z
近似答案,精确决策:用于分析的新草图功能

Databricks推出四种新草图功能,利用Apache DataSketches提高查询效率并降低计算成本。KLL草图用于近似分位数,Theta草图支持集合运算,近似Top-K草图追踪频繁项,Tuple草图结合独特计数和指标聚合。这些草图在ETL过程中构建,存储在Delta表中,适用于需要近似答案的分析场景,提供1-2%的可配置误差,显著提升查询速度。

近似答案,精确决策:用于分析的新草图功能

Databricks Databricks · 2026-04-29T20:01:22Z
优化与架构:了解区别

数据库性能问题分为优化问题和架构问题。优化问题可通过调整配置或添加索引解决,而架构问题会随着数据增长而恶化。对于高容量、追加重的数据,架构不匹配会导致性能下降。解决方案包括使用TimescaleDB的混合存储引擎和自动分区功能,以提高查询效率和降低维护成本。识别问题类型有助于避免不必要的优化和迁移成本。

优化与架构:了解区别

Timescale Blog Timescale Blog · 2026-04-29T02:21:18Z
在 Elastic Cloud Serverless 中引入跨项目搜索

Elastic Cloud Serverless推出跨项目搜索功能,允许用户在单一管理平台上即时查询多个项目的数据。该功能支持项目间的数据链接,确保数据隔离的同时,快速访问和分析分布式数据。用户可通过简单设置实现跨项目搜索,提升查询效率,减少运营摩擦。该功能将于2026年4月16日进入技术预览阶段。

在 Elastic Cloud Serverless 中引入跨项目搜索

Elastic Blog Elastic Blog · 2026-04-20T00:00:00Z

PostgreSQL 索引通过排序提高查询效率,但会增加写入成本和占用空间。复合索引的顺序需注意,使用函数可能导致索引失效。可以使用 EXPLAIN 诊断查询性能。函数索引、部分索引和覆盖索引是优化特定场景的有效工具。

PostgreSQL 索引:从基础到你可能不知道的高级用法

暗无天日 暗无天日 · 2026-04-19T00:00:00Z
关系数据库设计指南

关系数据库设计的关键在于设计思维,而非SQL语法。设计时需考虑信息的表格划分、表间引用及冗余程度。正确的设计确保数据一致性和查询效率,错误则可能导致长期问题。本文探讨表格、键、关系、规范化及连接等核心概念。

关系数据库设计指南

ByteByteGo Newsletter ByteByteGo Newsletter · 2026-04-16T15:31:26Z
穆罕默德·阿基尔:生产环境中的pg_semantic_cache:标签、驱逐、监控与Python集成

本文介绍了PostgreSQL中的语义缓存,强调如何将其应用于生产环境。通过标签组织缓存条目、监控缓存健康状况和实施驱逐策略,确保数据的新鲜度和有效性。示例展示了如何在Python应用中集成语义缓存,以提高查询效率和降低API调用成本。

穆罕默德·阿基尔:生产环境中的pg_semantic_cache:标签、驱逐、监控与Python集成

Planet PostgreSQL Planet PostgreSQL · 2026-03-03T04:20:12Z
哈基·贝尼塔:非常规PostgreSQL优化

文章探讨了PostgreSQL中的非常规优化技术,如启用约束排除以避免全表扫描,以及使用哈希索引提升大值的唯一性和查询效率。这些方法能有效节省存储空间并加快查询速度。

哈基·贝尼塔:非常规PostgreSQL优化

Planet PostgreSQL Planet PostgreSQL · 2026-01-19T22:00:00Z
2026年Tiger Data客户使用的9大PostgreSQL扩展

PostgreSQL功能强大,支持多种扩展,适用于时间序列、向量搜索和地理空间分析。常用扩展包括TimescaleDB、PL/pgSQL和pg_stat_statements,能够提升查询效率、简化代码和增强安全性,满足AI时代的需求。

2026年Tiger Data客户使用的9大PostgreSQL扩展

Timescale Blog Timescale Blog · 2026-01-14T14:21:59Z
  • <<
  • <
  • 1 (current)
  • 2
  • 3
  • >
  • >>
👤 个人中心
在公众号发送验证码完成验证
登录验证
在本设备完成一次验证即可继续使用

完成下面两步后,将自动完成登录并继续当前操作。

1 关注公众号
小红花技术领袖公众号二维码
小红花技术领袖
如果当前 App 无法识别二维码,请在微信搜索并关注该公众号
2 发送验证码
在公众号对话中发送下面 4 位验证码
友情链接: MOGE.AI 九胧科技 1tok 菜鸟教程 Remio.AI DeekSeek连连 53AI 神龙海外代理IP IPIPGO全球代理IP 东波哥的博客 匡优考试在线考试系统 开源服务指南 蓝莺IM Solo 独立开发者社区 AI酷站导航 极客Fun 我爱水煮鱼 周报生成器 He3.app 简单简历 白鲸出海 T沙龙 职友集 TechParty 蟒周刊 Best AI Music Generator 模力方舟 Gitee AI

小红花技术领袖俱乐部
小红花·文摘:汇聚分发优质内容
小红花技术领袖俱乐部
Copyright © 2021-
粤ICP备2022094092号-1
公众号 小红花技术领袖俱乐部公众号二维码
视频号 小红花技术领袖俱乐部视频号二维码