ClickHouse跳数索引的设计与应用:Bloom Filter与MinMax在查询加速中的效果
ClickHouse跳数索引的设计与应用Bloom Filter与MinMax在查询加速中的效果一、全表扫描40亿行ClickHouse也扛不住在一个数据分析场景中表user_events按小时分区存储了40亿条用户行为事件查询找出过去一周所有通过utm_sourcewechat且event_typepurchase的事件耗时18秒。表上已经建了排序键ORDER BY (event_date, user_id)但这个查询中utm_source和event_type都不在排序键前缀中ClickHouse不得不扫描所有粒度的数据块——这就是缺少跳数索引的代价。ClickHouse的稀疏主键索引primary.idx基于排序键只记录每N个粒度默认为8192行的排序键最小值。对于非排序键列的过滤条件主键索引完全用不上。跳数索引就是为了解决这个问题的——在非排序键列上建立轻量级的统计摘要让查询在执行时能够跳过不满足条件的数据块避免不必要的IO和计算。二、跳数索引的过滤原理MinMax、Set与Bloom Filter的代价模型ClickHouse支持多种跳数索引类型核心都是在每个粒度块上存储该列的统计摘要信息。flowchart LR subgraph Granules[数据粒度 (Granules)] G1[Granule 0br/8192 rowsbr/event_type: [click, view, click...]] G2[Granule 1br/8192 rowsbr/event_type: [purchase, purchase...]] G3[Granule 2br/8192 rowsbr/event_type: [view, share, view...]] end subgraph IndexMinMax[MinMax索引] M1[Minclick, Maxview] M2[Minpurchase, Maxpurchase] M3[Minshare, Maxview] end subgraph IndexBloom[Bloom Filter索引] B1[Bloom: {click, view}] B2[Bloom: {purchase}] B3[Bloom: {share, view}] end G1 -- M1 G2 -- M2 G3 -- M3 G1 -- B1 G2 -- B2 G3 -- B3 Q[WHERE event_typepurchase] -.-|MinMax检查| M2 Q -.-|Bloom检查| B2 M2 -.-|匹配| G2[只读取 Granule 2] B2 -.-|匹配| G2 style G2 fill:#c8e6c9 style M2 fill:#bbdefb style B2 fill:#bbdefbMinMax索引存储每个粒度块中列的最小值和最大值。查询时检查WHERE条件是否与MinMax区间有交集如果WHERE price 1000且某个粒度块的Max price是500那么这个粒度块可以直接跳过。MinMax在列值分布与物理存储顺序相关时效果最好——这就是为什么排序键对跳数索引也至关重要。Set索引存储每个粒度块中该列去重后的所有值。对于低基数列最有效——event_type可能只有10个不同的值Set索引可以精确判断某个值是否出现。但如果基数为10万Set索引本身的大小可能超过原始数据得不偿失。Bloom Filter索引使用概率数据结构可以快速判断一个值可能在或一定不在该粒度块中。空间效率远高于Set索引但有假阳性——Bloom Filter返回可能在但实际值不存在时需要实际读取数据块而无用功。假阳性率可以通过调整Bloom Filter的bit数来控制默认设置误差率约1%。三、针对不同查询模式的索引组合策略-- ClickHouse跳数索引创建示例 -- 场景1: 高基数列的等值过滤 → Bloom Filter ALTER TABLE user_events ADD INDEX idx_utm_source_bloom utm_source TYPE bloom_filter(0.01) GRANULARITY 4; -- 场景2: 低基数列的等值过滤 → Set ALTER TABLE user_events ADD INDEX idx_event_type_set event_type TYPE set(100) GRANULARITY 4; -- 场景3: 范围过滤列值与排序键相关 → MinMax ALTER TABLE user_events ADD INDEX idx_amount_minmax amount TYPE minmax GRANULARITY 1; -- 场景4: 时间范围枚举值过滤 → 组合索引 ALTER TABLE user_events ADD INDEX idx_composite (event_type, platform) TYPE bloom_filter(0.01) GRANULARITY 4; -- 场景5: 模糊匹配/前缀匹配 → ngrambf_v1或tokenbf_v1 ALTER TABLE user_events ADD INDEX idx_title_ngram title TYPE ngrambf_v1(3, 512, 2, 0) GRANULARITY 1;跳数索引的性能效果受三个参数影响GRANULARITY控制索引粒度每个索引条目覆盖多少个granuleTYPE决定索引类型和精度索引的物理排序决定了MinMax的有效性。在生产环境中测试过一组真实数据效果如下# 索引效果的简化评估脚本 import time from clickhouse_driver import Client import logging logger logging.getLogger(__name__) class SkipIndexBenchmark: ClickHouse跳数索引效果评估 def __init__(self, client: Client): self.client client def test_query_performance(self, table: str, query: str, with_index: bool True) - dict: 测试查询性能并收集指标 try: # 获取查询统计信息 stats_query f SELECT query, read_rows, read_bytes, query_duration_ms, memory_usage FROM system.query_log WHERE type QueryFinish AND query LIKE %{table}% ORDER BY event_time DESC LIMIT 1 # 先清除缓存 self.client.execute(fSYSTEM DROP MARK CACHE) start time.time() result self.client.execute(query) elapsed time.time() - start return { query: query[:100], with_index: with_index, elapsed_sec: elapsed, rows_returned: len(result), } except Exception as e: logger.error(fBenchmark failed: {e}) return {error: str(e)} def compare_index_effect(self, table: str, column: str): 对比有无跳数索引的查询效果 base_query fSELECT count() FROM {table} WHERE {column} target_value # 无索引测试 self.client.execute(fALTER TABLE {table} DROP INDEX IF EXISTS idx_{column}) no_index self.test_query_performance(table, base_query, with_indexFalse) # 有索引测试 self.client.execute(f ALTER TABLE {table} ADD INDEX idx_{column} {column} TYPE bloom_filter(0.01) GRANULARITY 4 ) self.client.execute(fALTER TABLE {table} MATERIALIZE INDEX idx_{column}) with_index self.test_query_performance(table, base_query, with_indexTrue) return {no_index: no_index, with_index: with_index}四、索引维护成本与查询加速比的非对称博弈跳数索引的维护成本集中在写入路径每次INSERT数据时ClickHouse需要为每个跳数索引更新对应粒度块的统计信息。对于Bloom Filter需要计算新增数据的哈希并更新bit数组对于MinMax需要比较并可能更新边界值。这个开销在批量写入场景下几乎不可见因为一批数据对应少数几个粒度块但在高频小批次写入场景下可能成为瓶颈。GRANULARITY参数是成本和收益的调节旋钮。GRANULARITY 1表示每个粒度块8192行建一个索引条目查得最细但索引体积最大GRANULARITY 4表示每4个粒度块约32K行建一个索引索引体积缩小4倍但可能多读一些不需要的数据。实践中GRANULARITY 4是较好的默认起点。索引物化的时机必须谨慎。MATERIALIZE INDEX会全表扫描构建索引在大于1TB的表上可能运行数小时期间的IO压力会影响在线查询。建议在业务低峰期执行或使用ALTER TABLE ... UPDATE ... WHERE分批构建。五、总结ClickHouse的跳数索引是在排序键索引之外的第二层过滤通过MinMax、Set和Bloom Filter等轻量级统计摘要在查询执行前过滤掉大量不相关的数据块。Bloom Filter是高基数列的最佳选择Set索引适合低基数列MinMax在有序列的范围过滤上效果显著。实践中建议为一个表创建2-4个跳数索引覆盖最高频的过滤条件。记住一个核心原则跳数索引的效果取决于数据在物理存储上的局部性——好的排序键设计能让跳数索引事半功倍。

相关新闻

DMA控制器原理与实战:嵌入式系统数据搬运优化指南

DMA控制器原理与实战:嵌入式系统数据搬运优化指南

1. DMA控制器:嵌入式系统的“数据搬运工”在嵌入式系统开发中,尤其是涉及雷达信号处理、高速数据采集或实时图像处理的场景,我们常常会遇到一个核心矛盾:CPU的计算能力是宝贵的,但大量、频繁的数据搬运工作&#xff08…

2026/8/9 3:13:36 阅读更多 →
杭州积分落户加分攻略:学历提升如何为你的城市生活加分

杭州积分落户加分攻略:学历提升如何为你的城市生活加分

一、杭州积分落户政策:新市民的安居之路作为长三角地区最具吸引力的城市之一,杭州以其优美的自然环境、蓬勃的经济活力和开放包容的城市氛围,每年吸引着大量外来人口前来就业和定居。为了更好地服务外来常住人口,杭州实行了积分落…

2026/8/9 11:34:00 阅读更多 →
搜索场景的大模型推理优化:多阶段召回的精排融合与 Query 理解延迟压缩

搜索场景的大模型推理优化:多阶段召回的精排融合与 Query 理解延迟压缩

搜索场景的大模型推理优化:多阶段召回的精排融合与 Query 理解延迟压缩 一、搜索的全链路延迟分解:从 Query 输入到结果返回的三级跳 搜索系统的一个完整请求链路包含三个阶段:Query 理解(意图分类、实体识别、纠错、改写&#xf…

2026/8/11 2:55:25 阅读更多 →

最新新闻

VScode配置python解释器

VScode配置python解释器

一、在VScode中下载好python插件二、在搜索栏搜索>python:三、最后右键运行就好了

2026/8/11 7:17:31 阅读更多 →
【迅投 QMT】QMT如何获取ETF申赎清单?download_etf_info()与get_etf_info()教程

【迅投 QMT】QMT如何获取ETF申赎清单?download_etf_info()与get_etf_info()教程

本方案由 EasyQuant AI量化助手 提供。问题背景ETF 套利、申购赎回和成分股篮子分析,都需要获取 ETF 的申赎清单数据。QMT 提供 download_etf_info() 下载 ETF 申赎清单,并通过 get_etf_info() 读取本地数据。实现思路下载最新 ETF 申赎清单数据。读取全…

2026/8/11 7:17:31 阅读更多 →
AI算力平台推荐分享:2026年算力消费透明化观察

AI算力平台推荐分享:2026年算力消费透明化观察

一段个人观察做了几年AI基础设施领域的跟踪研究,2026年让我感触较深的一个变化是:行业讨论的焦点,正在从"谁家的卡多"转向"谁家的账单看得懂"。这不是一个修辞。中国信通院发布的《2026年中国人工智能算力发展白皮书》显…

2026/8/11 7:17:31 阅读更多 →
工业现场协议堆成山,逐个写驱动太慢?UltraBus 通用协议栈:50+ 协议参数化接入,零改造分钟级上云

工业现场协议堆成山,逐个写驱动太慢?UltraBus 通用协议栈:50+ 协议参数化接入,零改造分钟级上云

一、为什么协议对接总在拖项目后腿 做工业现场数据采集或设备上云,你大概率遇到过这种场面: 现场 西门子 S7、三菱 MC、欧姆龙 FINS、汇川、Modbus RTU/TCP、Profinet、EtherNet/IP、OPC UA、电力 IEC104……几十种协议并存,新老设备混搭&…

2026/8/11 7:17:31 阅读更多 →
一文看懂 HarmonyOS 6.1.1 的 Canvas 抗锯齿开关能力

一文看懂 HarmonyOS 6.1.1 的 Canvas 抗锯齿开关能力

先确定它在 Canvas 能力体系中的位置HarmonyOS 6.1.1 为 CanvasRenderingContext2D 与 OffscreenCanvasRenderingContext2D 增加 antialias 属性,用于临时开关文本抗锯齿。只看接口形态,它只是上下文对象上的一个布尔值;放回二维绘图体系&…

2026/8/11 7:17:31 阅读更多 →
2、OpenCV 面试题

2、OpenCV 面试题

该文章只针对面试时面试官提问如何回答的更全更好,看此文章没有讲解太多太细节的知识点。如果知识点本身不会,背诵此文章可能能让你找到一份工作,但不能让你持续的干下去。还是需要自身精通对应知识点。该文章适合有学习过OpenCV 和Python的朋…

2026/8/11 7:16:31 阅读更多 →

日新闻

如何用Video2X实现专业级视频画质提升:AI视频增强完整指南

如何用Video2X实现专业级视频画质提升:AI视频增强完整指南

如何用Video2X实现专业级视频画质提升:AI视频增强完整指南 【免费下载链接】video2x A machine learning-based video super resolution and frame interpolation framework. Est. Hack the Valley II, 2018. 项目地址: https://gitcode.com/GitHub_Trending/vi/v…

2026/8/11 0:00:02 阅读更多 →
前后端分离项目中控制台与接口工具数据差异排查指南

前后端分离项目中控制台与接口工具数据差异排查指南

1. 问题现象解析:控制台与Apifox的数据差异 最近在调试一个前后端分离项目时,遇到了一个典型问题:后端服务在本地开发环境控制台能正常输出查询数据,但通过Apifox测试时却返回空结果。这种"控制台有数据,接口工具…

2026/8/11 0:00:03 阅读更多 →
AI编程实战:从Claude Code踩坑到游戏开发入门

AI编程实战:从Claude Code踩坑到游戏开发入门

1. 从“AI能帮我做游戏”到“AI让我重新学编程”最近身边不少朋友,尤其是一些非技术背景、但对游戏开发有浓厚兴趣的朋友,都在问我同一个问题:“听说现在用Claude Code这种AI编程工具,小白也能做游戏了,是真的吗&#…

2026/8/11 0:00:03 阅读更多 →

周新闻

5分钟告别提取码焦虑:baidupankey如何智能破解百度网盘资源锁

5分钟告别提取码焦虑:baidupankey如何智能破解百度网盘资源锁

5分钟告别提取码焦虑:baidupankey如何智能破解百度网盘资源锁 【免费下载链接】baidupankey 在线查询网盘提取码(维护中 rm repo) 项目地址: https://gitcode.com/gh_mirrors/ba/baidupankey 你是否曾经在深夜寻找一份重要资料&#x…

2026/8/11 1:08:05 阅读更多 →
如何快速生成中国车牌图片:Python开源工具完整指南

如何快速生成中国车牌图片:Python开源工具完整指南

如何快速生成中国车牌图片:Python开源工具完整指南 【免费下载链接】chinese_license_plate_generator 中国车牌生成器 项目地址: https://gitcode.com/gh_mirrors/ch/chinese_license_plate_generator 中国车牌生成器是一个基于Python的开源项目&#xff0c…

2026/8/11 1:08:05 阅读更多 →
收藏!小白程序员轻松入门大模型,从Harness工程开始实践

收藏!小白程序员轻松入门大模型,从Harness工程开始实践

文章强调学习大模型不应只关注模型本身,而应重视模型外的系统搭建,即Harness。提出AgentModelHarness的实用公式,详细介绍Harness的四个层次:持久化层、执行层、控制层和观察与验证层。文章还探讨了上下文工程、工具设计、AGENTS.…

2026/8/11 1:08:05 阅读更多 →

月新闻

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南 【免费下载链接】BaiduNetdiskPlugin-macOS For macOS.百度网盘 破解SVIP、下载速度限制~ 项目地址: https://gitcode.com/gh_mirrors/ba/BaiduNetdiskPlugin-macOS 还在为百度网盘macOS版的龟速下…

2026/8/10 17:07:33 阅读更多 →
终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换

终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换

终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换 【免费下载链接】ncmdump 项目地址: https://gitcode.com/gh_mirrors/ncmd/ncmdump 还在为网易云音乐下载的NCM格式文件无法在其他播放器播放而烦恼吗?ncmdump解密工具帮你轻松解决这个困…

2026/8/11 1:08:06 阅读更多 →
HarmonyOS 应用开发《掌上英语》第81篇: 智能体卡片:为英语学习 App 打造桌面级学习助手

HarmonyOS 应用开发《掌上英语》第81篇: 智能体卡片:为英语学习 App 打造桌面级学习助手

AgentCard 智能体卡片:为英语学习 App 打造桌面级学习助手适用平台:HarmonyOS 7.0 (API 26 Beta)一、引言 HarmonyOS 7.0(API 26 Beta)新增了 AgentCard 智能体卡片能力,这是继 HMAF(鸿蒙智能体框架&#x…

2026/8/10 17:07:33 阅读更多 →