STARROCKS SUMMIT ASIA 2024 湖上分析架构
项目背景
李鹏霖(丁典)作为研发工程师,在StarRocks和Apache Impala中贡献并提交代码,分享湖上分析架构相关内容。
湖上分析架构
Data Skipping
介绍Data Skipping技术,通过Z-Order排序键优化数据访问,提升查询效率。具体实现包括:
- Z-Order排序键的智能选择算法,考虑唯一值数量、频次比例、文件数量和频次排名等因素。
- 动态调整Z-Order排序任务中的列,以适应不断变化的业务需求,优化Data Skip效果。
Data Skipping效果
通过调整Z-Order排序列,优化数据排序方式,确保数据能根据近期用户使用习惯进行优化,优化过程不影响数据集查询性能。
StarRocks x Iceberg JOIN
介绍排序列选取算法,筛选满足唯一值数量、频次比例、文件数量和频次排名等条件的列进行处理,提升JOIN操作性能。
StarRocks OLAP Parquet T+1 I/O Join StarRocks Data Cache 2.5
在数据湖分析场景中,StarRocks作为OLAP查询引擎,通过Data Cache功能缓存热点数据,避免重复网络I/O开销,显著提升查询和分析性能,P90性能提升约20%。
Data Cache效果
提供Data Cache的详细性能数据,包括读取字节数、读取计数器、读取时间等,展示Data Cache在关闭和开启状态下的性能差异。
大查询优化策略
为应对单分区数据量激增的挑战,StarRocks实现EXPLAIN ESTIMATE功能,预估查询数据量,超过预设阈值时路由到规模较小的集群执行,避免资源占用和查询超时。
项目收益
查询性能(P90)提升3倍到10秒内,磁盘存储节省1倍。
未来规划
探索近实时链路和具有PK需求的湖上分析场景的优化方案,结合StarRocks和Paimon构建极速实时湖仓分析架构。
感谢观看
Thank you!