登录
注册
个人信息
我的订单
我的报告豆
我的优惠券
我的笔记
我的阅读
我的收藏
我的下载
我的上传
我的订阅
在线客服
退出登录
回到首页
AI
搜索
发现报告
发现数据
发现专题
专题报告
专题百科
研选报告
定制报告
VIP
权益
付费社群
发现一下
行业研究
公司研究
宏观策略
财报
招股书
会议纪要
Token
低空经济
十五五
AIGC
大模型
当前位置:首页
/
行业研究
/
报告详情
B站基于Iceberg构建秒级响应湖仓一体平台的技术实践
信息技术
2023-07-12
DataFunSummit2023:数据湖架构峰会
four_king
现状与背景
Hive数仓痛点
:查询性能低(无法满足交互式分析)、出仓链路复杂、数据冗余、时效性差。
目标
:实现查询高效、使用便捷。
湖仓一体架构与Iceberg表结构
Iceberg表结构特点
:
文件级别的元数据管理。
开放格式,完善的tablespec定义。
查询加速技术
排序优化
:
Iceberg表记录每列的MinMax统计信息,用于planfile文件过滤。
数据排序后过滤效果更佳。
InterleaveOrder和HilbertCurve提升聚集性。
基于Boundary Index的Z-ORDER计算。
索引优化
:
BloomFilter(小空间、支持等值查询、有false positive)。
Bitmap(大空间、支持等值和范围查询、精准匹配行号)。
BloomRF(分段单调有序哈希函数、支持等值和范围查询)。
TokenBloomFilter/NgramBloomFilter及TokenBitmap/NgramBitmap(用于日志场景)。
预计算
:
Cube/AggIndex:文件级聚合,支持单表和星型模型,定义维度字段和聚合值(Count、Min、Max、Sum、Avg等)。
聚合值处理:可累加的存储聚合值,不可累加的存储binary中间结果。
查询改写:判断聚合计算是否符合cube定义,改写逻辑计划,TableScan切换到cube模式。
仅有部分文件生成Cube时,未生成Cube的数据现场计算,与Cube数据union后再global merge。
Star-TreeIndex
:
参考ApachePinot实现,Cube定义选取最细粒度维度字段,响应不同维度组合查询。
Cube数据量随维度数量增长,按维度字段排序分层创建star-tree,生成starrecord,根据split threshold判断是否创建子节点。
智能优化
Magnus服务
:
后台优化。
Iceberg表详情展示。
智能推荐。
现状与落地情况
主要场景
:BI报表、指标服务、A/B Test、人群圈选、日志。
落地数据
:
Iceberg表总量5PB,日增75TB。
Trino查询P95响应时间5s。
你可能感兴趣
6-3 网易 Arctic:基于 Apache Iceberg 构建的实时湖仓一体系统
信息技术
DataFunSummit2022:多维分析架构峰会
2022-07-18
4 杭银消金-基于 StarRocks构建Xihu湖仓一体平台实践
商贸零售
StarRocks 2024 年度技术峰会
2024-12-17
Iceberg 湖仓一体在 B 站的实践 - 李锐
交通运输
ArchSummit杭州2022|全球架构师峰会
2022-11-02
基于 IceBerg 湖仓一体架构演进
网易
2023-03-09
基于Kyuubi和Hudi的湖仓一体实践
网易
2023-03-09
Iceberg 在湖仓建设的若干实践
建筑建材
DataFunSummit2023:数据湖架构峰会
2023-07-12
祝佳俊-Apache Iceberg 在网易严选批流一体的实践
文化传媒
DataFunSummit2022:大数据计算架构峰会
2022-05-19
机构建商会级 AI 平台的架构策略和实践 - 李欣欣
信息技术
ArchSummit上海2023|全球架构师峰会
2023-06-06
数据湖 Iceberg 在小米的落地及实践
小米
2022-07-11
1-2 邵赛赛-湖仓一体在腾讯的实践落地
文化传媒
2023 DAMS中国数据智能管理峰会
2023-05-08