核心观点
AI推理与训练的IO需求存在显著差异。AI训练依赖大数据块(10MB-1GB)的低并发访问,而AI推理则需要小数据块(几KB)的高并发访问,且存储容量需求高达PB级。传统以CPU为中心的存储架构无法满足AI推理的高并发需求,导致GPU性能未被充分利用。
关键数据
- AI训练:数据块尺寸10MB-1GB,低并发,存储容量1-10TB。
- AI推理:数据块尺寸几KB,高并发(数千条),存储容量PB级。
- AI工作负载分化为两大类:训练和推理/预测式AI。
- 传统架构中,CPU掌控存储IO的控制路径和数据路径,GPU仅作为辅助加速器。
- 利特尔定律要求系统维持高达20,000+的队列深度(Qd)以处理AI的512B小I/O。
解决方案
GPU地位需要提升,通过GPU直连SSD和SCADA软件架构实现:
- GPU直连SSD:通过NVMe-of、RDMA、GPUDirect Storage等技术,允许GPU直接从固态硬盘读取和写入数据,绕过CPU和系统内存。
- SCADA软件架构:通过uNVMe和GPU应用线程发起请求,实现数据直接流入GPU,旁路CPU。
数据库架构变化
- 架构层面:从“以CPU为中心”到“以GPU为中心”,GPU成为主计算单元。
- 核心组件升级:
- 存储引擎革新:直接管理GPU显存和直连SSD之间的数据流动。
- 数据布局优化:采用纯列式或混合式存储格式,原生支持Apache Arrow等零拷贝内存格式。
- 查询执行引擎重构:核心算子GPU原生实现,异步、流水线执行。
- 查询优化器挑战:成本模型剧变,数据本地性优化。
产业进展
- 硬件方面:
- HBF新型存储:闪迪与SK海力士合作制定HBF技术规范,预计2026下半年发布样品,2027年初面世。
- 铠侠与英伟达合作,开发直连GPU进行数据交换的SSD,支持PCIe 7.0。
- 软件方面:
- Hammerspace加速数据编排平台软件性能。
- Cloudian HyperStore通过RDMA over S3技术,使向量数据库性能提升8倍。
投资建议
随着AI推理的爆发,GPU直连SSD的创新架构将推动数据库产业迎来新机遇。相关标的包括星环科技、达梦数据、海量数据、MongoDB、Snowflake等。
风险提示