大数据的核心特征包括数据量(Volume)、数据生成速度(Velocity)和多模态(Variety),其中多模态数据涵盖图片、文档、图、时序和交易等多种形式。随着数据处理的深度增加,大模型的崛起对大数据提出了新需求,高质量训练数据成为提升模型性能的关键,而向量数据库则成为提升模型服务能力的核心技术。
吴恩达的“二八定律”指出,深度学习应从Model-centric向Data-centric转变,大模型需要大数据,而如何获得更多数据、提升数据质量以及高效处理海量数据成为核心挑战。
大模型崛起引领大数据新趋势,主要体现在以下三个方面:
-
在线离线一体化:采用2-in-1架构(TP & AP一体化),如OceanBase分布式HTAP数据库,支持实时数据分析和决策。以图风控方案为例,通过TuGraphDB(分布式图数据库)和TuGraphDataflow(流图计算系统)保证在线近线数据一致,并使用统一的查询语言避免语义不一致。
-
向量数据库与关系数据库一体化:将向量数据处理能力和关系型数据管理能力结合,如蚂蚁VSAG(通用向量索引库)在OceanBase中的集成。VSAG包含主流向量索引实现,针对场景优化,提供通用向量检索和构建接口,并支持自适应指令集加速、索引分区等特性。
-
数据处理与AI计算一体化:大模型训练数据处理是典型场景,如Common Crawl(PB级规模的海量网页数据集)和CCNet(Facebook发布的数据清洗流程)。当前数据处理主要依赖Java生态(分布式大数据处理),而AI计算主要依赖Python生态,存在生态独立问题。BigDL(深度学习的Java化)和Koalas Evolution(PySpark的Python化)是两种尝试,但均存在性能和兼容性问题。
核心观点包括:大数据特征显著,多模态数据成为重点;大模型推动数据处理向Data-centric转变;在线离线一体化、向量数据库与关系数据库一体化、数据处理与AI计算一体化是重要趋势;当前数据与AI生态独立问题亟待解决。