AI 时代的数据需求
AI 技术的应用激发企业对数据的旺盛需求,AI 的应用重度依赖于数据。根据IDC估计,全世界的数据量将从2018年的 33 ZB,增长到2025年的 175 ZB。数据贯穿于 AI 应用的整个链路,包括数据加工、数据集、模型和向量等。数据治理是 AI 应用中不可或缺的部分,涉及数据发现、数据血缘、数据安全、数据标准、数据质量、数据生命周期等,优秀的数据治理对 AI 的成功应用至关重要。
现有数据管理技术的挑战
现有数据管理技术面临诸多挑战,包括:
- 数据孤岛:数据被锁定在不同的数据源中,如数据湖、数据仓库、消息队列、向量数据库、分布式文件系统等,形成数据孤岛。
- 地域分割:企业由单云单域架构向多云多域架构迈进,数据合规的限制导致数据分割,跨云数据的传输成本高,GDPR、CCPA 等要求也加剧了数据管理的复杂性。
- 组织分割:数据被孤立到不同部门拥有的数据平台中,新业务和 LLM 需要一种统一的方式来访问所有数据。
- 隐藏问题:数据发现困难、数据连接复杂、数据分类不完善、数据生命周期管理混乱、元数据语义缺失、数据主权难以保障等问题。
这些挑战导致决策信息不完整、资源浪费、合规风险、阻碍业务创新发展等问题。
统一数据治理的价值
统一数据治理可以实现全方位数据管理,其价值包括:
- 统一数据/元数据管理视图:通过 Unified Catalog 实现统一数据/元数据管理视图,支持多租户和权限认证,兼容 HMS,与大数据生态天然融合。
- 统一权限管控:通过统一权限管控,实现集中权限管控,全域无缝访问,精细化权限控制,安全合规无忧,权限与 Ranger 生态互通。
- 数据智能调优:通过统一数据管控面,帮助用户快速构建和管理湖仓架构,实现全方位湖仓管理,支持多种触发方式(周期/按需/条件)的数据智能调优。
Apache Gravitino 作为统一数据/AI 目录,旨在实现数据统一视图,从元数据层面上达到 SSOT,统一访问和治理。其核心架构包括 Metadata Storage、Functionality layer、Interface layer、Connection Layer 和 Unified REST APIs,支持 Tabular data 和 Non-tabular data 的统一访问和治理。
企业 RAG 和 Data agent
RAG(检索增强生成)是一种人工智能框架,将传统信息检索系统与生成式大语言模型(LLM)的功能相结合。RAG 的几种形态包括:
- Basic RAG:效果一般,基于向量的检索,易于实现,但数据有限,缺少对查询和结果进行校验。
- Advanced RAG:结合关键字和语义检索的结果,检索前后进行一定预处理,提升质量和准确性。
- Multi-modular RAG:由决策引擎选择 RAG 方法,使用多种数据源/知识库,意图理解更准确,知识内容更丰富,准确度更高。
构建企业级 Multi-modular RAG 系统需要为每个数据库、每种数据源开发连接器/reader、获取其描述信息、获得 prompt 模版、进行 NL2SQL/QL、查询数据、输入给 LLM。而使用统一元数据平台管理各类数据,可以简化开发,实现统一数据访问和权限管控,易于扩展。
统一元数据管理最佳实践
实践案例包括:
- 某先进制造企业:通过基于 Gravitino 的统一元数据管理,实现 Data + AI 一体化,包括存量数据纳管、Data + AI 一体化开发、统一 AI 资产管理等。业务案例包括数据降本、基于统一元数据的 MLOps 等。
- 某互联网社交平台:通过 OneMeta 集成 Gravitino,提供定制化接口和 catalog 实现,降低代码的侵入性,便于同步社区最新代码。基于 Gravitino Fileset 文件治理,实现 HDFS EC 和 TTL,减少存储成本。
总结
AI 时代对数据治理提出更高的要求,统一元数据可以帮助企业管理多云异构数据,提供统一视图、确保安全与合规。企业级 RAG 应用需对接多种数据,需统一数据访问;统一元数据+统一引擎助力实现更强大的 Data agent,简化数据访问。