核心观点与目标
本计划旨在贯彻《“十四五”国家经济和社会发展规划纲要》,全面实施“AI+”战略,推动高质量工业数据集的建设与应用,强化数据在赋能人工智能创新发展中的关键作用。计划以习近平新时代中国特色社会主义思想为指导,遵循“需求牵引、急用先行、应用验证、安全可控”的原则,聚焦国民经济重点产业和战略性新兴产业,围绕高质量工业数据集的供给、流通和应用等关键环节,启动六大专项行动,构建“数据飞轮”生态,促进数据要素与人工智能协同发展。
目标: 到2028年底,建成一批覆盖重点领域、应用验证的高质量工业数据集;形成一批数据驱动人工智能创新发展的典型应用场景;培育一批具有领先优势的创新数据企业和专业人才;制定一批建设高质量工业数据集的标准和工具。基本形成从数据供给到价值创造的良好循环,数据在赋能人工智能创新发展中的作用更加凸显,数据产业与人工智能深度融合,智能经济新增长点持续涌现。
专项行动
-
强化基础,扩大能力
- 聚焦科研、工业制造、农业农村等重点领域及低空经济、具身人工智能等新兴领域,推进高质量工业数据集建设。
- 系统推进数据资源清查和需求统计,建立数据资源目录和数据集需求清单。
- 根据人工智能发展阶段,推进多模态高质量数据集建设,包括文本、代码、图像、音频、视频、点云、时序数据等。
- 加强与数据基础设施的有机衔接,利用隐私计算和可信数据空间等技术,推动数据集从分散持有向集约化、标准化供给转变。
-
攻克数据标注挑战
- 推动数据标注转型升级,研发自动化工具和平台,发展“模型预标注+人工校准”等智能化标注服务。
- 持续推进数据标注试点示范,引导首批七城市深化数据标注产业发展。
- 扩大数据标注人才供给,鼓励高校开设相关课程,支持校企合作培养专业人才。
-
提升质量与效率
- 加强数据清洗、增强、标注、对齐等关键技术研发,提升高质量工业数据集建设质量。
- 推进高质量数据集标准体系建设,鼓励制定重点行业领域标准。
- 强化数据集质量评估和结果互认,建立跨行业、跨场景、跨模态的评估数据集。
-
赋能应用
- 构建应用闭环,以模型应用引导数据供给,以数据驱动模型迭代,形成“场景—数据—模型”协同发展。
- 创建行业应用基准和示范项目,打造“数据赋能工场”和“数据×智能体”示范项目。
- 培育协同数据开发生态,搭建企业、高校、科研机构等交流平台,定期举办供需对接活动。
-
管理服务
- 建立数据集全生命周期管理体系,覆盖数据采集、处理、标注、质检、评估、迭代和审计等环节。
- 探索数据权属和利益分配机制,平衡产权保护与创新需求。
- 坚持伦理优先,确保数据公平性和包容性,防止数据偏见和歧视。
-
创造价值
- 发挥数据集应用价值,建立数据集与模型需求对接机制,推动跨行业、跨领域、跨场景的集成应用。
- 创新数据集商业模式,发展“订阅模式”“市场模式”“定制模式”等,探索基于代币的交易模式。
- 探索数据集资产化路径,鼓励开展数据集资产清查、登记、评估等工作,探索数据质押融资、资产证券化等模式。
- 培育数据付费市场共识,建立市场化利益分配机制,推动数据采购纳入预算,形成数据付费的市场共识。
保障措施
- 国家数据局统筹协调,相关部门协同推进,形成“部门协同、跨领域联动”的工作模式。
- 地方政府落实属地管理责任,制定支持措施,统筹安排数据产品和服务采购资金。
- 鼓励各类主体参与数据集建设,引导金融机构、风险投资、产业基金等增加投入。
- 建立尽职免责机制,完善试错容错管理机制,鼓励合规创新。
- 加强安全保障,落实数据安全法律法规要求,建立全流程安全治理机制,防范数据投毒、篡改、泄露等风险。