第一章:定义合成数据
- 合成数据定义:合成数据是指由真实数据生成,并具有与真实数据相同统计特性的数据。根据生成方式,合成数据分为两类:一类是从真实数据集中生成,另一类是基于现有模型或分析人员背景知识生成。
- 合成数据优势:合成数据可以解决数据获取困难、提升数据质量、用于探索性分析、替代不存在的数据、进行全分析等,从而加速人工智能(AIML)项目的发展。
- 信任合成数据:由于早期合成数据方法存在误差风险,因此建立对合成数据的信任至关重要。可以通过评估数据效用和隐私保障来建立信任,例如将合成数据与真实数据进行分析结果比较,或使用验证服务器进行最终代码执行。
- 其他数据获取方法:除了合成数据,还可以通过去识别化和安全多方计算获取数据,但它们存在各自的局限性,例如去识别化成本高、安全多方计算复杂等。
- 生成合成数据的方法:从真实数据生成合成数据的方法主要包括分布拟合和生成对抗网络等,可以根据具体需求选择合适的方法。
第二章:合成过程
- 数据合成项目:数据合成项目包括数据准备、数据生成、效用评估、隐私保障等步骤。数据准备包括数据清洗、标准化、协调和链接等操作,以确保数据质量。
- 数据合成流程:数据合成流程可以根据数据来源和需求进行灵活配置,例如从单个生产环境、外部数据供应商或多个外部数据供应商获取数据。
- 合成项目管理体系:建立合成数据卓越中心(CoE)可以集中化技术和管理能力,标准化方法,并提供规模经济效益。
- 实施最佳实践:实施数据合成需要足够的计算能力,建议合成完整数据集而不是单个队列,并执行验证研究以获得数据用户的认可。
第三章:合成数据案例研究
- 制造业和分销业:利用模拟引擎生成大量图像数据,用于训练工业机器人进行复杂任务。
- 医疗保健业:利用合成数据进行癌症研究、评估创新数字医疗技术、进行快速技术评估等。
- 金融服务业:利用合成数据进行软件测试、创建数据基准等。
- 交通运输业:利用微模拟模型进行交通规划,利用模拟引擎生成虚拟环境用于训练自动驾驶汽车。
第四章:合成数据未来
- 创建数据效用框架:建立数据效用框架可以帮助评估和比较不同数据合成技术的效用,并促进合成数据的应用。
- 从合成数据中移除信息:在某些领域,例如执法和情报,需要隐藏敏感信息,因此需要开发方法从合成数据中移除特定属性或关系。
- 使用数据水印:数据水印可以用于识别合成数据,并确保其不可变性。
- 从模拟器生成合成数据:模拟器可以作为数据合成的新来源,并允许对合成数据进行操纵,以满足特定需求。