AI 和数据集清单(BOM)创建指南
本文档介绍了如何使用 SPDX 3.0 创建 AI 和数据集清单(BOM),旨在提高 AI 系统的透明度、可追溯性和合规性。
概述
AI 应用,尤其是那些集成开源软件和免费数据的 AI 应用,对于推动创新、促进协作、确保透明度和普及 AI 技术至关重要。然而,这些应用通常包含大量第三方组件,这些组件可能针对不同的环境进行设计,存在安全漏洞,包含受污染的数据,或具有不明确的许可条款。AI 和数据密集型应用面临着独特的挑战,例如数据安全漏洞和 AI 安全威胁。监管机构对记录非传统软件工程方面(如设计决策、已知偏差、能耗和基本权利影响评估)的义务可能会显著增加 AI 风险管理的复杂性。此外,开源许可证的日益普及为管理 AI 风险带来了新的考虑因素。
SPDX 的重要性
SPDX AI 和数据集配置文件作为促进供应链透明度和问责制的重要基石,同时能够跟踪漏洞、潜在危害和风险。通过提供有关 AI 系统设计、能力和限制的标准化文档,SPDX AI 配置文件的元数据促进了用户之间的信任和理解,使他们能够就其系统做出明智和安全的选择。这些配置文件在确保 AI 技术符合道德标准和法律要求方面发挥着至关重要的作用,并促进 AI 生态系统中负责任的研究和部署,从而在整个供应链中促进透明度和问责制。
AI BOM 框架的动机
将 AI BOM 分为 AI 和数据集配置文件是为了阐明创建 AI 模型的来源和训练方法。AI 配置文件被认为包括机器学习(ML)用例。AI 配置文件可能引用与人工智能功能直接相关的软件组件,例如传统的机器学习算法、神经网络、大型语言模型(LLM)和其他预处理和评估组件。这些组件可能具有与其他类型软件组件不同的许可考虑因素、使用限制或安全影响。通过分离 AI 和数据集配置文件,使用 SPDX 组成的 AI BOM 旨在提供更细粒度和更全面的软件组成视图,从而更容易让利益相关者评估和管理相关的风险、义务和依赖关系。
AI BOM 框架的定义
2021 年,我们成立了一个由行业和学术界专家组成的多元化工作组来开发 AI BOM。该小组包括来自 AI 和软件工程等各个领域的活跃研究人员、教授、首席技术官、产品经理、AI 开发人员和法律专家。工作组的初始目标是制定一个不仅提供透明度,而且增强 AI 系统中的可追溯性、问责制、来源、谱系和自动化标准的标准。
方法论
工作组的初始任务是为 AI BOM 确定必要的字段。经过分析现有工具(如模型卡、数据表和事实表),最终确定了 36 个字段,其中 20 个字段用于 AI 包(其中 5 个是必需字段),18 个字段用于数据集包(其中 6 个是必需的)。
与其他工具的比较
本文档将 SPDX AI 和数据集配置文件与其他现有工具(如数据表、模型卡和事实表)进行了比较,以确定其独特性和改进之处。
使用 SPDX 遵守国际标准和监管框架
本节展示了如何使用 SPDX 确保框架与最佳实践和当前 AI 标准保持一致,并与欧盟 AI 法、美国 FDA 和 EMA 医疗设备监管要求以及 IEEE 伦理技术标准(P70xx 系列)进行了比较。
持续的修订和更新
随着 AI 领域的不断发展,工作组仍在努力将新的字段和考虑因素纳入 AI 清单(BOM)。定期更新和修订是此过程的重要组成部分,确保 AI BOM 保持最新并符合道德 AI 使用和文档的最高标准。
配置文件的关键元素
本节讨论了 AI 和数据集配置文件中的关键元素,包括许可细节、性能和验证指标、偏差和限制、模型详细信息、负责任的 AI 考虑因素、模型架构、气候变化考虑因素、训练数据和方法的详细信息、数据集详细信息、数据集架构、数据集偏差和限制、数据集负责任的 AI 考虑因素、数据集可用性、数据集类型、数据集更新机制、是否包含敏感个人信息、传感器和预期用途。
必要的 AI 包字段
本节列出了构成 AI 配置文件的必需字段,包括 spdxId、名称、构建时间、下载位置、包版本、主要目的、发布时间、提供者以及与已声明的许可证和已确定的许可证的关系类型。
可选的 AI 包字段
本节列出了构成 AI 配置文件的可选字段,包括自主类型、领域、能耗、能耗数量、能耗单位、微调能耗、超参数、推理能耗、有关应用程序的信息、有关训练的信息、限制、指标、指标决策阈值、模型数据预处理、模型可解释性、安全风险评估、标准合规性、训练能耗、是否使用敏感个人信息和模型类型。
必要的数据集包字段
本节列出了构成数据集配置文件的必需字段,包括 spdxId、名称、构建时间、下载位置、包版本、主要目的、发布时间、提供者以及与已声明的许可证和已确定的许可证的关系类型。
可选的数据集包字段
本节列出了构成数据集配置文件的可选字段,包括匿名化方法、保密级别、数据收集过程、数据预处理、数据集可用性、数据集噪声、数据集大小、数据集类型、数据集更新机制、是否包含敏感个人信息、已知偏差、预期用途和传感器。
常见的 AI 和数据集包字段
本节详细介绍了对 AI 包和数据集包都常见且必需的字段,包括构建时间、spdxId、下载位置、名称、包版本、发布时间、主要目的、提供者以及与已声明的许可证和已确定的许可证的关系类型。
具体的 AI 包字段
本节详细介绍了构成 AI 包的特定字段,包括自主类型、领域、能耗、能耗数量、能耗单位、微调能耗、超参数、推理能耗、有关应用程序的信息、有关训练的信息、限制、指标、指标决策阈值、模型数据预处理、模型可解释性、安全风险评估、标准合规性、训练能耗、是否使用敏感个人信息和模型类型。
具体的数据集包字段
本节详细介绍了构成数据集包的特定字段,包括匿名化方法、保密级别、数据收集过程、数据预处理、数据集可用性、数据集噪声、数据集大小、数据集类型、数据集更新机制、是否包含敏感个人信息、已知偏差、预期用途和传感器。
真实世界证据示例
本节提供了使用 SPDX 3.0 创建 AI BOM 的真实世界示例,包括手写文本识别应用(SimpleHTR)和 CO2 数据集。
未来方向
SPDX 正在不断发展,以支持更广泛的组件和更复杂系统的风险分析。未来的发展方向包括引入硬件、服务、测试、行为分析和操作配置文件,以及与 ISO 和 IEEE 标准的进一步协调,并验证对全球政府法案的合规性。