生成式人工智能数据标注安全规范(征求意见稿)
范围
本规范规定了生成式人工智能(GenAI)数据标注的基本安全要求,包括数据安全、标注工具安全、访问控制和数据传输等方面的安全要求;数据标注规则的安全要求;标注人员要求;数据标注核验要求;以及标注安全测试方法。
基本安全要求
- 数据安全:标注人员需确保标注数据安全,包括匿名化敏感个人信息、实施数据访问控制、数据备份、数据访问和修改记录、数据销毁等。
- 标注工具安全:定期进行安全评估、使用安全平台、记录用户操作和系统活动、确保物理环境安全、自动化标注工具合规等。
- 访问控制:制定安全访问控制策略、配置标注人员权限、及时撤销不合格人员的访问权限、设置数据访问和导出权限、安全数据单独存储等。
- 数据传输:使用安全传输协议、定义数据传输授权范围、安全数据使用独立传输协议等。
数据标注规则安全要求
- 规则内容:标注目标、数据格式、标注方法、质量指标等。
- 规则类型:功能性标注规则、安全性标注规则、其他标注规则。
- 规则要求:明确标注任务类型、识别安全风险内容、指导安全合理标注、识别不符合规则标注、验证标注质量安全、应急响应机制等。
标注人员要求
- 安全培训:组织安全培训,内容包括规则安全要求、工具使用、质量安全验证、数据安全管理、风险场景和案例等;进行安全评估,定期复训和复评。
- 人员选拔:根据任务规模和需求确定人员数量和职责,根据角色要求选拔人员,记录选拔过程。
- 人员管理:按时完成标注任务,提交结果供审核;审核人员验证结果质量,不合格返工;仲裁人员处理争议;监督人员 overseeing 活动并处理风险。
数据标注核验要求
- 基本要求:安全相关标注比例不低于30%;采用人工或混合验证方法;验证内容包括理解准确性、问答一致性、质量保证;跟踪问题纠正过程;制定数据返工要求;记录验证信息;编写验证报告;记录整个验证过程。
- 功能性标注核验安全要求:数据不含安全风险内容、内容逻辑有效、数据合理、响应内容准确、有用、及时、逻辑、易读;全面验证提示标注质量;全面验证响应标注质量。
- 安全性标注核验安全要求:提示覆盖主要安全风险场景;安全相关标注不含风险内容,提供安全回复;安全相关标注每项由至少一名审核人员审核;不合格率超过5%则整批作废。
标注安全测试方法
- 记录保留检查测试:检查安全培训、人员职责履行、平台安全评估、日志记录、数据验证、数据销毁等。
- 标注人员测试:随机选取人员,测试安全培训、规则理解、工作合规性等。
- 标注数据测试:人工抽样检查通过率;结合技术方法抽样检查通过率。