研究背景与问题
随着人工智能技术从开源软件时代迈向开源大模型时代,开源已成为推动技术创新和打破科技垄断的重要力量。然而,开源大模型涉及代码、参数(权重)、数据等复杂组件,其法律属性、私法保护及合规义务远比传统软件复杂。本报告旨在识别开源大模型全生命周期(孵化期与市场化期)中的法律风险,并为企业提供系统的合规与防范建议。
目前业界对“开源”定义未达成共识,存在从“完全封闭”到“完全开放”的多种形态。其中,“开放权重”(Open Weights)成为当前高性能模型发布的主流策略(如Meta的LLaMA系列)。开源AI不再仅仅是代码的开放,还涉及人工智能模型本体,即包括实现与运行模型所需的各类技术组件,如模型权重、训练数据和算法,以及模型的衍生物,即基于模型生成的输出内容。通过分析,上述开放对象分别可享有一定的民事权益。
本报告将开源大模型的生命周期划分为“孵化阶段”与“市场化阶段”。
- 孵化阶段:指从人工智能项目立项、开源发布前的技术准备和开发阶段、开源项目发布阶段、发布后的社区运营和维护、最后到项目逐步成熟到足以转化为产品或服务的整个时期。
- 市场化阶段:指开源模型已经孵化成功后,由开源项目管理者或者第三方以模型供应商、服务提供者的身份向市场推广应用。
尽管闭源模型(如最新的GPT系列)在性能上仍占优势,但开源模型(如DeepSeek、Qwen、LLaMA等)正在迅速追赶,促使更多企业采用“小模型开源、大模型闭源”或“代差开源”的混合策略。传统的开源软件许可证(如Apache 2.0)难以完全覆盖AI的复杂性。新型许可证如RAIL(负责任AI许可证)和LLaMA系列许可证应运而生,它们引入了“行为限制”(如禁止军事用途、限制大规模商用)等新型内容条款。
开源人工智能的定义、组件及阶段
- 开源人工智能的开放对象:
- 模型本体:多组件构成的技术系统,包括代码、参数(权重)、数据等。
- 模型衍生物:输出内容,如模型生成的文本、图像、音频、视频等生成式成果。
- 开源人工智能的定义:国际社会对开源人工智能的定义尚未形成广泛共识一致的结论。目前具有一定影响力的概念有OSI作出的“开源人工智能定义1.0”以及欧盟《人工智能法》序言对开源人工智能的定义。
- 开源人工智能及生成物的民事权益:
- 著作权保护:人工智能系统本身的可著作权性分析,模型生成物的可著作权性分析。
- 商业秘密保护:模型本身或其各个组件只要符合“秘密性、价值性以及保密措施”三大要件,就可享有商业秘密保护。
- 专利保护:人工智能算法的可专利性,人工智能生成物的可专利性。
- 数据权益保护:作为大模型的开发者,企业可能在数据采集和使用过程持有某些特定数据,例如用于训练模型的大规模数据集。
- 开源人工智能的开源孵化阶段与市场化阶段:
- 孵化阶段:涵盖开源规划、数据准备、模型研发、内部测试、开源合规预审等核心环节。
- 市场化阶段:指开源模型已经孵化成功后,由开源项目管理者或者第三方以模型供应商、服务提供者的身份向市场推广应用。
开源人工智能生态现状
- 开源人工智能项目、组织及平台:开源人工智能生态的构建依赖于项目、组织与平台的共同推动,以“技术-规则-市场”的三元结构共同构成开源人工智能生态的基础设施。
- 不同类型/程度的开源(开放)人工智能:业界尚未达成真正共识,市面自称“开源”的人工智能,其实开放程度并不一致。本报告采取以人工智能系统提供的最大访问和使用自由类型进行分类。
- 开源(开放)人工智能的产业地位:开源AI已成为人工智能版图中不可或缺的一极。开放与封闭两种模式也在相互促进和相互转化,各大公司根据自身优势选择差异化的发布策略。
- 开源人工智能的主流许可证:当前开源人工智能所使用的许可证,不仅包括之前传统的开源软件许可证,而且包括一些新生的许可证,如RAIL(负责任AI许可证)和LLaMA系列许可证。
企业防范相关法律风险的建议
- 开源大模型是技术红利与法律风险的共生体。企业在享受开源带来的生态优势时,必须从“代码思维”转向“模型思维”。
- 开源大模型的法律风险防范体系:企业应从源头的开源策略选择入手,建立跨部门的合规治理架构,并针对私法(知识产权与合同)与公法(监管合规)风险实施精细化管理。
- 开源大模型的法律风险防范建议:
- 开源选择:根据自身市场策略和战略目标进行选择,慎重开放权重及训练数据集。
- 许可证设计:开源许可证设置方式和具体内容设计是工作重心。
- 合规体系建立:建立跨部门的合规治理架构,并针对私法与公法风险实施精细化管理。
研究结论
开源人工智能的开放特质在释放技术红利的同时,也存在潜在的法律风险并需要谨慎防范。企业应建立完善的合规体系,从开源策略选择、许可证设计、数据合规管理以及全球监管应对等方面构建牢固的法律防火墙,以确保开源人工智能项目的可持续发展。