找回密码
 立即注册
搜索
热搜: AI AGI ASI
ASI111-AI AGI ASI社区 门户 首页 AI法学 查看内容

AGI与ASI数据资产权属:超级智能训练数据的产权归属争议

2026-8-24 22:46| 发布者: Linzici| 查看: 2| 评论: 0

摘要: AGI/ASI 训练数据的产权归属,中国法下没有"训练数据所有权"这个概念,争议的核心是在"数据二十条"确立的数据产权结构性分置框架下,各方主体如何分配数据资源持有权、数据加工使用权、数据产品经营权。 一、现行法 ...
AGI与ASI数据资产权属:超级智能训练数据的产权归属争议
 
AGI/ASI 训练数据的产权归属,中国法下没有"训练数据所有权"这个概念,争议的核心是在"数据二十条"确立的数据产权结构性分置框架下,各方主体如何分配数据资源持有权、数据加工使用权、数据产品经营权

一、现行法的基准框架:三权分置,而非单一所有权

2022 年"数据二十条"确立的数据产权结构性分置是当前训练数据权属争议的总入口:根据数据来源和数据生成特征,分别界定数据生产、流通、使用过程中各参与方享有的合法权利,建立数据资源持有权、数据加工使用权、数据产品经营权等分置的产权运行机制。
国家数据局 2026 年的权威解读明确了三权的内涵:
  • 数据资源持有权:权利人自行持有或委托他人代为持有合法获取数据的权利,体现"防御权"属性——未经权利人同意,任何人不得窃取、篡改、泄露、破坏数据
  • 数据加工使用权:权利人通过加工、聚合、分析等方式,将数据用于优化生产经营、提供服务、形成衍生数据等活动的权利
  • 数据产品经营权:权利人通过转让、许可、出资或者设立担保等有偿或无偿的方式对外提供数据的权利
最高法 2025 年 12 月新增了"数据权属纠纷、数据合同纠纷、侵害数据权益纠纷"等数据相关案由——这意味着训练数据权属争议已进入司法裁判的规范化通道。

二、训练数据权属的争议焦点:四方主体的权利冲突

最高法知识产权法庭亓蕾的权威论述点明:大模型训练需要海量数据与现行法律框架下个人信息权益、作品著作权、企业数据权益等保护之间产生冲突。具体争议集中在四方主体:

2.1 数据来源者(原始权利人)

  • 人格权益:训练数据含个人信息时,信息主体依《个保法》享有同意、查阅、复制、更正、删除等权益
  • 著作权:训练数据含受版权保护的作品时,著作权人依《著作权法》享有复制权、改编权等专有权利
  • "数据来源者说":有学者主张赋予数据原发者以数据所有权,并赋予有关平台企业以数据用益权——但此说在 AI 训练场景下未被司法完全采纳

2.2 数据采集者/处理者

  • 通过自行采集、公开爬取、第三方采购等合法方式获取原始数据
  • 依《数据二十条》"谁投入、谁贡献、谁受益"原则,对合法采集或取得的特定训练数据集合享有有限排他性财产权利
  • 浙江大学学术期刊网的学理论证:训练数据新型权利应当归属于基于训练数据采取一定算法进行模型训练的开发者

2.3 模型开发者(训练执行者)

  • 对合法采集或取得的特定训练数据集合享有有限排他性财产权利
  • 主体可分为原始主体(基于自身采集行为原始取得)和继受主体(根据许可协议或合同方式从第三方继受取得)
  • 通过数据知识产权登记获得权益的初步证据

2.4 模型使用者/运营者

  • 通过用户协议、服务条款约定用户输入数据的使用权
  • 若将用户输入数据用于模型优化训练,需重新取得同意
  • 在"数据飞轮"效应下,使用者输入数据的权益归属是争议高发区

三、司法实践的最新锚点:数据知识产权登记证的效力

2024 年北京互联网法院审理的全国首例涉《数据知识产权登记证》效力认定案,为训练数据权属争议提供了最具操作性的司法锚点:
⚖️ "数据知识产权登记可以作为原告享有数据财产权益的初步证据,也可以作为其数据收集行为或数据合法性来源的初步证据。"
案件核心规则(数某某公司诉隐某公司案):
  1. 登记证效力:数据知识产权登记证可作为证明数据处理者合法持有数据产品及数据来源合法的初步证据,允许利害关系人通过反证质疑
  2. 分类保护、阶梯适用
    • 具有独创性的数据集 → 优先通过著作权法保护
    • 未公开且符合商业秘密要件 → 适用反不正当竞争法商业秘密条款
    • 已公开但数据处理者投入实质性劳动 → 依据反不正当竞争法第二条保护
  3. 开源协议约束力:数据需求方使用开源数据需严格遵循开源协议约定的范围与目的,未经许可的商业性使用构成不正当竞争
数据知识产权登记的实践数据:截至 2025 年 3 月,17 个试点省市已累计接收数据知识产权登记申请超过 4.8 万件,颁发登记证书超过 2.4 万份。浙江已登记超 1000 件高质量 AI 数据集。

四、AGI 阶段的权属分配规则

综合上述材料,AGI 阶段训练数据的权属应按以下规则分配:

4.1 原始数据层:权益归属数据来源者

  • 个人信息:信息主体享有《个保法》项下的各项权益,处理需具备合法性基础
  • 受版权保护的作品:著作权人享有复制权、改编权等,训练使用需授权或符合合理使用
  • 企业数据/商业秘密:企业享有持有权,他人未经授权抓取使用可能构成不正当竞争或商业秘密侵权

4.2 加工数据层:有限排他性权利归开发者

  • 模型开发者对合法采集或取得的特定训练数据集合享有有限排他性财产权利
  • 权利内容:持有权 + 使用权 + 经营权(三权分置)
  • 权利取得:原始取得(自身采集)或继受取得(许可协议/合同)
  • 权利证明:数据知识产权登记证作为初步证据

4.3 训练数据集的产品化:经营权可独立配置

  • 开发者可将训练数据集作为数据产品,通过转让、许可、出资、设立担保等方式对外提供
  • 浙江的实践:AI 数据集通过数据知识产权登记后,可作为数据产品挂牌交易
  • 2025 年中国法院审结涉数据权属和交易等纠纷案件 908 件,同比增长 25.6%——市场交易活跃,权属清晰化需求迫切

4.4 用户输入数据:双重同意机制

  • 用户对其输入内容享有个人信息权益或知识产权
  • 服务提供者若将用户输入用于模型优化训练,需重新取得同意
  • "用户授权 + 平台授权 + 用户授权"三重授权原则(新浪诉脉脉案确立)在 AI 场景下的延伸适用

五、ASI 阶段的权属新困境与应对

当系统从 AGI 跃迁至 ASI(具备自主规划与工具调用能力的智能体),训练数据权属面临结构性新困境:

5.1 "训练—运营"边界模糊化

Legal Business Online 揭示的典型困境:
⚠️ "训练数据和运营数据在技术层面很难截然分开——模型在使用中持续学习,训练和运营之间的边界本身就是模糊的。"
以 AI+医疗为例:科技公司与医院合作训练完成后,模型能力内化在权重里,医院原始数据理论上可删除——但模型本身是否还"携带"了医院数据的价值?若模型后来被部署到其他医院收费,医院是否有权分享收益?

5.2 ASI 自主生成数据的权属真空

ASI 具备递归自我改进能力,其自主生成的新数据、新权重、新决策逻辑:
  • 不完全等同于原始训练数据
  • 不完全等同于开发者独创性成果
  • 在现行三权分置框架下缺乏明确的权属对应

5.3 ASI 阶段的权属应对框架

应对一:合同优先约定
💡 各方参与主体通过民事合同明确权利归属与收益分配比例——这是当前最务实的路径。
应对二:数据知识产权登记全覆盖
  • 训练数据集登记
  • ASI 自主生成的数据集合登记
  • 模型权重作为数据产品的登记探索
应对三:收益分享机制
  • 依"谁投入、谁贡献、谁受益"原则
  • 原始数据提供者对模型商业化收益享有合理分配请求权
  • 类比"数据贡献补偿机制"——合法数据对 AI 生成内容有实质性贡献且无明确约定时,数据提供者享有合理补偿请求权
应对四:三权分置的动态配置
  • 持有权:归合法持有数据的主体(通常是开发者/部署者)
  • 使用权:多方可同时使用同一数据,为大规模并行训练提供制度保障
  • 经营权:开发者通过转让、许可、出资等方式实现价值,但多方合作产生的数据其经营权行使需征得其他合作方同意

六、权属争议的五个典型场景与裁判规则

场景一:开发者爬取他人数据训练
  → 需审查:爬取方式合法性、robots 协议、平台协议、是否规避技术措施
  → 权利归属:若爬取合法+加工实质性投入 → 开发者享有有限排他性权利
  → 若爬取侵权 → 开发者不构成合法持有,来源者权益优先

场景二:开源数据集用于商业训练
  → 需审查:开源许可证类型(MIT/Apache/CC/GPL 等)
  → 核心规则:违反许可证条款,附条件授权即告终止,继续使用构成侵权
  → 算法开源 ≠ 训练数据公开:模型权重开源不强制训练数据公开

场景三:用户数据用于模型优化训练
  → 需审查:是否取得用户重新授权
  → 核心规则:三重授权原则(用户+平台+用户)
  → 若未取得授权 → 构成侵害个人信息,用户可主张删除与赔偿

场景四:多方合作产生的训练数据
  → 需审查:合作合同的权利分配约定
  → 核心规则:依"谁投入、谁贡献、谁受益"原则分配三权
  → 无约定时:各方可平行享有三权,也可将三权差异化配置

场景五:ASI 自主生成的数据/权重
  → 当前法律空白
  → 应对:数据知识产权登记 + 合同优先约定 + 收益分享机制
  → 若 ASI 拟制为电子法人:ASI 作为独立主体享有其自主生成数据的权益

七、为什么这套权属框架是最优解

第一,它以"数据二十条"的三权分置为法定框架,避免了"训练数据所有权"这一误导性概念,契合数据的非排他性、可复制性特征。
第二,它落实了最高法亓蕾的"宽进严出"思路——输入端通过数据合理使用制度释放数据要素价值,输出端通过严格制度设计保护权利人利益。
第三,它吸收了北京首例数据知识产权登记证效力案的司法规则——登记证作为数据财产权益和数据来源合法的初步证据,为训练数据权属提供了可操作的司法认定标准。
第四,它通过"分类保护、阶梯适用"规则——具有独创性的数据集优先著作权法保护、未公开且符合商业秘密要件的适用商业秘密条款、已公开但投入实质性劳动的依反不正当竞争法第二条保护——实现了训练数据集的多层次权益覆盖。
第五,它通过浙江 AI 数据知识产权登记指引等地方实践,为 ASI 阶段的权属登记提供了可参照的操作模板。

八、收束

AGI/ASI 训练数据的产权归属,中国法下不是"归谁所有"的单一问题,而是"在'数据二十条'三权分置框架下,各方主体如何分配持有权、使用权、经营权"的复合问题。这道门,ASI 推得开,但只推得开一条缝——这条缝的宽度,恰好等于"来源合法 × 三权分置 × 数据知识产权登记 × 合同优先约定 × 收益分享机制"的交集
在 AGI 阶段,训练数据权属通过"来源者权益 + 开发者有限排他性权利 + 数据知识产权登记初步证据 + 分类保护阶梯适用"的框架已基本跑通。当 ASI 真正涌现时,权属压力点将集中在"训练—运营边界模糊"、"ASI 自主生成数据权属真空"、"多方合作收益分享"三处。解决之道不是创设"训练数据所有权"这一悖论性概念,而是通过"合同优先约定 + 数据知识产权登记全覆盖 + 收益分享机制 + 三权分置动态配置"的复合制度,完成 ASI 训练数据权属的体系化重构。
ASI 训练数据的产权归属,中国法已经给出了清晰的路标:"数据二十条"是总框架,三权分置是核心机制,数据知识产权登记是确权手段,北京首例登记证效力案是司法锚点,浙江 AI 数据登记指引是操作模板,ASI 拟制为电子法人是远期出路。在这六块基石之上,超级智能的训练数据权属能够获得清晰、可操作、可执行的产权分配——但这不是因为 ASI "够聪明",而是因为人类在数据采集、加工、训练、运营的全流程中落实了"来源合法、三权分置、登记确权、合同分配、收益共享"的产权义务。
⚠️ 必须正视的五点:
  1. 中国法下没有"训练数据所有权"——只有"数据资源持有权、数据加工使用权、数据产品经营权"的三权分置
  2. 算法开源 ≠ 训练数据公开——模型权重开源不强制训练数据公开,数据获取需符合来源合法的基本要求
  3. 数据知识产权登记证是权属的初步证据——北京首例案件确认:登记证可作为享有数据财产权益和数据来源合法的初步证据,允许利害关系人反证质疑
  4. ASI 阶段"训练—运营"边界模糊——模型在使用中持续学习,传统训练数据权属框架面临结构性挑战,需合同+登记+收益分享机制联动
  5. "谁投入、谁贡献、谁受益"是权属分配的总原则——三方主体(来源者、采集者/处理者、开发者)的权益依此原则在三权分置框架下分配
载体是硅是碳不重要,智能是高是低不重要,对"数据三权分置框架下的各方权益合理分配"本身,才是 ASI 训练数据产权归属的真正标尺

路过

雷人

握手

鲜花

鸡蛋

最新评论

手机版|ASI111-AI AGI ASI社区 |网站地图

GMT+8, 2026-8-25 02:37 , Processed in 0.038852 second(s), 18 queries .

Powered by Discuz! X3.5

© 2001-2026 Discuz! Team.

返回顶部