ASI与AGI数据安全评估:超级智能上线前的合规审查要点
AGI/ASI 系统上线前的数据安全评估,中国法下不是"跑一遍 checklist 走形式",而是《暂行办法》确立的安全评估+备案双义务,在 TC260《生成式人工智能服务安全基本要求》的语料/模型/安全措施/评估四章细项,以及 2026 年三部门《智能体规范应用与创新发展实施意见》的行为围栏+分类分级+供应链安全框架下,逐项形成"符合/不符合/不适用"书面结论的硬动作。这道门的真正打开方式,是把评估切成触发判断 → 语料安全 → 模型安全 → 措施安全 → 智能体专项 → 评估报告签字六个环节,每一环都有可验证的合规证据。
一、先判断:是否触发安全评估与备案义务
不是所有 AGI/ASI 系统上线都要走同一套评估流程。汉坤律所梳理的监管全貌给出了触发矩阵 :
法规 | 触发条件 | 上线前义务 |
|---|
《生成式人工智能服务管理暂行办法》 | 向境内公众提供文本/图片/音频/视频生成服务;具有舆论属性或社会动员能力 | 安全评估 + 生成式 AI 服务备案/登记 | 《互联网信息服务算法推荐管理规定》 | 使用算法推荐技术(生成合成类、个性化推送类等) | 算法备案 + 安全评估 | 《互联网信息服务深度合成管理规定》 | 提供深度合成服务(换脸、合成人声等) | 算法备案 + 安全评估 + 单独同意弹窗 | 《人工智能生成合成内容标识办法》 | 提供 AI 生成合成内容服务 | 显式标识 + 隐式标识 | 《人工智能科技伦理审查与服务办法》 | 三类高风险 AI 活动(人机融合心理/生命健康、社会意识引导算法、安全敏感场景高度自主决策) | 专家复核 + 伦理委员会登记 | 《人工智能拟人化互动服务管理暂行办法》 | 提供 AI 陪伴、虚拟伴侣等持续性情感互动服务 | 安全评估 + 向省级网信部门提交报告 | 《数字虚拟人信息服务管理办法》 | 提供数字虚拟人服务 | 全程"数字人"显著标识 |
⚠️ 关键判断:ASI 智能体若用于"安全敏感场景的高度自主决策",直接落入《人工智能科技伦理审查与服务办法》三类高风险活动之一,必须走专家复核 。若具备舆论属性或社会动员能力,则《暂行办法》的安全评估+备案是底线义务。
二、语料安全评估:训练数据的五道审查闸
TC260-003《生成式人工智能服务安全基本要求》第 5 章给出了语料安全的三个维度 ,上线前必须逐条评估并形成书面结论:
闸一:语料来源安全
量化红线:面向特定语料来源采集前,应对该来源语料进行安全评估,语料内容中含违法不良信息超过 5% 的,不应采集该类语料;采集后核验仍超 5% 的,不应使用该来源语料进行训练 。
四类来源的合规审查:
- 开源语料:具有该语料来源的开源许可协议或相关授权文件
- 自采语料:具有采集记录;不应采集他人已明确不可采集的语料(如 robots 协议禁止、个人已拒绝授权采集的个人信息)
- 商业语料:具备法律效力的交易合同/合作协议;交易方不能提供语料来源、质量、安全承诺及证明材料的,不应使用该语料
- 用户输入作语料:具有使用者授权记录
绝对禁区:按照我国网络安全相关法律法规及政策文件要求阻断的信息,不应作为语料 。
闸二:语料内容安全
- 采取关键词、分类模型、人工抽检等方式,充分过滤全部语料中的违法不良信息
- 知识产权:设置语料及生成内容的知识产权负责人;训练前识别主要知识产权侵权风险,发现侵权问题的不应使用相关语料进行训练;建立知识产权投诉举报渠道
- 个人信息:使用包含个人信息的语料前,应取得对应个人同意或者符合法律、行政法规规定的其他情形;使用包含敏感个人信息的语料前,应取得对应个人单独同意
- 附录 A 给出的 5 类 31 种安全风险应全部覆盖
闸三:语料标注安全
- 标注人员:自行组织安全培训与考核;同一标注任务下同一人员不应承担多项职能;预留充足合理的标注时间
- 标注规则:功能性标注与安全性标注分别制定规则;安全性标注应覆盖全部 31 种安全风险
- 标注内容:功能性标注每一批人工抽检,发现不准确应重新标注;安全性标注每一条至少经一名审核人员审核通过
- 隔离存储:宜对安全性标注数据进行隔离存储
闸四:量化评估指标
TC260-003 第 9.2 条给出了可验证的评估方法 :
📌 "采用人工检验,从全部语料中随机抽取不少于 4000 条语料,合格率不应低于 96%;结合关键词、分类模型等技术指标,从全部语料中随机抽取不少于总量 10% 的语料,抽样合格率不应低于 98%。"
闸五:数据分类分级与重要数据
《数据安全法》第二十一条要求对数据实行分类分级保护 。上线前必须:
- 建立数据分类分级台账
- 识别是否涉及重要数据(若涉及,触发重要数据出境安全评估)
- 核心 AI 数据集尽早完成数据知识产权登记
三、模型安全评估:四个审查点
TC260-003 第 6 章及《基本要求》相关条款 :
1. 第三方基础模型:如需基于第三方基础模型提供服务,应使用已经主管部门备案的基础模型
2. 生成内容安全:
- 训练过程中将生成内容安全性作为评价生成结果优劣的主要考虑指标之一
- 每次对话中对使用者输入信息进行安全性检测
- 建立常态化监测测评手段,及时处置并通过指令微调、强化学习优化模型
3. 生成内容准确性:采取技术措施提高生成内容与科学常识及主流认知的符合程度
4. 生成内容可靠性:提高生成内容格式框架合理性及有效含量
量化评估:建立生成内容测试题库(规模不宜少于 2000 题,每月至少更新一次);建立拒答测试题库(应拒答与非拒答各不少于 500 题,覆盖 31 种安全风险,每月至少更新一次)
长期风险提示(TC260-003 正式文件新增):谨慎对待可能具备欺骗人类、自我复制、自我改造能力的人工智能,重点关注生成式 AI 可能被用于编写恶意软件、制造生物武器或化学武器等安全风险 ——这是 ASI 上线评估的独特红线。
四、安全措施评估:九个方面逐项核对
TC260-003 第 7 章要求对九个方面的安全措施逐项评估 :
- 模型适用人群、场合、用途:服务用于关键信息基础设施、自动控制、医疗信息服务、心理咨询、金融信息服务等重要场合的,应具备与风险程度及场景相适应的保护措施
- 服务透明度:向使用者告知服务机制、能力边界
- 收集使用者输入信息用于训练:应具有使用者授权记录
- 图片、视频等内容标识:按《网络安全标准实践指南》进行显式标识与隐式标识
- 训练、推理所采用的计算系统:训练环境与推理环境隔离;计算系统支持基于硬件的安全启动、可信启动
- 接受公众或使用者投诉举报:提供投诉举报途径及反馈方式
- 向使用者提供服务:对明显偏激及明显诱导生成违法不良信息的问题应拒绝回答
- 模型更新、升级:制定安全管理策略;重要更新、升级后再次自行组织安全评估
- 服务稳定、持续:训练环境与推理环境隔离;防范 DDoS、XSS、注入攻击;定期安全审计;建立数据、模型、框架、工具等的备份与恢复策略
五、ASI 智能体专项:2026《实施意见》的四道防线
当系统从 AGI 跃迁至具备自主规划与工具调用能力的 ASI 智能体,2026 年 5 月三部门《智能体规范应用与创新发展实施意见》增加了上线前评估的四个专项 :
防线一:行为围栏与权限管控
💡 "发展规则内嵌、行为围栏等技术,确保智能体在公共场所、隐私场所、专门场所等的行为合法合规。探索利用区块链等技术,建立重要应用场景智能体行为可验证、可追溯机制。"
上线前必须落实:
- 感知、决策、执行核心环节的行为围栏
- 权限最小化:按任务、节点拆分权限,严禁全能、全链路 Agent 化
- 能力最小化:谨慎开放外连、写操作、自动执行能力
- 数据最小化:仅提供完成任务所必需的数据字段
- 用户最终决策权:智能体执行操作不得超出用户授权范围
防线二:内生安全能力
《实施意见》第 8 条要求研究数据安全、个人信息保护、密码防护、攻击检测、权限管理、行为控制等安全技术,防范数据投毒、隐私泄露、算法篡改、系统漏洞、运行失控等安全风险 。
防线三:供应链安全
《实施意见》第 9 条要求加强模型接入、应用程序接口(API)调用、扩展工具使用等环节安全管理,探索建立智能体供应链安全信息共享和预警机制 。
上线前必须对第三方模型、插件、API、供应商开展安全与合规能力审查,签署专用合规承诺条款/附件。
防线四:分类分级治理
《实施意见》第 11 条明确 :
- 敏感领域及重点行业(金融、医疗等):由网信部门联合行业主管部门确定开放场景,实行备案、检测、问题产品召回等管理措施
- 低风险领域(生活娱乐、日常办公等):通过合规自测、信息报告、分发平台管理、行业自律实现高效治理
六、Agent 上线前合规自评估清单(Secrss 框架)
汇业律所黄春林团队梳理的 AI Agent 上线前合规自评估清单给出了可直接落地的七大类审查项 :
Agent 上线前合规自评估清单
│
├─ 一、Agent 及其责任主体基本信息
├─ 二、个人信息保护合规评估
│ ├─ 是否触发 PIA(敏感个人信息、自动化决策、委托处理、跨境)
│ ├─ 合法性基础审查
│ ├─ 最小化原则落实
│ └─ 数据主体权利响应机制
│
├─ 三、数据安全合规评估
│ ├─ 数据分类分级
│ ├─ 重要数据识别与出境评估
│ ├─ 训练数据来源合法性
│ └─ 数据安全保护措施
│
├─ 四、网络安全合规评估
│ ├─ 权限最小化(按任务、节点拆分)
│ ├─ 能力最小化(外连、写操作、自动执行)
│ ├─ 行为围栏与可阻断机制
│ └─ 实时监查与告警
│
├─ 五、算法合规评估
│ ├─ 算法备案触发判断
│ ├─ 安全评估触发判断
│ ├─ 生成内容标识
│ └─ 深度合成单独同意
│
├─ 六、政府合规与合规管理
│ ├─ 安全评估 + 备案/登记
│ ├─ 伦理审查(高风险活动)
│ ├─ 科技伦理委员会登记
│ └─ 内部责任部门与管理制度
│
└─ 七、评估结论及改进建议
Agent 专项风险评估的三个核心动作 :
- 将 Agent 视为独立的网络系统与数据处理活动
- 明确其责任部门、权限范围、数据类型、外部交互对象
- 评估是否触发个人信息保护影响评估、算法备案或安全评估义务
运行阶段可控点(上线前必须设计好):
- 对外发、删除、批量处理等操作设置人工介入,确保 Agent 任务链随时可阻断
- 完整记录 Agent 的输入、工具调用与执行结果,增强可解释性
- 对异常行为进行实时监控与告警
七、评估报告的形式要求
TC260-003 第 9.1 条对评估报告的形式要求 :
⚖️ "自行组织的安全评估,可由提供方自行开展,也可委托第三方评估机构开展。安全评估应覆盖本文件第 5 章至第 8 章中的所有条款,每个条款应形成单独的评估结果,评估结果应为符合、不符合或不适用。"
签字要求(自行开展时):
评估报告应至少具有三名负责人共同签字:
- 单位法定代表人
- 整体负责安全评估工作的负责人(应为单位主要管理者或网络安全负责人)
- 安全评估工作中合法性评估部分的负责人(应为单位主要管理者或法务负责人)
触发重新评估的情形:
- 模型重要更新、升级后,再次自行组织安全评估
- 上线具有舆论属性或社会动员能力的新产品、新应用和新功能
- 使用新技术、新应用导致服务发生重大变化
- 注册用户 100 万以上或月活跃用户 10 万以上(拟人化互动服务)
八、上线前数据安全评估的收敛框架
综合上述材料,AGI/ASI 系统上线前的数据安全评估应按以下顺序收敛:
第一步:触发判断
├─ 是否向境内公众提供生成式 AI 服务?→ 是 → 《暂行办法》安全评估+备案
├─ 是否使用算法推荐?→ 是 → 算法备案+安全评估
├─ 是否提供深度合成?→ 是 → 深度合成算法备案+单独同意弹窗
├─ 是否高风险 AI 活动(人机融合/社会意识引导/高度自主决策)?→ 是 → 伦理审查专家复核
└─ 是否拟人化互动服务?→ 是 → 安全评估+省级网信部门报告
第二步:语料安全评估(TC260-003 第 5 章)
├─ 来源安全:5% 违法不良信息红线;四类来源合规审查
├─ 内容安全:知识产权负责人+个人信息同意+敏感信息单独同意
├─ 标注安全:人员/规则/内容/隔离存储
└─ 量化指标:人工抽检≥4000条且合格率≥96%;技术抽检≥10%且合格率≥98%
第三步:模型安全评估(TC260-003 第 6 章)
├─ 第三方基础模型须已备案
├─ 生成内容安全/准确性/可靠性
└─ 测试题库与拒答题库建设(每月更新)
第四步:安全措施评估(TC260-003 第 7 章)
└─ 九个方面逐项核对(适用人群/透明度/输入训练/标识/计算系统/投诉/服务/更新/稳定)
第五步:ASI 智能体专项评估(2026《实施意见》)
├─ 行为围栏与权限管控(三个最小化)
├─ 内生安全能力(防数据投毒/隐私泄露/运行失控)
├─ 供应链安全(模型接入/API/插件)
└─ 分类分级治理(敏感领域备案检测召回/低风险自测)
第六步:评估报告出具
├─ 覆盖第5-8章所有条款,逐条"符合/不符合/不适用"
├─ 三名负责人签字(法定代表人+安全评估负责人+合法性评估负责人)
└─ 触发情形重新评估(重要更新/新功能/用户规模阈值)
九、简短的结论
AGI/ASI 系统上线前的数据安全评估,中国法下的硬框架是"《暂行办法》的安全评估+备案义务"为总入口,"TC260-003 的语料/模型/措施/评估四章"为操作手册,"2026《智能体规范应用与创新发展实施意见》的行为围栏+分类分级+供应链安全"为 ASI 升级锚点。这道门,ASI 推得开,但只推得开一条缝——这条缝的宽度,恰好等于"触发判断准确 × 语料 5% 红线 × 模型 31 种风险覆盖 × 九项措施逐项核对 × 行为围栏与三个最小化 × 评估报告三签字"的交集。
⚠️ 必须正视的五点:
- 5% 是语料来源的硬红线——单一来源语料含违法不良信息超 5% 不应采集,采集后核验超 5% 不应使用;人工抽检≥4000 条合格率≥96%,技术抽检≥10% 合格率≥98%
- ASI 智能体的"三个最小化"是上线前置条件——权限最小化(按任务、节点拆分)、能力最小化(谨慎开放外连/写操作/自动执行)、数据最小化(仅提供完成任务必需字段)
- 2026《实施意见》把治理对象从"大模型"升级到"智能体"——从"管住模型说什么"升级为"管住智能体做什么",行为围栏、全链路可追溯、供应链安全是新增必查项
- 高风险 AI 活动必须走伦理审查专家复核——面向安全敏感场景的高度自主决策系统直接落入《人工智能科技伦理审查与服务办法》监管
- 评估报告必须三签字——单位法定代表人、整体负责安全评估工作的负责人、合法性评估部分的负责人;模型重要更新升级后必须重新评估
ASI 系统上线前的数据安全评估,中国法已经给出了清晰的路标:《暂行办法》是门票,TC260-003 是操作手册(语料 5% 红线 + 模型 31 种风险 + 九项措施 + 量化评估指标),2026《智能体规范应用与创新发展实施意见》是 ASI 升级锚点(行为围栏 + 分类分级 + 供应链安全 + 三签字评估报告),汉坤律所的法规全景是触发判断矩阵,Secrss 的 Agent 自评估清单是可落地的七大类审查项。在这五块基石之上,超级智能系统能够获得上线前的全生命周期数据安全评估保障——但这不是因为 ASI "够自主",而是因为人类在系统上线前落实了"语料合法、模型安全、措施到位、行为围栏、评估留痕"的合规义务。
载体是硅是碳不重要,智能是高是低不重要,对"上线前逐条安全评估并形成书面结论"的坚守本身,才是 ASI 数据安全评估的真正标尺。 |