没做算法备案就敢上线大模型?训练数据真的干净吗?Aiii 人工智能创研院用一份 300 页的白皮书,把 AI 大模型从伦理到法律、从技术到商业的合规底牌翻了个遍。
2026 年 7 月,Aiii 人工智能创研院悄悄发布了一份重磅文档。
《AI 大模型合规指南(合规 99 问)》,300 页,10 个章节,99 个问题。不是那种堆满"应加强监管"废话的官样文章——每个问题后面都跟着具体的技术路径、管理流程和材料清单。
说白了,这是一本给 AI 公司法务和合规团队写的操作手册。
我花了几天通读全文,从中抽出了七个最值得从业者警惕的合规要点。不是理论探讨,是那种"不知道就可能出事"的东西。
没备案就上线,后果不只是罚款
很多技术团队觉得"先把产品跑起来,合规的事后面再说"。
白皮书第 85 问直接否定了这种思路:在中国上线面向公众的生成式 AI 服务,必须跨越两道门槛——前置安全评估和生成式 AI 服务备案。安全评估覆盖算法安全性、内容安全性、数据安全性三个维度,评估完了才能提交备案申请。
备案主体必须是中国境内依法设立的法人。境外公司不能直接在中国独立提供面向公众的生成式 AI 服务,必须依托境内实体。
没备案的后果?白皮书给了一组阶梯式惩处清单:
警告 + 限期改正
罚款 1 万到 10 万元,而且这个数字可以和《网络安全法》《个人信息保护法》的高额罚款并罚
暂停相关业务、停业整顿、吊销许可证
如果 AI 生成的内容构成了犯罪(比如危害国家安全、传播淫秽物品),直接追究刑事责任
别觉得最后一条离我们很远,已经有实际案例了。
备案流程走下来大约需要 5 到 10 个月。如果你的产品计划三个月后上线,现在就该启动了。
出了事,到底谁负责
大模型产业链有一个常见结构:A 公司开发模型,B 公司负责运营和面向用户。出了问题,责任怎么算?
白皮书第 20 问给出了一个清晰的责任分离模型,核心原则是"控制能力与责任匹配"——谁有能力预防和控制风险,谁就该承担相应责任。
具体来说,开发者作为技术源头,要对三件事负责:训练数据的合法溯源、模型算法的安全可控、技术文档的留存与披露。训练数据本身侵犯了他人著作权或个人隐私的话,开发者担主要责任。
运营方作为产品输出端,负责用户数据隐私保护、生成内容实时审核、风险监测与应急处置。AI 生成的诽谤、色情内容没有被有效过滤,运营方担主要责任。
最麻烦的是中间地带。模型存在固有偏见,开发者没向运营方充分提示风险,运营方知道风险后也没采取额外缓解措施——双方承担连带责任。
白皮书的原话很直白:"在 AI 大模型'开发-运营'分离的模式下,不存在责任的完全割裂,只存在基于控制能力的重点分配。"
这意味着,开发者和运营者之间那份合作协议,不是一份走过场的文件。权责划分写得越细,出事时越有底气。
公开数据不是免费午餐
这大概是整份白皮书里最容易被技术团队忽视的一条。
第 97 问的标题本身就是一个警告:"AI 大模型训练:公开数据等于免费午餐?"白皮书的回答是否定的。
很多技术团队觉得公开网站上的数据随便爬随便用。但数据的"公开可获取"和"可免费商用"之间隔着一条鸿沟。爬虫从公开网站抓取的数据,可能违反网站的服务条款(ToS),可能构成不正当竞争,甚至可能触犯刑法。
真正可以无限制使用的,只有明确放弃版权的公共领域数据——比如版权过期的作品,或者标记了 CC0 协议的数据集。大多数网上的公开内容,从法律角度讲都需要授权。
robots.txt 里写了"禁止爬取"?网站上标注了"禁止用于 AI 训练"?这些都必须遵守。欧盟的文本与数据挖掘(TDM)例外条款明确允许版权持有人选择退出。
白皮书给的建议八个字:授权优先,合理使用兜底。
脱敏数据 ≠ 匿名化数据
很多公司觉得"把用户数据做了脱敏处理就不算个人信息了",可以放心拿来训练模型。
白皮书第 67 问明确否定了这个想法。
去标识化(pseudonymization)和匿名化(anonymization)是两回事。去标识化只是把直接标识符替换成代号,数据仍然可以通过关联信息重新指向特定个人——在法律上,它依然属于个人信息,不能豁免《个人信息保护法》和欧盟 GDPR 的保护义务。
只有达到不可复原的匿名化标准,数据才真正脱离个人信息的法律定义。
一个经常被提到的研究:仅凭邮政编码、出生日期和性别三个字段,87% 的美国人口可以被唯一识别。去标识化的"安全性",远没有大多数工程师以为的那么高。
实操层面的含义很清楚:训练数据里包含用户信息的话,光做脱敏不够。要么做到真正的匿名化(不可逆),要么老老实实走完"告知-同意"的全流程。
数据出境的三道门
训练数据要出境?用户数据要传到海外服务器?
白皮书第 53-55 问系统梳理了中国数据出境的三条合规路径:
第一条是安全评估,适用于关键信息基础设施运营者,以及处理 100 万人以上个人信息的场景。由国家网信办审批,门槛最高,但也是覆盖面最广的强制路径。
第二条是标准合同,适用于不满足安全评估门槛的个人信息出境。向网信办备案标准合同即可。
第三条是个人信息保护认证,主要适用于跨国公司内部的数据出境。
有个细节容易被忽略:《个人信息保护法》第 39 条要求,训练数据出境必须取得个人的单独同意——不是那种埋在隐私政策里、用户随手点"同意"的概括性同意,而是针对数据出境事项的明确、单独的同意。
出境安全影响评估报告至少要保留 3 年。如果公司同时在欧盟运营,还得同时满足 GDPR 的充分性认定或标准合同条款(SCC)要求。
白皮书提出的全球合规战略可以概括为八个字:一地一策,底线统一。各法域分别部署合规方案,但企业内部要建立不低于最严格法域要求的合规底线。
算法透明不是打开黑箱
"你们模型的决策逻辑是什么?"——监管在问,用户也在问。
白皮书第 47 问给了一个有意思的说法:算法透明不是打开黑箱,而是为黑箱安装记录仪。
它把 AI 决策的解释需求分成了三个层次:
全局解释——模型整体怎么工作?适用于监管审查,比如算法备案时提交的模型说明。
局部解释——这一次具体决策怎么做出的?适用于用户权利保障,比如"为什么我的贷款申请被拒了"。白皮书推荐用 LIME 和 SHAP 等可解释性工具来量化各输入特征对决策结果的贡献度。
反事实解释——改什么条件可以得到不同结果?适用于申诉救济,比如"如果我的收入再高 2 万,贷款能过吗"。
这个分层框架挺实用。监管不需要知道你每一个神经元的权重,但需要知道你的模型在做什么、依据什么、出了问题怎么追溯。Model Card(模型卡片)和算法影响评估是目前最被认可的技术文档体系。
开源模型的"传染性"陷阱
最后一个要点,关于开源合规。
白皮书第 69 问提醒了一个很多公司踩过的坑:商用大模型使用开源算法时,如果没有仔细审查开源许可证,可能面临严重的知识产权风险。
Apache 2.0、MIT、BSD 这些宽松许可证问题不大,商业友好。但 GPL——尤其是 AGPL——有"传染性"。模型代码与 GPL 代码存在紧密耦合的话,可能触发开源义务,意味着你的专有代码也得开源。
白皮书建议的开源合规四步走:
审查每个开源组件的许可证类型
评估衍生作品的约束条件
检查专利和许可限制
确认许可证之间的兼容性
这件事不复杂,但很多创业公司在赶进度的时候直接跳过了。等到融资尽调或上市审计时被翻出来,代价就不是"换掉一个组件"那么简单了。
一个合规成熟度自测
读完这份白皮书,我从中提炼了一个简单的自测框架,供 AI 公司评估自己处在什么位置:
| 级别 | 状态 | 特征 |
|---|---|---|
| L1 | 被动应对 | 出了事再处理,没有系统性合规体系 |
| L2 | 基础合规 | 完成了算法备案,有基本的内容过滤 |
| L3 | 体系化管理 | 覆盖全生命周期的合规制度,有专人负责 |
| L4 | 主动防御 | 引入第三方审计、红队测试、数据保护影响评估 |
| L5 | 行业引领 | 参与标准制定,输出合规最佳实践 |
大多数公司还停留在 L1 和 L2 之间。而监管的底线,至少在 L2。
合规这件事,以前是"做了加分、不做也行"。
现在不是了。
白皮书里有一句话挺到位:能够证明自己已经尽职尽责的"负责任开发者",在法律上可获得减免责任的空间。反过来说,如果你连"自己做了什么"都证明不了,那法律的天平不会倾向你。
300 页的白皮书,核心信息就一个:合规能力正在成为 AI 公司的核心竞争力之一,而且这种竞争力的窗口期不会太长。
参考资料
[1] Aiii 人工智能创研院,"AI 大模型合规指南(合规 99 问)",2026 年 7 月。https://www.Aiii.org.cn


