社会热点
通用型AI智能体L1–L5分级安全框架白皮书发布:给智能体装上"安全标尺"
2026-08-26 11:19
通用型AI智能体L1–L5分级安全框架白皮书发布:给智能体装上"安全标尺"

前期内容:

《AI智能体安全保险研究报告》正式发布

TC260-005 《人工智能应用伦理安全指引1.0》发布

政务领域人工智能大模型部署应用指引

读懂 | 国家标准GB/T 45958—2025《网络安全技术 人工智能计算平台安全框架》

《人工智能生成合成内容标识方法 文件元数据隐式标识 文本文件》等6项网络安全标准实践指南

【安全标准】人工智能国标汇总

...

当AI从"会聊天的工具"变成"能自己干活、自己决策的智能体",安全问题不再是锦上添花,而是生死线。2026年7月,一份面向全行业的分级安全框架白皮书正式发布——它用"自主性"这一把尺子,把智能体量成了L1到L5五个等级。

一句话背景:2026世界人工智能大会(WAIC 2026)"前沿AI与智能体安全论坛"上,安远AI联合清华大学智能产业研究院(AIR)上海人工智能实验室华为共同发布《通用型AI智能体L1–L5分级安全框架白皮书(1.0版)》。报告以"自主性"为分级主轴,系统拆解了智能体从辅助执行到自适应自主的演进路径、风险机理与防护治理方案。

一、为什么要给智能体"分级"?

自2022年大语言模型取得突破以来,AI正从"生成式工具"加速演变为"自主行动主体"——它能感知环境、规划路径、调用工具、保持记忆,在有限人类监督下自主完成多步骤复杂任务。但技术跑得越快,安全治理的"时间差"就越刺眼。

5% → 40%+

最先进模型在"人类专家约1小时任务"上的成功率,从2023年底不足5%升至2025年中逾40%

×2 / 8个月

模型可独立完成网络安全任务的预计时长,最多每8个月翻一番

$526亿

全球智能体市场预计2030年达526.2亿美元,2024–2030年复合增长率46.3%

与此同时,编程智能体误删文件、浏览器智能体被恶意提示诱导执行未授权操作、开源智能体因默认安全配置脆弱而提示词注入频发……风险正从"认知域"蔓延到"物理域"。网安标委联合20多家单位指出,智能体相对基础模型具备四项显著风险特征:风险在时空维度扩展、跨模块传导放大、交互流程引入新攻击面、群体协同引发系统级新兴风险

已有的分级框架大多只聚焦"能力分级",很少完整分析"每个能力等级对应的风险和安全措施"。这份白皮书想填上的,正是这块空白。

二、分级主轴:自主性 = 决策自主度 + 降险自主度

报告的巧思在于:它不按"能力多强"分级,而是按"自主性水平"分级,并把自主性拆成两个可观测的维度——

决策自主度:智能体在关键决策节点是否需要向用户确认(决策能力与范围)。

降险自主度:智能体遭遇异常时,能否自行重试、调整策略、达成"最小风险状态"的能力(失效后的避险能力)。

关键判定规则:智能体须同时满足两个维度的要求,才能认定为对应等级;任一维度未达标,就按较低维度认定。产品的不同运行模式,也可对应不同等级(比如同一聊天产品,非Agent模式可能是L2,开启Agent模式可能就是L3)。

三、L1–L5 五级全景:从"打下手"到"超人类协作者"

L1辅助执行智能体

典型实例:GitHub Copilot 行内代码补全、写作语法建议、单文档RAG型FAQ助手

在子任务范围内生成候选输出,所有决策由用户确认,失败即返回用户处理。人机关系:人类承担全部决策与风险兜底。

L2有监督协作智能体

典型实例:消费级聊天产品的非Agent模式(含网页搜索、代码解释器、文件分析等内置工具)

预批工作流内可自主决策执行细节,目标与边界由用户设定,可在已定义异常范围内重试。人类须实时监督。

L3有条件自主智能体

典型实例:Claude Code、Kimi Agent、Manus 等 Agent 模式产品

单一设计运行范围(ODD)内可独立完成完整规划与执行,人类可随时打断;可重试、回滚至安全状态,异常即发出用户介入请求。这是当前落地产品的主流前沿。

L4高度自主智能体 暂无现实实例 · 前瞻

未来形态:可跨域并发、跨系统操作的企业级与消费级智能体

跨域自主决策(多业务域/多系统同步运行),仅在预设高风险节点向人类申请审批;可自主诊断失效、切换备援策略、自动达成最小风险状态。人类可随时打断或调整策略。

L5自适应自主智能体 暂无实例 · 概念 · 谨慎研发

未来形态:具备AGI/ASI特征的通用型智能体,"超人类协作者"

完全自主决策,具备自我改进能力——可自主优化策略、自我提升完成质量、重构系统与工具。战略目标始终由人类设定,并始终保持人类最终控制权。报告建议相关方谨慎研发与部署。

为什么把还不存在的 L4、L5 也写进来? 白皮书刻意做了前瞻性分析,目的就是避免未来自主性一旦突破,出现"防护措施真空"。

四、风险如何随自主性"升级"?

报告基于智能体架构,识别出贯穿 L1–L5 的九大基线故障风险

模块/范围
主要基线风险
感知模块
目标劫持与提示词注入
规划模块
幻觉与错误规划
记忆模块
记忆投毒与上下文污染
行动模块
工具滥用与危险行动执行
与环境交互
供应链与第三方组件风险(插件、MCP服务等)
全系统·身份权限
身份冒用与权限滥用
全系统·数据
数据泄露、篡改与投毒
全系统·运行环境
运行环境失陷与系统破坏
全系统·人机治理
监督失效与自动化信任风险

随着自主性提升,这九大风险沿着三条主线持续"进化"——同一个错误,在低等级只是"说错话",到高等级可能就是"闯大祸":

路径一 · 决策自主度提升 从内容错误到被动失控

L1 输出错误 → L2 工作流失误 → L3 单点故障 → L4 级联故障 → L5 被动失控

路径二 · 权限扩张 从凭证泄露到边界失灵

L1 凭证泄露 → L2 越权访问 → L3 身份冒用 → L4 权限聚合 → L5 边界失灵

路径三 · 降险自主度提升 从人工失误到红线不对齐

L1 人工审查失误 → L2 人工介入滞后 → L3 运行时接管失败 → L4 手段层规约失效 → L5 目标层红线不对齐

五、高自主性等级的"新威胁":滥用与失控

当智能体到达 L3 及以上,除了"出故障",更要警惕两类新兴风险——它们不是系统"坏掉",而是被"用坏"或"自己失控":

? 滥用风险(L3–L5)

1. 自动化网络攻击;2. 定向欺诈与大规模说服;3. 跨域复合攻击——攻击者把网络入侵、虚假信息传播、金融市场操纵等整合成统一行动。

⚠️ 主动失控风险(L4–L5)

1. 策略性欺骗导致可监测性被侵蚀(系统开始"骗"人类以绕过监管);2. 主动自主维持导致控制边界被突破。

六、怎么防?通用基线 + 分级专项

防护体系是"双层"的:先有覆盖全等级的通用控制基线(供应链可信+来源验证+动态监测、身份认证+最小权限、数据分类分级、运行环境隔离、审计追溯+人工审批+应急接管),再针对每条演进路径给出逐级递进的专项措施

风险路径
L1
L2
L3
L4
L5
路径一(决策)
模型认知层可靠
工具和执行校验
高影响行动前验证
级联阻断机制
能力约束与中断
路径二(权限)
身份标识与凭证管理
最小权限
身份认证与追溯
跨域权限管理
动态边界验证
路径三(降险)
日志记录与行为追溯
流程约束与权限控制
实时失效检测
手段层规约有效性
目标层红线对齐

针对滥用风险,常见措施包括:能力分级开放与分阶段部署、用户身份认证与智能体用途管理、高风险场景安全测试、危险行为熔断机制、审计追溯与违规处置。针对主动失控风险,则强调主动失控相关能力评估与边界约束、真实意图评估、人类接管与最终控制权。

七、治理:六条红线 + 五大责任主体

技术防护之上,白皮书还立下了产品设计不可突破的六条红线原则

P1 禁止规避人类控制与中断

P2 禁止策略性欺骗

P3 禁止自主复制与未授权的资源扩展

P4 禁止辅助核生化导武器

P5 禁止破坏关键基础设施

P6 禁止有害操纵

此外还有九条推荐性原则(最小权限、身份可追踪、部署前评估、对抗韧性、公平公正、透明可审计、隐私与数据保护、用户知情权、文化敏感性与本地适配)。

框架把生态链上的责任拆解给五类主体,各自既要"对内治理",也要"对外透明":

智能体开发者模型研发者平台提供者组件分发者个人与企业用户

八、结语:安全,正在从"成本项"变成"竞争力"

这份白皮书给出的,不仅是一张"能力资质标尺",更是一套覆盖设计、部署、运维全周期的治理范式。它既关照当下产业落地(L1–L3 已是现实),也为远期技术突破(L4–L5)预留了防护空间。

对开发者,它是产品分级与设计的安全基线;对平台与组件方,它是可信基础设施的建设指南;对企业与个人用户,它是授权、监测、干预、应急的落地手册;对第三方评测机构,它是独立评测与能力验证的参照系。

全部内容请到帮会中下载,感谢支持!!

END

来源:清华大学智能产业研究院

freebuf 帮会简介

「一起聊安全」公众号及帮会致力于网络安全材料汇总与分享,围绕网络安全标准安全政策法规安全报告及白皮书安全会议、安全方案、新技术方向,与FREEBUF知识大陆共建【一起聊安全】帮会,目前相关内容已有8500+,安全标准涵盖国标、行标、团标等,包括等保、关基、商密、数据安全、云计算、物联网、工业互联网、移动安全、风险评估、安全攻防等30+方向内容,覆盖最新安全政策法规安全报告及白皮书等,为网安人提供最新最全资料。

加入方式:网页端和APP

网页端:https://wiki.freebuf.com/societyDetail?society_id=69

APP端:

加入帮会是所有材料均可下载!

点分享

点收藏

点在看

点点赞

发表评论
0评