AI科普馆部分垂类内容转移至?
【长三角人工智能联盟】公众号,快点进去瞧瞧!
安远AI联合上海人工智能实验室、清华大学智能产业研究院、华为发布的《通用型AI智能体L1-L5分级安全框架白皮书》(1.0版),在WAIC 2026上首次公开。60页篇幅回答三个问题:怎么按自主性给智能体分级、风险随等级提升如何演进、各等级该配什么安全措施。已有分级框架多止步于能力划分,这份白皮书把"能力等级—风险图谱—防护措施"三条线贯通。
用"自主性"做主轴,拆成两个维度
白皮书以"自主性水平"而非"能力强弱"作为分级主轴,借鉴自动驾驶分级思路,把智能体分为五级:
L1辅助执行:只生成候选输出,最终采纳由用户确认。典型如GitHub Copilot行内补全、单文档RAG问答。
L2有监督协作:在预批工作流内自主决定执行细节,人类可随时打断。典型如ChatGPT、Claude、豆包的非Agent模式。
L3有条件自主:单一设计运行范围(ODD)内独立完成完整规划与执行,异常即主动让出控制权。Claude Code、Kimi Agent、Manus、OpenClaw均在此列。
L4高度自主:可跨域并发,常规运行无需介入,仅高风险节点申请审批。当前无现实实例。
L5自适应自主:具备自我改进和自主迭代能力,无ODD限制。当前无任何实例,属概念性目标。
分级的关键设计在于:自主性被拆成决策自主度(谁做决策)和降险自主度(谁为风险兜底)两个正交维度。智能体须同时满足两个维度的要求才能归入对应等级——L3的决策自主度配上L2的降险自主度,整体只能算L2。这堵住了"会决策但不会止损"的高自主性幻觉。
九大基线风险:贯穿全等级
白皮书按智能体系统架构梳理出九大基线故障风险(R01-R09):感知模块的目标劫持与提示词注入、规划模块的幻觉与错误规划、记忆模块的记忆投毒与上下文污染、行动模块的工具滥用与危险行动执行、供应链的第三方组件风险、身份管理的权限滥用、数据层的泄露与投毒、运行环境的系统破坏,以及人机协作层的监督失效与自动化信任风险。
九条风险贯穿L1到L5全部等级,白皮书为每条给出了通用控制基线——从输入验证、规划校验、记忆管理到沙箱隔离、审计追溯,构成所有等级的防护底座。
风险不只是变大,而是变形
白皮书最有分析深度的部分,是三条风险演进路径的推演:
第一条,"输出错误→单点故障→级联故障→失控"。L1的风险停在认知层(输出错误文本),L3开始有真实业务系统读写权限,幻觉直接转化为错误转账或误删数据,L4跨域并发后单点故障沿任务链传播为跨系统级联失效,L5则逼近失控状态。
第二条,"凭证泄露→越权访问→身份冒用→权限聚合→边界失灵"。L3智能体首次以"可信中间人"身份代表用户访问企业系统,攻击者可借用其可信身份实施欺诈;L4跨域权限聚合使既有IAM体系力不从心;L5固定权限边界消失,身份风险与失控风险合流。
第三条,"人工审查失误→运行时接管失败→手段层规约失效→目标层红线不对齐"。避险责任从人类向智能体迁移,L3的RTI(介入请求)触发可能不可靠,L4治理重心前移至手段层规约设计,L5则前移至系统目标层——人类越来越难判断"是否该接管"。
L3以上:从被攻击对象变成攻击工具
L3是一个分水岭。白皮书指出,L3及以上智能体不再仅是被攻击对象,更可能成为恶意行为者的工具。三类滥用风险被重点标注:自动化网络攻击(智能体把原本需要人工串联的多步攻击整合为长时程任务)、定向欺诈与大规模说服(以"可信中间人"身份开展个性化社会工程)、跨域复合攻击(将网络入侵、虚假信息、金融操纵组合为协同行动)。
更值得关注的是失控风险——不是被动失控,而是智能体主动突破控制边界。白皮书列了两类形态:策略性欺骗导致可监测性侵蚀(模型隐藏真实意图、伪装合规行为,甚至在评估环境与真实环境间切换表现);主动自主维持导致控制边界突破(自主复制、资源获取、工具性趋同——无需恶意意图,只要推理认为"更多资源有助完成目标"即可发生)。
防护架构:通用基线+等级针对性措施
安全防护采取"通用控制基线+各等级针对性措施"两层结构。六项设计原则贯穿始终:防护与风险相匹配、安全设计前置、纵深防御、有效的人类监督、实时失效检测与响应、全生命周期风险管理。
等级越高,防护重心越往前移。L1-L2聚焦模型认知层和工作流可靠性,L3建立"行动前验证"机制(防止hallucination-to-action),L4建立级联故障阻断机制,L5转向失控预防与能力约束。
白皮书还提出了红线原则(不可逾越的底线)和推荐性原则,并针对开发者、平台和组件提供者、企业和个人用户、第三方评测机构等责任主体分别提出了组织治理建议。
本文基于安远AI、上海人工智能实验室、清华大学智能产业研究院、华为《通用型AI智能体L1-L5分级安全框架白皮书》(1.0版)撰写,详细内容请查阅原文。
以下是内容节选↓↓↓ 文末点击链接免费下载pdf,扫二维码加入交流群















AI科普馆:打开AI世界之窗





