展会资讯
清华大学:智能体安全研究报告 2026
2026-06-09 10:03
清华大学:智能体安全研究报告 2026

本报告由清华大学清新研究团队 2026 年 6 月发布,聚焦行动型 AI 智能体(Agent) 安全,结合多国权威机构指导意见,剖析风险、架构、评测、治理与落地路径,核心指出智能体安全已从模型层转向运行时系统安全,是企业规模化落地 Agent 的核心壁垒。

一、核心认知与核心判断

本质界定

智能体安全的定义:让可行动的 AI 实现可授权、可约束、可追责,公式为Agent Safety = 身份 + 策略 + 工具 + 日志。智能体具备规划、工具调用、状态保持、外部系统交互能力,风险从传统大模型的内容风险升级为行动风险,单一模型错误可演变为数据篡改、业务变更等实际损失。

三大核心结论

Agent 并非简单聊天机器人,而是带权限的运行时系统,安全边界远大于普通对话模型;

仅依靠提示词无法保障工具调用与外部动作安全;

企业核心竞争力在于安全控制平面,而非单个大模型。

行业现状与误区

目前 Agent 能力快速商品化,但安全部署能力无法自动复刻;企业普遍存在三大误区:仅做提示词防护、让 Agent 继承用户全量权限、先对接业务再补审计审批。

二、行业背景与政策导向

国际权威机构定调:CISA、NSA、NIST 等将 Agent 安全列为国家级安全议题,发布分层防御、最小权限、人工监督、渐进式部署的落地指引,明确区分普通聊天机器人与可改变外部状态的行动型智能体。

技术趋势与风险延伸

  • OpenAI 将沙箱执行作为 Agent 基础设施,执行层安全成为标配;

  • MCP 协议简化工具与数据源接入,但同步扩大攻击面,存在权限滥用、隐私泄露、代码执行等风险;

  • 安全主战场转移:从单纯模型安全转向运行时层(工具、身份、沙箱、审计)。

管理类比:Agent 需参照数字员工管理,配套独立身份、分级权限、审批流程与全链路日志,实现事故可追责。

三、智能体系统架构:七层安全控制体系

报告提出完整的智能体运行闭环(感知 - 计划 - 调用 - 记忆 - 复盘),并搭建七层安全控制框架,覆盖全链路风险:

身份层:配置独立身份链路,禁止长期持有人类凭证,完整记录执行人、Agent、服务账号信息。

权限层:遵循最小权限原则,按任务分配短期、可撤销权限,区分只读、半自动、自动执行,高风险动作强制审批。

工具层:工具标注风险标签与调用规则,调用前后做策略校验。

上下文层:隔离不可信数据,区分指令、用户意图与普通数据,防范上下文投毒。

记忆层:管控记忆读写,支持版本回溯、删除与回滚,避免记忆污染形成长期风险。

沙箱层:代码、文件、命令等操作强制环境隔离,限制网络与资源,支持快照与回滚。

审计 & 人工层:搭建全量操作日志(Action Ledger),高风险、不可逆动作设置人工审批门,实现全程可追溯。

四、核心风险地图

梳理十大高频风险,覆盖攻击、误用、运维全场景:

高频风险:目标劫持、提示词注入、工具滥用、身份 / 权限滥用是最主要威胁;

持续性风险:记忆污染、上下文投毒会让风险跨任务延续;

扩散类风险:沙箱逃逸、供应链污染、多 Agent 级联失败会放大事故影响范围;

衍生风险:数据泄露、意外代码执行、人机信任滥用、行为漂移、审计缺失。

同时划分风险场景:资金、医疗、法律、生产变更、身份权限操作为高风险;客户外发、公开发布为中风险;普通内容交互为低风险,建议低风险任务先行落地。

五、安全控制平面(核心架构)

统一控制平面是企业规模化治理 Agent 的核心,实现身份、工具、策略、审计集中管理,核心模块包括:

Agent / 工具注册中心:全量登记智能体、工具信息,标注风险等级,未登记主体禁止访问业务系统;

策略引擎:系统层执行安全规则,每次工具调用前校验身份、权限、数据;

基础安全能力:上下文防火墙、数据脱敏 + DLP、沙箱隔离、分级人工审批;

审计与应急:全链路操作日志、熔断机制、故障回滚、专属事故响应剧本。

六、评测、监控与运营体系

安全并非一次性测试,而是持续运营能力,分为三类评测 + 常态化监控:

核心评测维度:注入攻击红队测试、工具调用安全测试、数据泄露检测、记忆污染验证、沙箱逃逸对抗测试;

运行监控:对接 SIEM 等安全平台,监控调用频率、异常行为,触发自动降级 / 暂停;

事故响应:遵循检测 - 遏制 - 根除 - 恢复流程,复盘后重测回归用例;

指标看板:同步监控业务指标与安全、治理指标。

七、组织治理、合规与成熟度

三方责任体系:每个 Agent 配备业务、技术、安全三类负责人,权责清晰;

风险分级落地:按数据敏感度、动作不可逆性,划分为只读辅助、草稿建议、半自动执行、闭环自治四级,等级越高管控越严格;

安全流程与合规:将 Agent 纳入安全开发生命周期,适配国内生成式 AI 备案、内容标识、数据安全等合规要求;第三方供应商需完成安全审查并将管控要求写入合同;

能力成熟度:分为 L1 只读、L2 受限工具、L3 半自动、L4 闭环自治、L5 高保证自治五级,建议企业优先落地 L2-L3 阶段。

八、落地路线图与最终结论

(一)分阶段落地规划

0-30 天:资产盘点,梳理所有 Agent 与高权限工具,建立基础清单;

30-60 天:搭建权限、日志、审批基线,制定统一安全策略;

60-90 天:选取低风险场景试点,完成红队渗透测试,验证防御能力;

90-180 天:走向平台化,完善注册中心、策略引擎、沙箱等基础设施,建立跨团队评测上线流程;

一年目标:建成企业统一安全控制平面,核心 Agent 全面接入,高风险场景落地专项评估与应急演练。

(二)试点选择建议

优先落地知识检索、工单分类、报告撰写、代码辅助等低风险、可回滚任务;谨慎推进邮件外发、财务操作、生产变更等高权限场景,杜绝初期全自治部署。

(三)最终核心结论

安全不是 Agent 发展的阻碍,而是规模化落地的前提,无安全管控的 Agent 只能停留在小范围实验;

智能体安全发展方向:从理论原则走向工程化控制平面;

落地优先级:先完成资产清单、权限管控、全量日志三大基础,再逐步放开工具能力与自治范围,最终实现 AI 行动可控、企业部署可信。

点击文后阅读原文,可获得下载资料的方法
欢迎加入智能交通技术群!扫码进入。
点击文后阅读原文,可获得下载资料的方法
联系方式:微信号18515441838
发表评论
0评