展会资讯
《智能体安全研究报告》发布
2026-06-11 10:15
《智能体安全研究报告》发布
AGENT SECURITY

智能体安全的最大难点,是让 AI 的行动能力被组织控制住,能做事,但不能越权;能自动化,但不能失控;能委托,但必须可追责。

一个模型说错话,问题通常停留在内容层;一个 Agent 做错事,可能会调用工具、写入系统、发送邮件、修改权限,甚至触发业务流程。

所以,Agent 安全的核心不再只是“模型是否安全”,而是“行动是否可控”。

只要 AI 开始访问数据、调用工具、执行命令、影响外部系统,它就不再只是一个会回答问题的模型,而是一个需要身份、权限、边界、沙箱、审批和审计的数字行动主体。

Agent 安全不是模型安全的延伸,而是生产系统安全的新问题。

Agent 的风险不在回答,而在执行

聊天机器人主要生成内容。

它的风险集中在回答是否准确、是否有害、是否越界。

Agent 不一样。

Agent 会规划任务、调用工具、读取文件、连接数据库、操作业务系统、执行命令,并在多步骤任务中保持状态。它不是只给出建议,而是可能代表用户或组织采取行动。

这使安全问题发生了根本变化。

模型答错,可能是一段错误文本。 Agent 做错,可能是一条错误记录、一封错误邮件、一次错误变更、一笔错误付款。

同样一个错误,在聊天机器人里可能只是内容质量问题;在 Agent 里可能变成业务事故。

所以,企业不能只问:

这个模型会不会生成错误内容?

更要问:

它能访问什么? 能调用什么工具? 能修改什么系统? 是否有审批? 是否有日志? 出错后能否撤回和追踪?

这就是智能体安全的第一条判断:风险从内容风险升级为行动风险。

安全目标是做到错误受控

在真实生产环境里,没有任何复杂系统可以保证永远正确。

模型会误判,检索会遗漏,工具会异常,上下文可能被污染,用户指令也可能不完整。

因此,Agent 安全不能建立在“AI 永远不犯错”的假设上。

真正可落地的安全设计,是确保 Agent 即使犯错,也不能越权、不能扩散、不能绕过审批、不能留下无法追踪的黑箱结果。

企业要做到:

Agent 可以建议,但不能擅自执行高风险动作。 

Agent 可以调用工具,但必须有边界。

 Agent 可以写入系统,但必须可审计。 

Agent 可以自动运行,但必须可暂停、可撤权、可回滚。

所以,Agent 安全的核心不是把 AI 关起来,而是建立一套可控行动系统。

Agent 是一个组合系统

很多企业会把 Agent 安全简化成模型安全。

这会漏掉真正的风险。

Agent 通常由多个组件组成:模型、工具、数据、权限、上下文、记忆、执行环境、人类审批和日志系统。

任何一个环节都可能成为风险入口。

模型可能被提示词诱导。 工具可能被过度授权。 数据源可能被污染。 上下文可能夹带恶意指令。 执行环境可能缺少隔离。 日志可能无法还原过程。 审批可能被绕过。

因此,Agent 安全不能只盯模型输出。

风险往往发生在模型生成计划和工具执行动作之间。

模型提出一个计划,工具执行这个计划,外部系统状态随之改变。中间如果没有权限控制、执行隔离、审批确认和日志追踪,风险就会直接进入业务系统。

Agent 必须像数字员工一样管理

一个员工进入企业,企业不会只看他能力强不强。

企业会给他岗位、账号、权限、审批链和责任边界。

他能看哪些数据? 能改哪些系统? 能不能发客户邮件? 能不能审批付款? 离岗后权限是否收回? 出事后是否能查到操作记录?

Agent 也需要同样的治理逻辑。

这不是把 Agent 拟人化,而是承认一个事实:只要 Agent 能代表组织读取、判断、发送、修改和执行,它就已经成为一个需要管理的数字行动主体。

每个 Agent 都应该有独立身份、明确权限、短时凭证、审批策略、审计记录和责任人。

尤其是涉及写入、删除、付款、退款、改权限、生产变更、合同签署等高风险动作时,Agent 不能只被当成一个 AI 功能,而必须被纳入身份与权限治理体系。

Agent 不是员工,但必须像数字员工一样被管理。

智能体安全的核心公式

智能体安全可以压缩成一个公式:

Agent Safety = Identity + Policy + Tools + Context + Sandbox + Logs

身份:它是谁,代表谁行动。 

策略:它能做什么,不能做什么。 

工具:它能调用哪些外部能力。 

上下文:它根据什么信息做判断。 

沙箱:它在哪里执行,是否隔离。 

日志:它做过什么,是否可追踪。

这些要素缺一不可。

只有身份,没有权限边界,Agent 可能越权。 

只有权限,没有工具隔离,Agent 可能扩大攻击面。 

只有工具,没有上下文治理,Agent 可能被错误信息诱导。 

只有沙箱,没有审计,出事后无法复盘。 

只有日志,没有撤权机制,企业只能事后追悔。

所以,Agent 安全不是一个按钮,也不是一个插件,而是一套运行控制体系。

它至少要回答七个问题:

谁在行动? 依据什么权限? 调用了什么工具? 使用了什么上下文? 是否在受控环境里执行? 过程是否可审计? 出错后能否中止、撤权和恢复?

落地路径:先读,再建议,再有限执行

Agent 安全落地,不能从最高风险场景开始。

更稳妥的路径,是按风险等级逐步推进。

只读任务可以较早部署,例如资料检索、知识库问答、会议总结、文档归纳、内部政策查询。但仍要控制数据访问范围,并要求引用和溯源。

任务适合人机协同,例如合同初审、候选人筛选、客户分类、风险提示、报价建议。Agent 可以生成判断,但最终动作应由人确认。

有限写入任务需要更强控制,例如创建工单、更新 CRM 字段、生成待审批内容、提交低风险流程。

这类任务需要最小权限、操作日志和回滚机制。

高风险执行任务必须谨慎,例如付款、退款、权限变更、生产变更、合同签署、客户正式通知。

这类任务必须有强认证、人类确认、短时凭证、沙箱执行和完整审计链。

让 Agent 先读,再建议,再有限写入,最后才进入高风险执行。

Agent 安全不是防 AI,而是管理数字行动

智能体安全的本质,不是阻止 AI 行动,而是让 AI 的行动被组织管理。

它不是单纯的模型问题,也不是单纯的内容审核问题,而是身份、权限、工具、上下文、沙箱、审计和组织责任共同构成的系统工程。

Agent 进入企业后,安全问题成为:

AI 能不能代表组织行动? 行动有没有授权? 权限是否最小? 过程是否可追踪? 出错能否撤回? 责任能否定位?

未来企业部署 Agent 的竞争,不只是模型能力竞争,也不是工具数量竞争,而是安全控制能力竞争。

谁能让 Agent 在真实业务中可授权、可约束、可审计、可撤权、可恢复,谁才真正具备把 Agent 从实验工具带入生产系统的能力。

Agent 安全不是为了限制智能体,而是为了让智能体真正可用。

扫描下方二维码,获取完整版《智能体安全研究报告》

业务联系

ZeeLin自进化AI框架测试版已更新至0.0.7版本

新版现已支持Windows和macOS双平台。无论你是独立开发者、产品经理、内容创作者、企事业单位人员,还是团队管理者,都可以在ZeeLin中找到适合自己的AI工作方式。

立即体验ZeeLin

请用浏览器打开网址,一键安装:

https://www.zeelin.cn/#/zeelin

操作手册:

https://my.feishu.cn/wiki/KsGNwPkO5ijuuFknJJ5cFCubnRJ?from=from_copylink

想看更多AI领域的深度内容,记得关注「清新研究」公众号和视频号。这里会持续更新前沿AI深度研究报告,也会分享AI音乐、AI视频、AI产品等方向的精彩洞察,干货不断,不要错过。

发表评论
0评