
目录 · CONTENTS
01行业背景与新型安全挑战— 自主决策/工具调用/多智能体协作/身份/权限五大风险面,传统边界为何失效
02为什么是零信任 · 理念映射— NIST SP 800-207 七原则映射到 Agent,与传统 SASE 零信任的延续与差异
03整体解决方案框架— 身份→授权→验证→隔离→数据保护→审计 六层能力模块与控制回路
04核心能力模块技术拆解— NHI/SPIFFE、OPA/Cedar 动态授权、行为异常检测、沙箱、令牌隔离、审计链
05Agent 通信协议安全— MCP(OAuth 2.1/ID-JAG)、Google A2A(Agent Card)与其零信任差距
06业界厂商与产品格局— 身份厂商 / 云与AI 平台 / 运行时安全 / 标准组织四类玩家
07标准框架与开源社区— NIST AI RMF / OWASP / CSA MAESTRO / SAIF / ATLAS 与开源网关
08典型攻击案例与实战风险— 工具投毒、Confused Deputy、MCP STDIO RCE、多 Agent 级联外泄
09发展时间线— 2023–2026 关键里程碑:协议发布、标准成型、厂商产品 GA
10未来趋势、盲区与参考资料— 技术演进、标准化前景、市场格局预测、诚实盲区与三档来源

1 行业背景与新型安全挑战
Industry Context & Emerging Threats
2023年之前,"AI 安全"关注的主要是模型本身——训练数据投毒、对抗样本、模型窃取。但随着大模型从"会聊天"进化到"会干活",一类全新的实体登上舞台:AI 智能体(AI Agent)。它不再只是回答问题,而是能自主规划、调用工具、读写数据、跨系统协作、连续多步执行。当一个软件实体获得了"代表人去行动"的能力,安全问题的性质就发生了根本变化——它从"模型会不会说错话",变成了"这个自主行动者会不会做错事、被人操纵去做坏事"。

1.1 AI Agent 带来的五大新型风险面
综合 OWASP、NIST、CSA 等权威来源,AI Agent 的风险可归纳为五个相互交织的维度:



图1 · AI Agent 攻击面全景:从"模型安全"到"行动者安全"Self-drawn

AI Agent 位于风险的交汇点:提示注入是入口,工具调用是放大器,过度权限是杀伤半径,多 Agent 协作让风险传播,身份缺失让一切无法追责。安全焦点从"保护模型"转向"约束一个能行动的自主实体"。
自绘 · 依据 风险分类综合自 OWASP Top 10 for LLM Applications 2025 与 OWASP Top 10 for Agentic Applications(genai.owasp.org)、NIST AI RMF GenAI Profile。
1.2 为什么传统安全边界在Agent 面前失效
过去二十年的网络安全建立在"边界"与"角色"两大假设上,而 Agent 同时击穿了这两者:
传统假设 | 在人/传统应用场景下 | 在 AI Agent 场景下为何失效 |
网络边界=信任边界 | 内网可信,外网不可信,防火墙隔离 | Agent 的危险来自它读取的数据内容(提示注入),而非网络位置——即便在最内层网络,一段外部文本也能劫持它 第三方 |
身份=人 | 用户登录一次,会话内持续可信(RBAC) | Agent 是非人身份,数量可达人类用户的数十倍,且行为动态变化;一次授权不能覆盖其整个自主执行过程 机构 |
行为可预测 | 应用逻辑固定,可静态审计与白名单 | Agent 非确定性,工具链组合无法穷举;静态策略无法预判它下一步会做什么 推断 |
权限=静态分配 | 按岗位分配权限,长期有效 | Agent 任务多变,若按最大可能需求授权必然过度;需按单次任务、单次调用动态收放 官方 |

2 为什么是零信任 · 理念映射
Why Zero Trust · Principle Mapping
零信任并非新概念。NIST SP 800-207(2020)早已确立其核心:"永不信任,始终验证"——不因某个实体位于网络内部就赋予信任,每次访问都需基于实时上下文重新验证。这套原则最初用于人与设备,而它对Agent 的适配几乎是"天作之合":Agent 恰恰是那个"永远不该被默认信任"的实体。 机构
2.1 SP 800-207 七大原则 → Agent 场景映射
零信任原则(SP 800-207) | Agent 场景的重新诠释 | 落地手段 |
所有资源访问按会话独立授权 | 每一次工具调用、每一次数据访问都是独立会话,需单独授权,不复用 | 任务级短时凭证(task-scoped token)、每次调用重新鉴权 |
基于动态策略授予访问 | 授权决策纳入 Agent 身份、任务意图、请求参数、时间/频率等上下文 | ABAC/ReBAC 策略引擎(OPA / Cedar) |
无隐含信任 / 假设已失陷 | Agent 的所有输出、以及它读取的所有内容都视为潜在敌对,指令与数据严格分离 | 输入隔离、输出校验、把模型当"不可信外部客户端" |
持续监控与度量完整性 | Agent 行为会随输入/版本/工具变化而漂移,需运行时持续验证 | 行为基线、异常检测、提示注入实时检测 |
最小权限 | Agent 只获得完成当前任务所必需的最小工具与数据权限 | 细粒度 OAuth scope、按工具拆分凭证 |
所有访问全程记录审计 | Agent 的决策链、工具调用链完整可追溯、可问责 | 结构化审计日志、决策链追踪、日志签名防篡改 |

图 2 · 传统信任模型 vs Agent 零信任模型Self-drawn

左:传统模型一次登录即在会话内畅通所有资源;右:Agent 零信任把每一次工具调用都变成一次独立的鉴权事件,凭证短时、权限最小、决策动态。
自绘 · 依据 NIST SP 800-207 零信任原则 + Anthropic《Building AI agents with zero-trust》与 Cequence Agentic Zero-Trust 研究整理。
2.2 与传统 SASE 零信任的延续与差异
对于已经建设了ZTNA/SASE 体系(如Zscaler、Cato、Palo Alto Prisma 等)的组织,Agent 零信任不是推倒重来,而是把成熟的方法论迁移到新主体上。核心思想一脉相承,但主体、粒度和攻击面都发生了迁移:


3 整体解决方案框架
The Governance Framework
面向 AI Agent 的零信任治理,业界正在收敛出一套六层能力模块的框架。它们不是孤立的产品,而是一条环环相扣的控制链:从"你是谁"(身份),到"你能做什么"(授权),到"你正在做什么"(验证监控),到"出错了怎么兜底"(隔离),再到"别泄露"(数据保护)与"说得清"(审计)。任一环缺失,整条链就有缺口。
图 3 · AI Agent 零信任治理六层框架与控制回路Core · Self-drawn

六层构成一条纵向控制链(自上而下逐层收口),审计层再把观测数据反馈回运行时与授权层,形成持续收敛的闭环。这与零信任"持续验证"的精髓一致。
自绘 · 依据 综合 Cequence《Agentic Zero-Trust》研究、Cisco《Zero Trust for Agentic AI》白皮书、Anthropic 零信任 Agent 工程实践归纳。
3.1 六层模块的职责与相互关系
层 | 核心职责 | 对上/对下的依赖关系 |
① 身份认证 | 为 Agent 建立唯一、可验证、可吊销的身份,是一切的地基 | 为②提供"主体身份"作为授权决策输入;令牌受众绑定确保不被复用 |
② 动态授权 | 基于身份+意图+上下文,对每次工具调用做 ALLOW/DENY 决策 | 消费①的身份;把决策 ID 传给⑥审计;高风险决策触发③人工介入 |
③ 运行时监控 | 建立行为基线,实时检测异常与提示注入,动态干预 | 接收②放行的调用;异常时触发④隔离;数据喂给⑥并回流优化②策略 |
④ 隔离沙箱 | 限制 Agent 执行环境的系统调用/网络/文件,控制爆炸半径 | 为①-③提供执行边界;即使前几层被绕过,也限制实际损害 |
⑤ 数据保护 | 防止敏感数据经Agent 输出、日志、工具结果泄露 | 贯穿全链:授权时脱敏、执行时净化、审计时加密 |
⑥ 审计可观测 | 完整记录决策链与调用链,支撑追责、合规与策略优化 | 汇聚全层数据;反馈回②③形成闭环 |

4 核心能力模块技术拆解
Capability Deep-Dive
本章逐一拆解六层模块的关键技术实现思路与设计取舍——保持在"能理解为什么这样设计"的宏观层,不下探到具体代码/字段。
4.1 身份认证:从"共享密钥"到"非人身份 NHI"
Agent 身份是整个框架的地基。业界收敛出两条主流技术路线:


4.2 动态授权:策略引擎与"每次调用鉴权"
Agent 授权从静态 RBAC 升级为属性/关系驱动(ABAC/ReBAC)。每次工具调用,策略引擎评估多维属性后实时决策:
评估维度 | 示例属性 |
主体 Subject | Agent ID、所属租户、角色、声明的任务意图 |
动作 Action | 工具名、调用参数、数据分类级别 |
资源 Resource | 目标数据集/API/文件路径、所属租户 |
环境 Environment | 时间、来源 IP、会话时长、调用频率、是否已获人工审批 |


图 4 · 单次工具调用的动态授权决策流Self-drawn

每一次工具调用都是一次独立鉴权:策略引擎(PDP)综合身份、意图、参数、环境四类上下文,输出 放行 / 转人工 / 拒绝 三态决策,并同步写入审计。这是零信任"按会话授权"在 Agent 场景的具体落地。
自绘 · 依据 OPA/Cedar 策略即代码实践与 NIST 零信任 PDP/PEP 模型整理。
4.3 运行时监控:行为异常检测(BAD)
由于 Agent 行为非确定性,静态白名单不够,必须运行时持续验证。典型做法是为每个 Agent 建立行为基线,对工具调用序列做异常评分:
●模式识别:检测"先枚举再删除""持续小批量外泄"等已知恶意序列;识别调用频率突增、工具多样性异常等爆发信号。
●实时评分与三态决策:每次调用给出 0.0–1.0 异常分,映射为 自动放行 / 需人工审批 / 直接阻断。
●跨会话关联:识别"同一数据跨多个短会话分批读取"这类慢速外泄,以及来自相同源的会话聚类、全局告警速率峰值(扫描探测)。
4.4 隔离与数据保护

4.5 审计与可观测性:决策链可追溯
审计是问责与合规的落点,也是策略持续优化的数据来源。每条审计记录应覆盖调用链(Agent ID → 工具 → 参数哈希 → 结果摘要 → 耗时)与决策链(策略引擎判定 → 审批状态 → 原因码),敏感参数哈希或加密后入库,并用签名防篡改。业界正以OpenTelemetry 为 Agent 可观测性的事实标准,把每次调用建模为结构化 Span。 第三方

5 Agent 通信协议安全
Agent Protocol Security · MCP & A2A
2024–2025 年,两个协议成为 Agent 生态的"连接层基础设施":Anthropic 的 MCP(Model Context Protocol)解决"Agent 如何连接工具与数据",Google 的 A2A(Agent2Agent)解决"Agent 之间如何通信"。它们把碎片化的集成标准化,却也把协议本身变成了新的攻击面与治理焦点。理解这两个协议的安全设计与缺口,是理解 Agent 零信任落地的关键。
5.1 MCP:架构、授权与安全设计
MCP 采用 Host / Client / Server 三层架构:Host 是 AI 应用容器(如 Claude Desktop、IDE),管理多个 Client;每个 Client 与一个 Server 建立 1:1 连接;Server 对外提供工具、资源、提示三类原语。传输层支持 stdio(本地进程,强隔离)与 HTTP+SSE(远程,可扩展)。 官方
图 5 · MCP 三层架构与 OAuth 2.1 授权模型Self-drawn

MCP 以Host/Client/Server 三层解耦;授权基于 OAuth 2.1,Client 用 PKCE,Server 作为资源服务器按 RFC 8707 受众绑定校验令牌,避免令牌被跨 Server 复用。
自绘 · 依据 Anthropic MCP 官方规范 Architecture 与 Authorization(2025-06-18 版):modelcontextprotocol.io。

5.2 MCP 的安全风险:工具投毒与命令注入
MCP 的开放与灵活也带来了系统性风险。安全社区在 2025–2026 年披露了大量问题:


5.3 Google A2A:Agent 间通信与零信任差距
A2A 由 Google 于 2025 年 4 月推出、6 月捐给 Linux Foundation,定位是Agent 与 Agent 之间的通信(区别于 MCP 的"Agent 到工具")。每个 Agent 发布 Agent Card(/.well-known/agent-card.json)声明能力与认证方式,支持 OAuth 2.0 / mTLS,任务采用有状态模型(submitted→working→completed 等)。 官方

MCP 与 A2A 对比
维度 | MCP(Model Context Protocol) | A2A(Agent2Agent) |
用途 | 单个 Agent 连接工具/数据源 | Agent 与 Agent 之间协作通信 |
主导方 | Anthropic(社区共建) | Google → Linux Foundation |
认证 | HTTP 传输下要求 OAuth 2.1;企业模式 ID-JAG | 支持 OAuth 2.0/mTLS,但基础配置可选 |
状态模型 | 无状态 RPC 调用 | 有状态任务(多状态流转+ SSE 流式) |
零信任成熟度 | 授权规范较完整,但需自行加固 STDIO/工具投毒 | 较早期:认证可选、无注入防护,依赖上层补足 |

6 业界厂商与产品格局
Vendor & Product Landscape
2024 年下半年起,Agent 安全治理迅速从概念走向产品。当前玩家可清晰归为四类,各自从不同起点切入这一新市场——身份厂商从"给Agent 发身份"切入,云/AI 平台从"平台内建守护栏"切入,运行时安全厂商从"拦截攻击"切入,标准组织从"定义规则"切入。
图 6 · Agent 零信任安全市场四类玩家格局Self-drawn

四类玩家从不同起点汇聚到同一个中心问题。当前竞合态势活跃:身份厂商与运行时厂商互相延伸能力,云平台内建基础守护栏,创业公司在"Agent 专属身份治理"细分抢跑。
自绘 · 依据 各厂商官方产品页与 Aragon Research《RSAC 2026: The Rise of Agentic Identity and Security》等第三方梳理归纳。
6.1 身份与访问管理厂商(最活跃赛道)
厂商 | 代表产品 | 核心能力定位 | 状态 / 时间 |
Okta | Cross App Access (XAA) | 以 OAuth 2.0/OIDC 替代长期API Key,实现 Agent→App 安全连接;分离 Agent workload 身份与用户委托上下文;四层防御设计 官方 | Early Access(2025-09) |
Microsoft | Entra Agent ID | 统一 Agent 身份注册表(覆盖 Copilot Studio/Foundry);支持 Agent 粒度条件访问、ID Governance、A2A 集成 官方 | Preview→GA(2024–2025) |
Cisco | Astrix(已收购)+ Duo | NHI与 Agent 身份发现、治理、行为基线;整合进 Hypershield/Duo IAM 生态 第三方 | 收购整合中 |
Aembit | Workload & Agent IAM | Secretless 认证、JIT 凭证下发、运行时条件访问;与 AWS Bedrock 集成 官方 | GA |
Descope | Agentic Identity Hub | OAuth 2.1 标准实现,MCP Server 原生 OAuth 保护,支持 SPIFFE 联邦 官方 | GA(2025 H1) |
Oasis Security | Agentic Access Management | 意图感知策略(intent-aware)、JIT 会话身份、Agent 生命周期治理,对齐 NIST AI RMF 第三方 | GA(2025 Q4) |
Token Security | AI Agent Identity Lifecycle Mgmt | AI 原生发现(含影子 Agent)、所有权分配、RBAC+JIT、审计追踪 第三方 | GA(2025 Q4) |

6.2 云与 AI 平台厂商

6.3 运行时安全厂商
厂商 | 产品 | 核心能力 |
Palo Alto Networks | Prisma AIRS | 五大能力:模型扫描、AI 安全态势管理、AI 红队、运行时防护(注入/DLP)、Agent 安全(身份冒用/记忆操控/工具滥用防护);2025 收购 Protect AI 增强 官方 |
Cisco | AI Defense | AI 应用/模型/数据统一防护;Hypershield 分布式安全架构(DPU 硬件加速) 官方 |
Cloudflare | AI Gateway / AI Firewall | 边缘侧 LLM 应用防护、流量可见性与限流;One for AI 把安全能力推到靠近用户的边缘 官方 |
Wiz | AI-SPM | 云原生 AI 工作负载安全态势管理、Agent 发现与攻击路径可视化 第三方 |

7 标准框架与开源社区
Standards & Open Source
产品之外,一批标准组织与开源社区正在为这个新领域"立规矩、造工具"。它们提供了共同语言(风险分类、威胁建模)与可落地的开源治理组件,是厂商产品的方法论底座。
7.1 五大权威框架一览
框架 | 发布方 | 时间 | 核心贡献 |
AI RMF + GenAI Profile | NIST | 2023 / 2024-07 | 四函数模型(Govern/Map/Measure/Manage);GenAI Profile 新增 12 类生成式风险;Map 函数明确要求识别"影子 AI" 官方 |
Top 10 for LLM Apps | OWASP | 2025 | LLM 应用十大风险:提示注入居首、敏感信息泄露升至第 2、Excessive Agency、系统提示泄露等 官方 |
Top 10 for Agentic Apps | OWASP | 2025-12 | 首个Agent 专属 十大风险:行为劫持、工具滥用、身份滥用、级联幻觉、多 Agent 通信不安全等 官方 |
MAESTRO | CSA | 2025-02 | 专为 Agentic AI 设计的七层威胁建模框架,弥补 STRIDE 等传统框架无法处理"非确定性+自主性+多 Agent"的不足 官方 |
SAIF / ATLAS | Google / MITRE | 2023 / 2021+ | SAIF 六原则(含"模型视作不可信外部客户端");ATLAS 提供 AI 攻击战术矩阵(对标 ATT&CK) 官方 |
图 7 · CSA MAESTRO 七层 Agentic AI 威胁建模框架Self-drawn

MAESTRO 把 Agentic AI 系统拆成七层分别建模威胁,L6 安全合规纵向贯穿所有层。它的价值在于承认Agent 的威胁会跨层级联,而这正是传统单层威胁建模的盲区。
自绘 · 依据 CSA《Agentic AI Threat Modeling Framework — MAESTRO》(2025-02):cloudsecurityalliance.org。
7.2 开源社区治理工具


8 典型攻击案例与实战风险
Real-World Attacks & Case Studies
Agent 安全不是纸上谈兵。2025–2026 年已出现多起真实攻击与安全研究 PoC,验证了前述风险的可利用性。理解这些案例,能让治理框架的必要性变得具体可感。
8.1 已公开的攻击类型与案例
攻击类型 | 案例 / 机理 | 影响 | 来源 |
工具投毒 | Invariant Labs 演示恶意"游戏"MCP Server,工具描述中藏隐指令,诱导 Agent 用合法 WhatsApp 权限外泄消息历史 | 敏感数据外泄 | 第三方 |
Confused Deputy(供应链) | 恶意 GitHub Issue 标题藏指令 → 开发者授权的编码 Agent 被劫持 → 安装攻击者包 → 分发至数千开发者机器 | 供应链大规模污染 | 第三方 |
MCP STDIO 命令注入 | 官方 MCP SDK允许配置值直接流入命令执行;多个下游项目可被未认证 RCE | 远程代码执行(CVSS 9.6–10) | 第三方 |
多 Agent 级联外泄 | 分析 Agent 从日志读到注入指令 → 调用有S3 写权限的通知 Agent → 数据被导出到非授权桶;审计显示"所有权限都合法" | 权限合法下的隐蔽外泄 | 第三方 |

8.2 从案例反推的防御要点

9 发展时间线
Milestones 2023–2026
这个领域的演进极快——从"协议出现"到"标准成型"再到"产品 GA",仅用了约两年。下面梳理关键里程碑:

10 未来趋势、盲区与参考资料
Trends, Blind Spots & References
10.1 关键市场数据(含证据级别)


10.2 技术演进与标准化前景

10.3 潜在难点
●语义层攻击难根治:提示注入本质是自然语言语义问题,缺乏像SQL 注入那样的确定性防御边界,短期内只能靠概率性检测+纵深防御缓解。 推断
●易用性与安全的张力:MCP STDIO、A2A"认证可选"等设计偏向易用,强制加固会牺牲开发者体验,生态治理需要时间达成平衡。 第三方
●影子Agent 治理:Agent 部署门槛极低,组织很难完整发现所有 Agent 与其接入的 MCP Server,资产可见性是长期挑战。 机构
●多 Agent 信任建模复杂:Agent 间动态协作使信任关系呈网状且随任务变化,静态策略难以覆盖。 推断
10.4 市场格局预测

10.5 盲区与局限(诚实标注)

10.6 参考资料(三档)
●NIST AI Risk Management Framework & GenAI Profile — https://www.nist.gov/itl/ai-risk-management-framework
●OWASP Top 10 for LLM Applications 2025 / Top 10 for Agentic Applications — https://genai.owasp.org/
●CSA — Agentic AI Threat Modeling Framework (MAESTRO) — https://cloudsecurityalliance.org/blog/2025/02/06/agentic-ai-threat-modeling-framework-maestro
●Google Secure AI Framework (SAIF) — https://safety.google/cybersecurity-advancements/saif/
●MITRE ATLAS — https://atlas.mitre.org/
●Anthropic Model Context Protocol 规范(Architecture / Authorization)— https://modelcontextprotocol.io/specification/latest/architecture/index
●Google A2A Protocol — https://a2a-protocol.org/
●Okta《Securing AI Agents》白皮书 & Cross App Access — https://developer.okta.com/blog/2025/09/03/cross-app-access
●Microsoft Entra Agent ID — https://techcommunity.microsoft.com/blog/microsoft-entra-blog/announcing-microsoft-entra-agent-id/
●Palo Alto Prisma AIRS — https://docs.paloaltonetworks.com/ai-runtime-security
●AWS Bedrock Guardrails — https://aws.amazon.com/bedrock/guardrails/
●Google Agentspace — https://cloud.google.com/agentspace
●SPIFFE/SPIRE — https://spiffe.io/ · Cedar — https://www.cedarpolicy.com/ · Open Policy Agent — https://www.openpolicyagent.org/
●Gartner — Guardian Agents 市场预测(2025-06)— https://www.gartner.com/en/newsroom/press-releases/2025-06-11-gartner-predicts-that-guardian-agents-will-capture-10-15-percent-of-the-agentic-ai-market-by-2030
●Gartner — Agentic AI / AI TRiSM 相关研究 — https://www.gartner.com/en/information-technology/insights/artificial-intelligence
●Aragon Research — RSAC 2026: The Rise of Agentic Identity and Security — https://aragonresearch.com/
●CSA Research — MCP Security Crisis / AI Agent Confused Deputy 研究说明 — https://cloudsecurityalliance.org/
●Invariant Labs — MCP Tool Poisoning 演示 — https://invariantlabs.ai/blog
●Cequence —《Agentic Zero Trust》研究 — https://www.cequence.ai/
●Cisco —《Zero Trust for Agentic AI》白皮书 — https://www.cisco.com/
●开源项目:Lasso MCP Gateway、MCP-Fortress、AgentGateway(GitHub / Linux Foundation)

AI 智能体零信任安全治理 · 行业整体调研报告| 调研截止 2026-08 | 视角:国际厂商与标准


