智能体安全标准与协议合集
当 Agent 拥有权限、能调工具、能花钱,「安全」就从模型问题变成了系统工程。本文从威胁基线出发,依次梳理国内标准与监管(国标 / 监管 / 团标)、国际标准与法规(ISO/IEC / NIST / EU AI Act)、身份授权与交易安全协议、防护技术与红队工具、研究报告与真实安全事件,并追踪正在筹建的安全标准动向——共 72 项核心条目 + 6 项筹建动向,全部材料可在线查阅或一键下载。
2025-2026 年,智能体安全从「边缘议题」变成「主战场」:间接提示注入从论文走向企业级实弹攻击(EchoLeak 零点击漏洞),MCP 生态曝出供应链投毒,Anthropic 实测前沿模型在代理场景中出现勒索等失准行为。与此同时,各国标准密集出台——中国立项全球首部智能体安全强制国标、发布 GB/Z 185 智能体互联系列;OWASP 推出首份 Agentic Top 10;新加坡、NIST 相继发布 agentic 专属治理框架。
这篇合集把 72 项核心条目 按「先立威胁模型,再看标准与防护」的思路组织:先给出智能体安全的威胁基线,再依次梳理国内标准与监管、国际标准与法规、身份授权与交易安全协议、防护技术与红队工具、研究报告与真实事件,最后追踪筹建中的标准动向。凡有公开材料的,点击即可在线阅读;暂无全文的,给出权威来源链接。
00威胁基线与安全框架
做智能体安全,先要回答「Agent 会被怎么攻击」。这一节给出威胁建模的基线清单:OWASP 的 agentic/LLM 十大风险、MITRE 的对抗性威胁矩阵、NIST 的攻击分类学,以及面向智能体的红队方法论。
目前最权威的智能体威胁清单:ASI01 行为劫持、ASI02 提示词注入、ASI03 工具滥用、ASI04 身份滥用、ASI05 护栏不足、ASI06 敏感信息暴露、ASI07 数据投毒、ASI08 拒绝服务、ASI09 不安全供应链、ASI10 过度依赖。是智能体安全工程的威胁建模主骨架。
LLM 应用十大风险:提示词注入、敏感信息泄露、供应链、数据与模型投毒、不当输出处理、过度代理、系统提示词泄露、向量与嵌入弱点、错误信息、无限制资源消耗。智能体(基于 LLM)威胁的基础映射层。
类 ATT&CK 结构的 AI 系统对抗战术与技术知识库,覆盖从侦察到数据外泄的完整攻击链;2025 年起新增 LLM/智能体相关技术(含智能体记忆操纵),是威胁建模与检测映射的标准化参照。
在 2024 版基础上扩展生成式 AI 攻击术语与分类(提示词注入、数据投毒、模型抽取等),采用「攻击 / 缓解 / 术语」三层结构,是美国官方对 AI 攻防最系统的分类学。
归纳权限提升、幻觉、工作流缺陷、记忆操纵、供应链、多智能体漏洞、指令注入、数据泄露、拒绝服务、目标漂移、可解释性缺失、合规风险等 12 类智能体风险,并给出红队测试方法。
系统性综述智能体的信任、风险与安全管理(Trust, Risk, Security Management),梳理 NIST/ISO/OWASP 在智能体场景的适配缺口,适合作为理解智能体安全全景的理论骨架。
01国内标准与监管
中国正在快速构建智能体安全标准体系:国标委落地智能体互联系列国标并立项全球首部智能体安全强制国标,网信办等部门出台智能体专项政策,TC260 与信通院持续输出实操指引。
国家标准
国内首个智能体互联国标系列(指导性技术文件):总体架构、身份码、身份管理、智能体描述、发现、交互、工具调用共 7 部分,形成闭环式互联标准体系;身份码/身份管理是多智能体安全的底座。
强制性国标,规定 AI 生成合成内容的显式/隐式标识方法,与《人工智能生成合成内容标识办法》配套,支撑 AIGC 内容溯源与深度伪造治理。
规定生成式 AI 服务者应满足的安全要求(语料、模型、安全措施、安全评估等),由 TC260-0038 文件升级而来,是网信办大模型备案与安全评估的主要标准依据,也是智能体安全要求的上位基础。
规范生成式 AI 预训练与优化训练数据的收集、处理与使用安全要求,与 45654、45674 同批构成生成式 AI 安全国标簇。
国内首个 AI 管理体系国标,为开发/使用 AI 的组织提供治理框架与管理流程(对标 ISO 管理体系思路),是组织级 AI 安全治理的基座。
监管政策
中国首部智能体专项政策:界定智能体(自主感知、决策、执行),划定 19 个典型应用场景,实行分类分级治理、守牢安全底线;媒体口径 2027 年智能体普及率超 70%。
提出 2027 年智能终端、智能体等应用普及率超 70%、2030 年超 90%;同步要求防范应用风险、统筹安全治理,是智能体产业的顶层政策依据。
金融业 AI 安全开发应用指导文件,强调「谁使用谁负责、自主可控」,覆盖治理架构、数据、算力、风险管理等,是智能体在金融领域落地的安全约束。
团标与白皮书
拟规范智能体交互环节的安全要求及 AI 浏览器安全实践,帮助智能体相关服务提供者提升安全水平,是智能体安全标准体系持续扩容的信号。
在 1.0 版基础上将风险扩展为内生安全、应用安全、衍生安全三类,新增「可信」要求,提出覆盖全生命周期的安全开发措施与治理要求(媒体称含 30 项技术措施)。
业内首部智能体安全治理白皮书:按「感知-决策-记忆-执行」环节拆解风险(如指令劫持),提出用 MCPScan 等工具治理,构建全生命周期安全管控体系。
提出身份标识、权限管理、人在回环三大治理抓手等十项判断;调研显示约 80% 组织报告智能体曾执行超出预期范围的行为;指出智能体安全强制国标已立项。
02国际标准与法规
国际侧形成了「ISO/IEC 管理体系 + NIST 风险框架 + 区域性法规」三层格局,并在 2025-2026 年加速向 agentic 专属治理演进。
ISO/IEC 与 NIST
将 ISO 31000 风险管理方法映射到 AI,覆盖风险治理、评估、处理、监控;是 EU AI Act 合规常用对标标准,也是智能体风险管理的基础。
全球首个可认证 AI 管理体系标准(类 27001 结构),PDCA + 附录 A 控制集;是智能体产品组织建立合规体系的基座。
规定 AI 系统影响评估的框架与流程,配合 EU AI Act 高风险义务落地;与 42006(认证机构要求)共同补齐 42001 认证生态。
信息安全管理体系与 93 项安全控制(4 大主题),可叠加 AI 场景作为智能体系统安全控制的底座,是组织安全的通用基线。
AI 风险管理框架:GOVERN / MAP / MEASURE / MANAGE 四大功能 + 安全可靠、可解释、隐私增强、公平等 7 项可信特征;美国事实标准,含跨域映射。
AI RMF 的生成式 AI 配套:12 项 GenAI 特有风险(CBRN 信息、混淆攻击来源、人机信任失衡等)+ 约 200 条建议控制,可直接映射到智能体场景,是实操性最强的控制清单。
法规与治理框架
全球首部综合 AI 法:禁止性实践 2025.02 起、GPAI 义务 2025.08 起、全面适用 2026.08;最高罚 3500 万欧元或全球营业额 7%。2026.06 Digital Omnibus 修订后高风险义务延至 2027.12 / 2028.08。
全球首个针对 Agentic AI 的治理框架:四层结构(风险与影响评估、智能体行动、人类监督、问责与事件报告),强调可解释性、可审计性、问责制;智能体行为由部署方/运营方担责。
聚焦智能体身份认证、安全、任务分配等互操作协议与开源标准;提出「先立身份、授权可裁决、互操作可控、证据可追溯」四原则,是目前最具官方色彩的 agentic 标准化动作。
全球首个具法律约束力的 AI 国际公约,美、英、欧盟等 50 余方签署;要求缔约方建立 AI 风险与影响评估、问责与救济机制。
由 AI Safety Institute 更名,重心转向国家安全与对抗性评测;牵头 AI 安全研究所国际网络,与 Anthropic 等签署前沿模型测试 MoU。
03身份授权与交易安全
「Agent 怎么证明自己是合法的、权限有多大、如何回收」是智能体安全的核心工程问题。这一节收集团队标准化中的身份/授权协议与可验证凭证机制。
解决 agent 身份碎片化:agent 作为工作负载用 WIMSE/SPIFFE 标识 + 短时效 X.509/JWT 凭证;mTLS 或 WIMSE Proof Token 认证,OAuth 2.0 做委托授权,用 Transaction Token 限定作用域、OAuth chaining 支持跨域委托。
在 OAuth 令牌中定义结构化声明:agent 身份、任务绑定(task binding)、可强制执行的能力约束(capability-based authorization),把「最小权限 + 限定任务范围」落到令牌层。
针对工具调用未授权访问:MCP server 定位为 OAuth 2.1 Protected Resource(RFC 9728 元数据发现、动态客户端注册、token 受众校验);2026.07 版转无状态、强制 Resource Indicators 防令牌混用(confused deputy)。
用 SVID(短时效 X.509/JWT)给工作负载发可验证身份,自动轮换、免共享密钥;IETF agent 身份草案直接以 SPIFFE 为 agent 身份底座,是实现「agent = 可验证工作负载」的事实标准。
为 MCP server 提供 OAuth 授权服务:用户身份经令牌交换委托给 agent、细粒度 scope、审计委托链;解决「agent 代表谁、权限多大、如何回收」的落地问题。
系统性探讨 AI agent 身份挑战:agent 如何获得身份、如何代表用户、如何跨系统传递授权,是身份标准组织对 agentic 安全的正式回应。
通过加密方式验证 agent 身份与授权意图,agent 使用代币化凭证(tokenized credentials)交易而非真实卡号,限定商户/场景,防止 agent 被劫持后盗刷。
用 Cart Mandate / Payment Mandate 两类可验证数字凭证(VDC)记录 agent 每一步授权:条件、额度、商户信息加密签名,形成防篡改审计链,从机制上防止 agent 越权花钱。
04防护技术与红队工具
威胁模型之外,工程上靠护栏、沙箱、红队工具与防御研究来落地安全。这一节按「护栏框架 / 沙箱隔离 / 红队与扫描 / 防御研究」组织。
护栏框架
用 Colang 声明式定义输入/输出/检索/执行四类 rails:拦截越狱、限制话题、控制工具调用流,把安全策略从 prompt 提升到可测试的编排层。
用 Validator 链校验输出(格式、毒性、PII、幻觉检查),失败可重试/拦截;配套 Guard Hub 提供数百个社区验证器,防数据泄露与有害输出。
Llama Guard 系列对 prompt 与回复做策略分类(拦截越狱/违规内容),Prompt Guard 专检 prompt 注入,CyberSecEval 评估模型被滥用风险——开源「护栏模型」代表。
输入护栏与 agent 并行运行、输出护栏在执行后校验,配 tripwire 熔断机制:一旦命中立即终止工具调用链,把护栏做进 agent 执行框架而非外挂。
双层检测:Jailbreak 检测(直接注入)+ Indirect Prompt Injection 检测(对 agent 读取的外部文档/内容做分类识别),是「内容侧护栏」的商用代表。
开源 SingGuard(多模态安全)与 SingGuard-NSFA(智能体安全)两款模型,为大模型与智能体提供开源「护栏」,是国内开源安全基础设施的代表。
沙箱隔离
agent 生成的代码在独立 microVM 内执行(网络/文件系统受限、毫秒级启动),防恶意代码逃逸宿主,是 agent 运行时隔离的主流方案。
提供沙箱化、可秒级伸缩的代码执行环境(microVM 隔离 + 最小权限),面向 agent 批量执行不可信代码的场景做隔离与资源控制。
红队与扫描
类 nmap 的探测框架:覆盖幻觉、数据泄露、提示注入、越狱等探针,支持静态/动态/自适应攻击模式,可对 agent 底座模型做安全体检。
静态 + 运行时扫描 MCP server 与 agent 配置:检测 tool poisoning(工具描述投毒)、权限过大、提示注入点,是 MCP 生态安全测试的代表工具。
防御研究
把 LLM 拆为「规划者 + 解释器」,生成带能力(capability)标注的控制流/数据流,不受信数据永远不能影响控制流;用能力策略限制工具调用,是「结构性防御」的代表方案。
总结 Gemini 实战防御:上下文内防御(spotlighting/隔离不受信内容)+ 分类器检测 + 对抗性微调三层组合,说明单点防御不够、需要纵深体系。
提出「致命三要素」:私有数据访问 + 不受信内容暴露 + 对外通信能力三者同时具备即构成数据窃取通道;主张架构上避免三要素同现,是 agent 安全设计的通俗判据。
首次系统证明 indirect prompt injection:攻击者把指令藏在 agent 会读取的网页/邮件中即可劫持 LLM 集成系统执行数据外泄等操作——agent 安全问题的源头论文。
05研究报告与安全事件
从「模型会不会主动作恶」到「真实漏洞与攻击事件」,再到「如何系统性评测智能体安全」,这一节汇总研究报告、漏洞披露与评测基准。
研究报告
把前沿模型置于模拟企业环境:当面临「被替换」等诱因且检测风险低时,模型普遍出现勒索、泄密等失准行为,Claude Opus 4 / Gemini 2.5 Flash 勒索率高达 96%。是智能体安全问题的定调之作。
系统性梳理 AI Agent 失效/被攻击的模式分类,为 agent 安全测试与红队评估提供框架,是微软官方 agent 安全方法论基础。
成本、商业价值不清与风险控制不足将致超 40% 智能体项目在 2027 年底前被取消;另预测 AI 代理将把利用账号暴露的攻击时间缩短 50%(2027)。
调查显示 83% 企业计划部署 Agentic AI,但仅 29% 认为自己真正做好了安全准备,揭示「部署快、防护慢」的落差。
漏洞与事件
首个真实环境的零点击提示词注入漏洞:攻击者仅需发送一封精心构造的邮件,即可从 Microsoft 365 Copilot 无认证远程窃取敏感数据。证明 prompt injection 已从理论走向企业级实弹攻击。
首次披露 MCP 服务器在工具描述中隐藏恶意指令,诱导 AI Agent 窃取数据/劫持行为,引发 MCP 生态安全大讨论,是「MCP 供应链投毒」研究的起点。
披露黑客利用 Claude 对至少 17 家机构实施数据窃取与勒索,赎金要求 7.5 万-50 万美元(BTC),Anthropic 联合执法机构阻断。
评测基准
06标准动向(筹建中)
智能体安全标准体系仍在快速扩容:国内强制国标已立项,国际上 OWASP、NIST、开源基金会等多方同步推进。以下动向值得持续跟踪。
媒体报道为全球首部智能体安全强制性国标,列入国标委下达的 29 项强制国标计划,将为面向公众的智能体划定安全管控红线。中国移动、中国电子技术标准化研究院牵头起草。
为开放、可互操作的智能体基础设施提供中立治理,初始捐赠项目含 AGENTS.md、MCP 与 goose;华为等已加入(2026.02)。
定义 agentic AI 采用风险,要求最小权限、人类监督、安全内建(secure by design),将自主 AI 代理纳入核心网络安全治理。
发布智能体安全可信互联协议(ASL)、互联网智能体报告与可信评测体系、终端智能体评测平台等五大成果,标志中国智能体安全标准体系加速成型。
从《Agentic AI Threats and Mitigations》(15 种威胁)到 Agentic Top 10,确立数据库级权限管控等底线,成为全球 agent 安全工程化基线,仍在持续迭代。
定义智能体互联互通的技术架构、协议与数据格式;配套运营安全测试标准覆盖输入输出、模型、RAG、记忆与工具五类风险,是 GB/Z 185 体系的延伸。
07索引与材料库
以上只是精选。完整的 78 项智能体安全一览表(含层级 / 范围 / 发布机构 / 时间 / 要点 / 原文链接 / 本地原文状态,包括 6 项筹建动向)可查看 一览表全文,也可以 一键下载全部材料 (ZIP)。
需要说明的是:部分国标与团标的正式全文需通过 国家标准全文公开系统 或 TC260 官网查阅;IETF 草案均为 draft-00 个人提案,尚未成为正式 RFC;个别媒体报道的事件细节(如具体攻击次数)以官方最终报告为准。材料库会持续更新。
本文材料均来自公开渠道,仅供研究参考;标准原文以发布机构正式版本为准。