- 全部
- 企业新闻
- 行业动态
- 前沿技术
总机: 010-8250-9710
热线: 400-1066-819
智能体安全分析与攻防实践
返回2026-09-09 公司原创
一、概述
2026年各类Agent(智能体)逐渐进入大众视野。随后,编程Agent、浏览器Agent及多智能体工具不断涌现,并逐步应用于实际业务。随着Agent能力和应用范围扩大,安全风险也从模型内容安全延伸至智能体身份、工具链、数据访问、权限控制、凭证管理及运行环境等真实系统层面。
其中,工具调用是Agent区别于传统大模型最核心的能力之一。Agent可以根据任务需要调用API、浏览器、文件系统、命令行以及第三方服务,并直接完成真实操作。但能力越强、权限越高,相应的攻击面也越大。结合近期DEF CON、Black Hat、Pwn2Own等安全大会和相关研究可以看到,Agent安全的关注重点正在从单纯的“模型安全”,逐渐转向执行框架、工具链、身份权限、凭证以及运行环境安全。
因此,Agent安全防护也正在由传统的输入输出过滤,向权限最小化、凭证隔离、工具管控、沙箱执行、高危审批、行为审计和运行时监控等多层防御体系演进,在赋予Agent更强自主执行能力的同时,确保其始终运行在可控、可审计、可追溯的安全边界之内。
二、智能体类型
根据系统架构和实际应用场景的不同,Agent主要可以分为以下几种类型:
2.1按架构形式
单智能体:由一个Agent独立完成任务规划、工具调用和结果输出。
多智能体:由主Agent负责拆解和调度任务,多个子Agent并行协作完成复杂目标,比如某些AI自动化渗透测试系统则是多Agent协同完成测试。
2.2架构形式
通用智能体:完成研究、文档、网页、数据处理等适合大部分场景及个人需求;
编程智能体:读取代码库、修改文件、运行命令和完成开发任务;
浏览器智能体:可识别网页界面并执行点击、输入、表单操作等任务;
办公智能体:可连接企业数据和业务流程,构建办公及业务自动化;
安全智能体:用于威胁分析、身份安全、数据安全及安全运营自动化。
三、攻击面分析
OWASP组织围绕AI与Agent安全构建了分层防护体系,从通用应用安全和生成式AI安全逐步延伸至Agent特有风险,重点覆盖身份权限、工具调用、记忆投毒等关键安全问题,如下图可见:
OWASP结合Agent的技术特性、应用架构以及各领域专家的研究与实践经验,系统梳理并总结了十余类具有代表性的Agent安全威胁。如下图(只截取前面一部分):
尽管上面提到了Agent存在十几种攻击方式,但目前主要的攻击方式如下:
3.1提示词注入
提示注入是大模型及Agent面临的主要风险之一,攻击者可通过恶意指令诱导大模型绕过规则、泄露数据、滥用工具;也可将指令隐藏在网页、文档等外部数据源中形成间接注入。另外多模态Agent因接收文本、图片等多种输入,攻击面更加广泛。
例如攻击者构造恶意提示词,绕过AI的安全约束,迫使代理进程调用操作系统原生命令等破坏性指令,执行代码,窃取敏感数据、破坏正常业务逻辑流程等。
3.2工具越权调用
Agent最核心的能力之一就是工具调用。按照工具来源和执行方式,大致可以分为内置工具、第三方工具、MCP工具、API接口工具以及自定义Skill工具。其中,内置工具通常包括命令行、文件系统、代码执行等能力;第三方工具主要用于连接外部应用和服务;MCP和API则负责扩展Agent与业务系统、数据库及云服务之间的交互能力。
例如,一个允许执行bash、read_file等命令的Agent,如果输入未经严格过滤,攻击者可以通过构造特定输入让Agent调用命令执行获取系统信息及权限。
3.3沙箱逃逸致权限提升
Agent通常运行在沙箱环境中,但实际隔离边界可能存在缺陷。一旦沙箱在系统调用、文件访问、对象封装或网络权限等方面控制不严,攻击者便可能利用这些薄弱点突破隔离,进一步访问宿主资源或扩大攻击范围。
Agent 通常运行在一定程度的沙箱环境中,但实际隔离边界往往并不完全可靠。常见逃逸风险主要涉及沙箱边界突破、宿主接口暴露、权限配置不当、容器及运行时漏洞、内核缺陷、网络信道滥用、环境变量泄露以及进程权限继承等方面。
3.4记忆投毒
记忆投毒是指攻击者向Agent的短期或长期记忆中植入恶意、虚假或误导性信息,持续影响其上下文理解和后续决策,进而可能导致错误判断、权限滥用或非授权操作。
比如攻击者可通过向 Agent 的记忆系统注入恶意或虚假信息,使其长期保存错误的信任关系、用户权限等。被污染的记忆可能在后续任务中影响Agent的判断与决策,进而导致错误授权、违规操作或安全策略绕过。
3.5幻觉攻击
幻觉攻击指的是利用大模型可能生成看似合理但实际错误”的信息,并使其在Agent执行链中持续传播,干扰判断与任务规划,甚至导致错误推理、异常工具调用和非预期操作。
例如在实际测试过程中,大模型可能对部分高风险操作识别不足,在缺少人工审批或权限约束的情况下执行删除文件、修改配置、重启服务等操作,进而造成业务中断、数据损坏甚至生产环境受影响。
3.6数据泄露
敏感数据可能通过记忆、日志、配置文件或源码等途径泄露。智能体在运行过程中通常会保存上下文、调用记录、访问凭证等信息,若存储或访问控制不当,可能导致敏感数据跨会话、跨用户泄露。
例如,攻击者通过反编译工控软件源码,获取到硬编码的AI API-Key,并进一步滥用接口持续调用模型,造成凭证泄露、资源滥用及额外费用损失。
四、漏洞案例
4.1工具调用命令执行
上面讲到AI Agent最大饿核心功能是工具调用,因此工具大概也可分为内置工具、第三方工具、MCP工具、API接口工具、浏览器/计算机操作工具以及自定义Skill工具等。此处通过通过真实漏洞案例介绍下工具调用攻击。
Agent具备 bash、read_file、write_file 等高权限工具时,攻击者可结合恶意 Prompt 注入诱导其执行非预期操作,进而实现任意命令执行,甚至获取远程代码执行能力。
执行系统命令:
读取系统文件:
后续通过识别命令环境,发现与宿主机并未做相关隔离操作直通内网和其他主机。
4.2技能沙箱逃逸导致权限提升
该场景是一个某Agent允许开发者上传JS云函数作为Skill后端逻辑,运行于Kubernetes 容器中,并通过vm2实现代码隔离,整体沙箱边界存在缺陷,经过多次尝试发现异常点可实现逃逸。
首先针对vm2历史高危逃逸漏洞进行验证:
CVE-2021-23449: 通过Error.prepareStackTrace逃逸;
CVE-2023-29017: 通过宿主函数的arguments.callee.caller逃逸;
CVE-2023-37466: 通过Promise.resolve().constructor逃逸
上述历史漏洞完全失败:
然后尝试了多种攻击方式,比如构造器链完全失效、主函数本体被正确包装、原型链攻击无效、模块白名单也限制了危险模块。
上述尝试失败后,将测试思路转换,转向分析沙箱与宿主环境的数据交换接口。所有进入沙箱的数据都会被contextify,但从宿主返回到沙箱的数据可能存在处理不一致的情况。
通过编写脚本探测能从沙箱调用的宿主API,找出哪些返回值没有被contextify正确处理:
运行探测脚本后,发现存在一个关键的原生接口api异常反馈,在技能Agent 中JS编码器编写逃逸代码实现远程命令执行漏洞:
通过调试功能触发逃逸代码执行:
原生接口API返回的数据没有被vm2完整换成沙箱自己的对象,导致宿主环境的 Array/Function 引用意外泄露,最终成为突破沙箱边界的入口,上述为黑盒环境下的逃逸过程和结论。
为了验证上述结论的真实性、后面找到源码分析代码执行流程,通过代码分析,发现vm2最新版本3.11.6仍然存在该漏洞,具体代码分析如下:
产生漏洞的原因在于 vm2 将部分宿主环境的原生对象直接暴露给沙箱,且返回值未经过完整的 contextify 封装,导致沙箱内可访问到未经隔离的原生对象。攻击者可进一步利用其对象构造关系,间接获取宿主环境中的高权限执行对象,突破沙箱上下文限制,最终实现宿主机任意代码执行。
五、安全保护
未来Agent安全正逐步形成独立的安全领域,未来将围绕身份、权限、记忆、工具调用和行为审计建立新的安全边界,并推动传统IAM向人机协同治理演进。同时,攻防模式也将由人工测试逐渐发展为Agent之间的自动化持续对抗。
针对AI Agent在权限、数据、工具调用及执行环境等方面的安全风险,可从以下几个方面构建系统化安全防护体系:
5.1输入输出过滤
通过对Agent输入内容与输出结果进行安全检测,识别提示词注入、敏感信息、恶意指令及异常内容,防止风险指令进入执行链,并在Agent的输出到达用户或系统之前,进行安全检查是否泄露敏感信息、是否包含恶意指令、是否越权操作。
5.2权限最小化
智能体都应仅拥有完成其职责所需的最低权限。基于最小权限原则对Agent、工具及数据访问权限进行精细化控制,仅授予任务执行所需的必要权限,限制高危操作与越权访问,降低权限滥用和攻击扩散风险。
5.3沙箱隔离
某些Agent通常具备代码执行、文件操作及网络访问等高权限能力,若缺乏有效隔离,容易引发命令执行、SSRF等安全风险。通过沙箱限制系统权限、网络边界和资源访问范围,可有效降低攻击扩散及宿主环境受影响的风险。
5.4行为审计
建立分级行为审计与审批机制,对删除数据、修改生产环境、变更业务流程及共享敏感文件等高风险操作进行人工确认,未经授权不得执行,确保Agent行为全程可控、可追溯。
5.5工具与MCP安全
对Tool、Skill、插件、MCP等第三方供应链进行可信校验、参数检查及调用限制,防止恶意工具或异常调用进入Agent执行链。
六、总结
随着大模型和Agent快速发展,Agent给我们带来了较大的便利,逐步具备自主规划、工具调用、代码执行及网络访问等能力,安全风险也由传统内容安全延伸至权限、数据、工具和执行环境等多个层面。应通过输入输出过滤、最小权限、沙箱隔离、高危审批、工具与MCP安全及行为审计等机制,严格控制Agent权限与操作边界,防范高危风险,保障Agent安全、可控、可信运行。