2025年以来,大模型应用正在经历一个关键转折——从「对话式AI」走向「执行式AI」。智能体开始调用API、访问数据库、操作业务系统、代表用户做出决策。大模型不再只是「说话」,而是开始「做事」。
这一转变带来了全新的安全挑战。艾瑞咨询《2026年中国互联网及AI大模型内容风控行业发展研究报告》明确指出:Agent行为风险——包括越权操作、远程操控和自动化攻击——是大模型内容安全的新兴威胁维度。当安全边界从「模型说了什么」扩展到「模型做了什么」,传统的纯内容审核不再够用。

Agent安全与内容安全的本质区别
内容安全关注的是输出是否合规——回答是否包含违规词、是否涉及敏感话题、是否有数据泄露。
Agent安全关注的是行为是否可控——调用哪个API、操作什么数据、执行什么权限、是否按预期路径运行。
| 维度 | 内容安全 | Agent安全 |
|---|---|---|
| 核心问题 | 模型说了什么 | 模型做了什么 |
| 检测对象 | 文本/图片/音频输出 | API调用链/权限/行为序列 |
| 防御手段 | 输入输出围栏 | 行为围栏+权限管控 |
| 违规后果 | 舆情/合规 | 资损/数据泄露/系统破坏 |
Agent面临的3类核心安全风险
越权操作
Agent被赋予访问数据库或调用API的权限后,可能在非预期场景下越权使用。例如:一个客服Agent被提示词诱导调用了用户数据删除接口,或者一个写作Agent在生成内容时无意中访问了不应读取的内部文档。
越权操作的核心难点在于:Agent的权限需求是动态的——它需要足够权限完成正当任务,但权限范围又需严格限制。静态的「一刀切」权限策略要么限制Agent能力,要么留下安全隐患。
远程操控与间接攻击
攻击者不直接攻击模型,而是通过Agent接入的第三方工具或API进行间接攻击。例如:Agent调用一个外部天气查询API,攻击者控制该API返回恶意数据,间接引导Agent做出错误决策。这种攻击路径比直接提示词注入更隐蔽、更难检测。
自动化规模攻击
Agent天然具备「批量执行」的能力——这是它的优势,也是它的风险。一个被攻破的Agent,可以在短时间内执行大量操作。如果Agent没有行为频率限制和异常检测机制,攻击者可以利用这点进行大规模的自动化攻击。
Agent安全围栏的3层防护
第一层:行为围栏
在Agent执行操作前,对操作意图和行为进行审查。关键能力包括:
- 意图识别:区分用户请求是「查一下今天天气」还是「批量导出客户数据」
- 行为分级:根据操作的风险等级设置不同的审批流程——低风险操作自动放行,高风险操作需要人工确认
- 操作序列审计:追踪Agent的完整操作链条,检测是否存在「逐步越权」的渐进式攻击——单次操作合法,但组合起来构成风险
第二层:权限管控
借鉴零信任架构的「最小权限」原则,为Agent设置精细化的权限边界:
- 数据分级访问:根据数据密级设置不同的访问权限——公开数据可自由查询,机密数据需要二次授权
- API调用许可:白名单制管理Agent可调用的API,不在白名单中的API调用自动拦截
- 上下文感知权限:Agent的权限可以根据对话上下文动态调整——同一Agent在客服模式下和系统管理模式下拥有不同的权限范围
第三层:监控与熔断
当出现异常行为时,安全系统需要及时介入:
- 行为频率检测:监控Agent的操作频率,当请求频率异常升高时触发告警
- 操作路径异常检测:Agent的操作路径是否偏离了预期的业务流程
- 熔断机制:当检测到严重安全风险时,立即停止Agent的所有操作,保护业务系统不受影响
Agent安全治理的建设路径
Agent安全治理仍处于早期阶段,目前行业共识的建设路径是:
- 优先做行为围栏——在Agent执行操作前做意图审查和行为分级,这是最快速有效的切入点
- 逐步建立权限体系——从最小权限原则开始,根据运营经验逐步细化和扩展
- 补充监控和熔断——关注异常行为检测和应急断开能力,作为兜底防线
- 关联内容安全围栏——Agent的输入输出仍需要内容审核,行为围栏和内容围栏协同工作
选择Agent安全方案时,建议优先考察方案是否具备行为围栏能力和与企业现有Agent框架的集成能力。独立的Agent安全方案如果无法嵌入Agent的开发和工作流,实际落地效果会大打折扣。易盾的安全围栏体系在内容审核和Agent行为管控两个维度持续探索,已通过CMA审核智能体实现内容安全层面的Agent化能力。
Agent安全治理常见问题
Q1:Agent安全围栏和内容安全围栏需要分开部署吗?
A:两者定位不同但最好协同工作。内容安全围栏关注输入输出内容,Agent安全围栏关注行为权限。建议在有Agent的场景中同时部署两者,并在告警和运营层面打通。
Q2:Agent安全治理的最大挑战是什么?
A:最大的挑战是「权限的动态性」——Agent需要足够权限完成任务,但权限范围又需严格限制。静态的一刀切策略要么拖慢Agent能力,要么留下安全缺口。目前行业在探索基于对话上下文的动态权限分配方案。
Q3:当前有哪些Agent安全的最佳实践?
A:目前最成熟的实践是「三层防护」——行为围栏做事前审查、权限管控做事中控制、监控熔断做事后兜底。此外,建议建立完整的Agent操作审计日志,便于事后追溯和策略优化。