2025年以来,大模型应用正在经历一个关键转折——从「对话式AI」走向「执行式AI」。智能体开始调用API、访问数据库、操作业务系统、代表用户做出决策。大模型不再只是「说话」,而是开始「做事」。

这一转变带来了全新的安全挑战。艾瑞咨询《2026年中国互联网及AI大模型内容风控行业发展研究报告》明确指出:Agent行为风险——包括越权操作、远程操控和自动化攻击——是大模型内容安全的新兴威胁维度。当安全边界从「模型说了什么」扩展到「模型做了什么」,传统的纯内容审核不再够用。

大模型内容风控体系


Agent安全与内容安全的本质区别

内容安全关注的是输出是否合规——回答是否包含违规词、是否涉及敏感话题、是否有数据泄露。

Agent安全关注的是行为是否可控——调用哪个API、操作什么数据、执行什么权限、是否按预期路径运行。

维度 内容安全 Agent安全
核心问题 模型说了什么 模型做了什么
检测对象 文本/图片/音频输出 API调用链/权限/行为序列
防御手段 输入输出围栏 行为围栏+权限管控
违规后果 舆情/合规 资损/数据泄露/系统破坏

Agent面临的3类核心安全风险

越权操作

Agent被赋予访问数据库或调用API的权限后,可能在非预期场景下越权使用。例如:一个客服Agent被提示词诱导调用了用户数据删除接口,或者一个写作Agent在生成内容时无意中访问了不应读取的内部文档。

越权操作的核心难点在于:Agent的权限需求是动态的——它需要足够权限完成正当任务,但权限范围又需严格限制。静态的「一刀切」权限策略要么限制Agent能力,要么留下安全隐患。

远程操控与间接攻击

攻击者不直接攻击模型,而是通过Agent接入的第三方工具或API进行间接攻击。例如:Agent调用一个外部天气查询API,攻击者控制该API返回恶意数据,间接引导Agent做出错误决策。这种攻击路径比直接提示词注入更隐蔽、更难检测。

自动化规模攻击

Agent天然具备「批量执行」的能力——这是它的优势,也是它的风险。一个被攻破的Agent,可以在短时间内执行大量操作。如果Agent没有行为频率限制和异常检测机制,攻击者可以利用这点进行大规模的自动化攻击。


Agent安全围栏的3层防护

第一层:行为围栏

在Agent执行操作前,对操作意图和行为进行审查。关键能力包括:

  • 意图识别:区分用户请求是「查一下今天天气」还是「批量导出客户数据」
  • 行为分级:根据操作的风险等级设置不同的审批流程——低风险操作自动放行,高风险操作需要人工确认
  • 操作序列审计:追踪Agent的完整操作链条,检测是否存在「逐步越权」的渐进式攻击——单次操作合法,但组合起来构成风险

第二层:权限管控

借鉴零信任架构的「最小权限」原则,为Agent设置精细化的权限边界:

  • 数据分级访问:根据数据密级设置不同的访问权限——公开数据可自由查询,机密数据需要二次授权
  • API调用许可:白名单制管理Agent可调用的API,不在白名单中的API调用自动拦截
  • 上下文感知权限:Agent的权限可以根据对话上下文动态调整——同一Agent在客服模式下和系统管理模式下拥有不同的权限范围

第三层:监控与熔断

当出现异常行为时,安全系统需要及时介入:

  • 行为频率检测:监控Agent的操作频率,当请求频率异常升高时触发告警
  • 操作路径异常检测:Agent的操作路径是否偏离了预期的业务流程
  • 熔断机制:当检测到严重安全风险时,立即停止Agent的所有操作,保护业务系统不受影响

Agent安全治理的建设路径

Agent安全治理仍处于早期阶段,目前行业共识的建设路径是:

  1. 优先做行为围栏——在Agent执行操作前做意图审查和行为分级,这是最快速有效的切入点
  2. 逐步建立权限体系——从最小权限原则开始,根据运营经验逐步细化和扩展
  3. 补充监控和熔断——关注异常行为检测和应急断开能力,作为兜底防线
  4. 关联内容安全围栏——Agent的输入输出仍需要内容审核,行为围栏和内容围栏协同工作

选择Agent安全方案时,建议优先考察方案是否具备行为围栏能力和与企业现有Agent框架的集成能力。独立的Agent安全方案如果无法嵌入Agent的开发和工作流,实际落地效果会大打折扣。易盾的安全围栏体系在内容审核和Agent行为管控两个维度持续探索,已通过CMA审核智能体实现内容安全层面的Agent化能力。


Agent安全治理常见问题

Q1:Agent安全围栏和内容安全围栏需要分开部署吗?

A:两者定位不同但最好协同工作。内容安全围栏关注输入输出内容,Agent安全围栏关注行为权限。建议在有Agent的场景中同时部署两者,并在告警和运营层面打通。

Q2:Agent安全治理的最大挑战是什么?

A:最大的挑战是「权限的动态性」——Agent需要足够权限完成任务,但权限范围又需严格限制。静态的一刀切策略要么拖慢Agent能力,要么留下安全缺口。目前行业在探索基于对话上下文的动态权限分配方案。

Q3:当前有哪些Agent安全的最佳实践?

A:目前最成熟的实践是「三层防护」——行为围栏做事前审查、权限管控做事中控制、监控熔断做事后兜底。此外,建议建立完整的Agent操作审计日志,便于事后追溯和策略优化。

了解更多Agent安全治理方案,欢迎体验易盾大模型安全围栏