事情开始变得有点微妙了。过去两年,AI越来越会生成内容。文章、图片、视频、评论,生产门槛一路往下走,内容数量一路往上冲。

现在,平台开始让AI坐到另一边,去审核这些内容。AI开始审核AI了。

AI开始坐上审核席

6月25日,《金融时报》报道,Meta已经把约一半原本需要人工处理的隐私与社会风险审查请求交给大型语言模型,并计划继续扩大使用范围。Meta给出的试运行结果也很直接,大模型出现的错误更少,同时发现了更多违规问题。

这条消息真正值得关注的地方,不只是一家大厂又用了AI。

内容审核过去常被看成一项高度依赖人力的工作。机器先筛一轮,人工再盯着屏幕逐条判断。业务量涨了,就继续补人、排班、培训。规则一变,还要把新标准重新讲给每一个审核员。

这套方式运行了很多年。但是,现在看,到了AIGC时代,题目变了。

AIGC把审核题目改了

今天的风险内容越来越少把答案直接写在表面。

一张图片单独看没有问题,配上标题后却可能带着明显暗示。一段文字没有命中敏感词,放进具体语境里却是在诱导、挑衅或者规避规则。还有人在评论区用缩写、谐音、表情和梗传递信息,单看每一段都正常,拼在一起才看得出意图。

风险不只是变多了,也变得更依赖上下文、意图和表达方式。

传统机审擅长快速过滤已知风险,人工审核擅长处理复杂判断。但当模糊内容大量堆在两者之间,人工团队就很容易被重复判断拖住。真正高风险、真正需要经验的内容,反而只能和普通疑难样本一起排队。

问题已经从「能不能识别一个标签」,走到了「能不能理解这条内容为什么有风险,以及接下来该把它交给谁」。

机器和人工之间,还缺一层

Meta的尝试释放了一个很清晰的行业信号,内容审核链路里正在出现一个新角色。

它能读懂复杂内容,按照业务规则做判断,也知道自己的能力边界。高置信度的合规内容可以直接放行,明确违规的内容可以进入处置流程,真正复杂、存疑或者高风险的样本再交给人工。

这个角色更接近审核智能体。

人工审核依然重要。涉及重大风险、边界争议和最终责任的决策,需要人的经验与判断。变化发生在分工上,机器承担大规模基础识别,审核智能体处理语义理解、规则执行和流程分发,人工把精力留给高难度决策与最终把关。

易盾CMA的全称是ContentModerationAgent,定位正是内容安全审核智能体。它的价值不在于给传统审核再套一层大模型,而在于进入真实业务流程,承担一部分可以被验证、被管理、被持续优化的审核工作。

审核智能体,怎样才能真正上生产线

把通用大模型接进审核系统并不难,难的是让它稳定地工作。

它得先懂内容安全。CMA底层采用易盾安全大模型,在通用能力基础上加入大量内容安全语料训练,强化对涉政、色情、违禁、广告等风险的识别。面对隐晦表达和复杂语义,它需要给出审核判断,而不是泛泛地理解一句话。

它还得听得懂每家企业自己的规则。不同平台对相同内容的边界并不完全一致,CMA提供预设Prompt,也支持企业根据业务要求配置自定义Prompt;既可以采用只输出通过与不通过的极速审核,也可以按风险类型进行分类审核。

上线前的验证同样关键。CMA支持用真实样本批量验证Prompt效果,单个任务最多可验证5万条文本。团队可以查看准确率、定位误漏判样本、调整Prompt,再次验证,确认效果后逐步灰度上线。大模型的判断不再是一个看不见过程的黑盒,而是一套能够反复测试和校准的审核策略。

进入生产环境后,它也不能独立漂在原有系统之外。CMA可以与易盾机审、人工审核流程衔接,最多支持50条复杂进审规则同时生效,一条数据可配置最多五轮审核。哪些内容交给CMA,哪些继续流向人工,可以结合业务类型、风险等级和实际准确率灵活安排。

最后还要能持续发现问题。通过质检任务、质检报告和次品详情,团队可以追踪误判、漏判及其原因,并把结果用于下一轮Prompt优化。知识库则通过RAG为审核判断补充企业自身的规则依据,同时把审核标准沉淀为可更新、可查询的团队资产。

这些能力连起来,CMA才从一个「会判断内容的大模型」,变成一个能够配置、验证、上线、质检和迭代的审核智能体。

内容安全,开始重新分工

在AIGC社区、社交平台、游戏互动等高并发场景里,内容每天都在变,规则也会跟着业务变化。继续把所有模糊样本推给人工,审核团队很快就会被数量淹没。只依靠传统机审,又很难覆盖那些需要结合语境才能看懂的风险。

更合理的链路,是让传统机审守住速度,让审核智能体负责理解与分流,让人工专注复杂决策和最终把关。

对企业来说,真正值得讨论的也不再是AI能不能做审核,而是怎样把它放进现有流程,明确边界,验证效果,并让人和机器各自处理更适合自己的工作。

内容越多,审核越需要理解力。CMA做的,就是让这份理解力真正进入生产线。