中文站

易盾动态

新一代数字内容风控领军者

动态资讯>大模型安全围栏
  1. 金融大模型安全治理怎么做?从8号文到生产级安全围栏

    发布于: 2026-09-04

    网易智企易盾内容安全负责人饶晓艳分享金融大模型安全治理体系:金融AI风险正从"答错"走向"做错",8号文推动全周期治理,安全围栏成为业务系统的策略执行层,治理从内容安全走向Agent行为治理。

  2. 黑产如何用AI攻击企业?AI安全典型事件全景盘点

    发布于: 2026-08-31

    本文基于网易智企·易盾《AI安全白皮书》,盘点横跨数据至生态五层的十二起AI安全典型事件,涵盖数据泄露、越狱攻击、深度伪造、智能体删库、供应链投毒等路径,并提炼三大共性规律。

  3. 一句提示词,批量生成攻击:企业安全进入AI vs AI时代

    发布于: 2026-08-29

    网易智企联合金山办公、MiniMax发布的《AI安全白皮书》提出,人工智能攻防正进入"AI vs AI"时代,攻击更自动、隐蔽,企业需以内容安全为基础构建"内生安全+围栏防护"双重防御体系。

  4. 大模型安全防护怎么做?从训练到运营的全链路指南

    发布于: 2026-08-28

    大模型安全防护是覆盖数据层、模型层、应用层、智能体层、生态层,贯穿训练期、上线期、运营期全生命周期的治理体系,从训练数据源头治理做起。

  5. AI客服、AI教育、AI陪伴三类场景,大模型安全围栏怎么配?

    发布于: 2026-08-28

    三类场景的围栏配置各有侧重:AI客服重输入过滤与回复合规,AI教育重适龄化与内容审核,AI陪伴重隐私脱敏与伦理拦截,不能共用一套策略。

  6. AI幻觉能消除吗?成因与企业应对方法

    发布于: 2026-08-28

    幻觉是大模型生成"看似可信但不准确、不完整或过时信息"的原生缺陷,无法被彻底消除,但可以通过数据治理、模型评测与输出护栏系统性压降其发生概率与危害。据网易智企·易盾发布的《AI安全白皮书》,…

  7. AI训练数据合规要求有哪些?版权隐私质量

    发布于: 2026-08-27

    AI 训练数据合规核心涵盖版权、隐私、质量三大要求:训练数据须来源合法、授权完备,不含未脱敏的个人信息与受版权保护内容,并经过质量评估剔除错误与偏见数据。据网易智企·易盾发布的《AI安全白皮…

  8. 大模型输入输出安全检测怎么做?围栏防护的五个核心能力

    发布于: 2026-08-27

    大模型安全检测并非单点过滤,而是在输入、输出两侧双向部署围栏,由五大核心能力协同,把风险拦截在模型生成之前与返回用户之前。

  9. 模型选型必看:大模型安全测评横向对比怎么做?

    发布于: 2026-08-26

    直接给结论:多模型安全测评的横向对比,本质是在同一套测评基准上,用统一的题库、统一的对抗攻击手段、统一的自动化判定标准去跑多个候选模型,量化输出每个模型的安全评分与风险画像,再据此排序取舍。…

  10. 企业级围栏如何毫秒级拦截提示词注入与越狱攻击?

    发布于: 2026-08-26

    提示词注入与越狱攻击的防线,不在事后补救,而在模型输入、输出两端部署实时安全围栏。企业级做法是:在提示词到达模型前识别真实意图、审查越狱模板与对抗样本,在模型生成内容返回用户前做流式实时检测…