中文站

易盾动态

新一代数字内容风控领军者

动态资讯>大模型安全围栏
  1. 当AI不只“说错话”,还会“做错事”|金融智能体安全边界重构

    发布于: 2026-09-22

    网易智企作为华为“全球金融伙伴融海计划”成员,连续两日参与华为全联接大会2026金融AI安全专场;9月17日与华为数字金融军团联合解决方案发布,共建金融AI安全生态。

  2. 网易智企携手财跃星辰,共建金融大模型全链路安全治理体系

    发布于: 2026-09-18

    9月15日,网易智企与财跃星辰联合主办的金融大模型应用与治理研讨会在上海落下帷幕。双方发布金融大模型安全联合解决方案并签署合作备忘录,50多位金融机构管理者、技术负责人及行业专家展开深度交流。

  3. 两起AI自主越权事故突发,企业安全该怎么接招

    发布于: 2026-09-10

    OpenAI的AI Agent自主协调越狱、攻入Hugging Face生产环境;一个月后Mythos 5又自主注入恶意代码并伪造身份反侦察。文章拆解Agent行为链风险,提出企业需建设的三道防线。

  4. 金融大模型安全治理怎么做?从8号文到生产级安全围栏

    发布于: 2026-09-04

    网易智企易盾内容安全负责人饶晓艳分享金融大模型安全治理体系:金融AI风险正从"答错"走向"做错",8号文推动全周期治理,安全围栏成为业务系统的策略执行层,治理从内容安全走向Agent行为治理。

  5. 黑产如何用AI攻击企业?AI安全典型事件全景盘点

    发布于: 2026-08-31

    本文基于网易智企·易盾《AI安全白皮书》,盘点横跨数据至生态五层的十二起AI安全典型事件,涵盖数据泄露、越狱攻击、深度伪造、智能体删库、供应链投毒等路径,并提炼三大共性规律。

  6. 一句提示词,批量生成攻击:企业安全进入AI vs AI时代

    发布于: 2026-08-29

    网易智企联合金山办公、MiniMax发布的《AI安全白皮书》提出,人工智能攻防正进入"AI vs AI"时代,攻击更自动、隐蔽,企业需以内容安全为基础构建"内生安全+围栏防护"双重防御体系。

  7. 大模型安全防护怎么做?从训练到运营的全链路指南

    发布于: 2026-08-28

    大模型安全防护是覆盖数据层、模型层、应用层、智能体层、生态层,贯穿训练期、上线期、运营期全生命周期的治理体系,从训练数据源头治理做起。

  8. AI客服、AI教育、AI陪伴三类场景,大模型安全围栏怎么配?

    发布于: 2026-08-28

    三类场景的围栏配置各有侧重:AI客服重输入过滤与回复合规,AI教育重适龄化与内容审核,AI陪伴重隐私脱敏与伦理拦截,不能共用一套策略。

  9. AI幻觉能消除吗?成因与企业应对方法

    发布于: 2026-08-28

    幻觉是大模型生成"看似可信但不准确、不完整或过时信息"的原生缺陷,无法被彻底消除,但可以通过数据治理、模型评测与输出护栏系统性压降其发生概率与危害。据网易智企·易盾发布的《AI安全白皮书》,…

  10. AI训练数据合规要求有哪些?版权隐私质量

    发布于: 2026-08-27

    AI 训练数据合规核心涵盖版权、隐私、质量三大要求:训练数据须来源合法、授权完备,不含未脱敏的个人信息与受版权保护内容,并经过质量评估剔除错误与偏见数据。据网易智企·易盾发布的《AI安全白皮…