在大模型时代, AI 技术的飞速发展带来了前所未有的机遇,同时也引发了新的安全挑... 展开 >





网易易盾 AI 算法负责人,中国信通院专家委员会成员,浙江大学行业导师,目前负责数字内容风控领域的人工智能算法研究,曾获浙江省科学技术进步奖一等奖、中国人工智能产业发展联盟年度创新人物等奖项,所带团队多次在音视频伪造检测、大模型安全等领域的人工智能算法竞赛中获得最高荣誉,拥有多项数字安全领域的发明专利并发表多篇国际期刊和会议论文。
在大模型时代, AI 技术的飞速发展带来了前所未有的机遇,同时也引发了新的安全挑战。随着 AI 模型的复杂性和自主性不断增加,它们不仅能够处理复杂的任务,还可能被用于欺骗其他 AI 系统或人类用户。本专题将深入探讨大模型的安全性问题,特别是如何应对 AI 模型之间的相互欺骗和攻击,以及这种现象对社会和人类的影响。
本专题讨论的方向:
1. 大模型的内在安全能力
2. 大模型的外部安全围栏
3. 大/小模型协同的综合检测方案
专题受众:
AI 安全与合规从业者
生成式 AI 平台与产品负责人
模型研发工程师与算法研究员等
通过本专题的深入探讨,听众将获得关于 AI 模型欺骗行为的全面理解,掌握关键技术和实践方法,并从成功案例中获得宝贵的参考,重构 AI 的「认知免疫系统」。
大模型的生成能力在拓展应用边界的同时,也引入了复杂多变的内容安全风险。传统防控手段因缺乏对风险本质的精准认知,难以构建动态有效的治理体系。本次演讲将提出 “评测驱动防护”的闭环技术框架:首先通过系统性评测解构风险分布与演化规律,突破隐性风险挖掘与评测准度瓶颈;其次基于风险画像构建可信防护机制,破解治理泛化性困境。我将从技术原理层面剖析评测与防护的关键路径,并探讨理论突破与工程落地的衔接挑战,为构建可信任的大模型内容安全治理范式提供学术支撑。
演讲提纲
1. 大模型内容安全风险图景与核心挑战
2. 大模型内容安全治理挑战
3. 大模型内容安全治理技术
4. 总结与技术展望
您认为,这样的技术在实践过程中有哪些痛点?
演讲亮点
听众收益
随着大模型的快速发展以及能力边界的持续突破,其计算成本高、响应延迟大、输出不稳定等挑战已成为规模化落地的核心瓶颈。同时,纯粹的小模型又难以应对复杂场景的理解与生成需求。大小模型协同正成为解决这一矛盾的关键路径,它通过工程与算法的协同设计,让大小模型动态配合、优势互补,从而实现系统效能的最大化。
本次演讲我将结合内容风控场景的实践,聚焦如何通过大小模型协同的体系架构设计,充分发挥大模型复杂场景理解能力强、泛化能力强、创造能力强的优势,同时结合小模型低成本低时延、定制敏捷、可控性高的特点,打造效果精准、实时响应、迭代敏捷、成本优化、稳定可靠的新一代数字内容风控系统。
演讲提纲
1. 背景与挑战
2. 大小模型协同解决方案设计与分析
3. 基于大小模型协同的数字内容风控实践
4. 未来展望
您认为,这样的技术在实践过程中有哪些痛点?
演讲亮点
听众收益
随着大语言模型(LLM)的加速普及,其在应用中带来的数据隐私与安全风险,正成为制约其规模化落地的关键挑战。传统的隐私计算方案,如联邦学习或同态加密,虽然安全性高,但因其技术复杂、成本高昂,难以在通用场景中广泛部署,无法满足日益增长的 AI 应用需求。
大语言模型强大的智能能力,本质上依赖于对用户提供信息的深度理解与处理。然而,将包含个人隐私或企业核心机密的原始数据直接提交给云端模型,存在着不可控的泄露风险。这种在“AI 效能”与“数据安全”之间的内在矛盾,导致用户难以在享受AI便利的同时确保自身信息安全,构成了当前 AI 普惠化进程中的核心瓶颈。
本次分享我将介绍一种创新的 HaS(Hide and Seek)隐私保护系统,通过首创的“语义同构标签”技术,在不暴露原始数据的前提下,实现了对敏感信息的结构化保护与云端大模型的安全交互。我们将展示该系统如何通过轻量化的端云协同架构,有效解决上述矛盾,为个人与企业提供一条兼顾隐私安全与 AI 效能的全新路径,让用户能够真正掌控自己的数据,安心释放 AI 的全部潜力。
演讲提纲
1. 背景与挑战
2. HaS 的解法
提出一种新的解耦思路:从“隐藏数据”转向“翻译业务意图”,该思路的核心技术是“语义同构标签”,一种保留了逻辑关系的结构化隐私表达。为此,我们设计了端云协同架构,将信任边界与数据控制权完全回归用户侧,并自研了轻量化端侧模型 HaS_SLM,用于高效执行本地的编译与还原任务
3. 系统架构设计
4. 实践效果与案例
5. 未来展望
您认为,这样的技术在实践过程中有哪些痛点?
演讲亮点
听众收益
本次演讲聚焦大模型安全风险的根源与系统化应对策略。从模型原理出发,剖析安全风险成因。提出多维安全评测体系,包括风险度量、数据质量评估与深度评测方案,为安全能力提供量化基准。重点探讨安全对齐在SFT、DPO、RLHF等训练阶段的嵌入方法。最后,介绍推理阶段“嵌入式围栏”新架构,实现运行时风险实时拦截与行为约束。整体构建“训练对齐—评测验证—推理防护”闭环安全体系,推动大模型在开放场景中安全、可控、可信落地。
演讲提纲
1. 大模型安全风险与挑战-从原理再看安全风险产生原因
2. 模型安全评测方案
3. 大模型内生安全能力建设-安全对齐
4. 推理阶段安全
您认为,这样的技术在实践过程中有哪些痛点?
演讲亮点
听众收益



微信咨询

电话咨询
领取往期热门演讲视频

