构建闭环安全体系:大模型的内生对齐与推理防护

所属专题:大模型安全:当 AI 学会欺骗 AI

嘉宾 : 许晓东 | 阿里云算法工程师

会议室 : 多功能厅 2

讲师介绍

专题演讲嘉宾:许晓东

阿里云算法工程师

许晓东,阿里云算法工程师。北京邮电大学计算机硕士,当前的研究方向是大模型安全,参与 Qwen 模型内生安全对齐工作。

议题介绍

演讲:构建闭环安全体系:大模型的内生对齐与推理防护

本次演讲聚焦大模型安全风险的根源与系统化应对策略。从模型原理出发,剖析安全风险成因。提出多维安全评测体系,包括风险度量、数据质量评估与深度评测方案,为安全能力提供量化基准。重点探讨安全对齐在SFT、DPO、RLHF等训练阶段的嵌入方法。最后,介绍推理阶段“嵌入式围栏”新架构,实现运行时风险实时拦截与行为约束。整体构建“训练对齐—评测验证—推理防护”闭环安全体系,推动大模型在开放场景中安全、可控、可信落地。

演讲提纲

1. 大模型安全风险与挑战-从原理再看安全风险产生原因

  • 模型面临的安全风险
  • 大模型安全能力建设-内生安全与围栏安全

2. 模型安全评测方案

  • 如何度量安全风险
  • 如何评价数据质量
  • 全面且深入的评测方案

3. 大模型内生安全能力建设-安全对齐

  • 安全对齐方法-应在哪些阶段引入安全对齐
  • SFT/DPO/RL 安全对齐
  • 安全性与有用性平衡

4. 推理阶段安全

  • 嵌入式围栏——新的围栏架构

您认为,这样的技术在实践过程中有哪些痛点?

  • 如何度量安全风险、评价数据质量和做全面且深入的模型安全评测
  • 通用能力和安全的权衡:何在不牺牲语言理解、多模态推理等通用能力的前提下,有效提升模型在各类任务中的安全生成表现,实现“安全性”与“通用性”之间的精细平衡

演讲亮点

  • 安全评测:如何全面深入地做模型安全评测
  • 内生安全对齐:如何有效对齐模型安全价值观

听众收益

  • 了解安全评测方法
  • 熟悉内生安全对齐方案

交通指南

上海浦东滨江喜来登酒店

SHERATON SHANGHAI PUDONG RIVERSIDE
地址:上海浦东大道2288号
  • 微信咨询

  • 电话咨询

    联系电话:+86 18514549229

微信联系我们

如您在购票过程中遇到问题,请扫码咨询票务小助手