许晓东,阿里云算法工程师。北京邮电大学计算机硕士,当前的研究方向是大模型安全,参与 Qwen 模型内生安全对齐工作。

许晓东,阿里云算法工程师。北京邮电大学计算机硕士,当前的研究方向是大模型安全,参与 Qwen 模型内生安全对齐工作。
本次演讲聚焦大模型安全风险的根源与系统化应对策略。从模型原理出发,剖析安全风险成因。提出多维安全评测体系,包括风险度量、数据质量评估与深度评测方案,为安全能力提供量化基准。重点探讨安全对齐在SFT、DPO、RLHF等训练阶段的嵌入方法。最后,介绍推理阶段“嵌入式围栏”新架构,实现运行时风险实时拦截与行为约束。整体构建“训练对齐—评测验证—推理防护”闭环安全体系,推动大模型在开放场景中安全、可控、可信落地。
演讲提纲
1. 大模型安全风险与挑战-从原理再看安全风险产生原因
2. 模型安全评测方案
3. 大模型内生安全能力建设-安全对齐
4. 推理阶段安全
您认为,这样的技术在实践过程中有哪些痛点?
演讲亮点
听众收益



微信咨询

电话咨询
微信联系我们

