Safe RLHF 的挑战与蚁鉴的应对之策

所属专题:大模型数据工程和对齐

嘉宾 : 三笛 | 蚂蚁集团大安全技术 AI 工程团队负责人

会议室 : 国盛厅

讲师介绍

专题出品人:三笛

蚂蚁集团大安全技术 AI 工程团队负责人

三笛,蚂蚁大安全技术 AI 工程团队负责人,2011 年加入蚂蚁集团,有超过十年风控专业领域技术经历,专注大数据处理、高并发架构、人工智能在风控领域的创新和应用。带领团队完成蚂蚁新一代风控技术升级,应用风险预测技术将风控耗时降低至 10ms 内,并在蚂蚁获得多项技术大奖。

议题介绍

演讲:Safe RLHF 的挑战与蚁鉴的应对之策

大模型在带来前所未有的技术能力变革的同时,也“涌现”出许多“类人”甚至“超人”的能力,这些能力在提升工作效率和创新力的同时,也带来了一系列安全问题,如何生成更符合人类的偏好和价值观的正向内容同样成为业界关注的焦点。

为了确保大模型的安全性和可控性,我们将安全评测能力作为驱动大模型生产内容的核心任务,本次演讲阐述在 Safe RLHF(安全强化学习与人类反馈)的实践过程中,我们遇到了一系列问题和挑战,以及在解决这个问题实践中,加强安全评测能力、优化评测方法和技术的思考,希望能共同推动 Safe RLHF 的发展,推动大模型技术的安全、可控和可持续发展。

演讲提纲:

1. 为什么关注 Safe RLHF

  • 大模型应用面临哪些安全问题
  • 大模型价值对齐的方向与挑战

2. 增强模型的安全性方法

3. 落地案例分享 - 蚂蚁大模型安全检测产品:蚁鉴

4. 需长期解决的问题

听众收益:

  • 了解大模型价值对齐可能面临的挑战
  • 通过 Safe RLHF 的了解,熟悉大模型价值对齐一些方法
  • 熟悉安全评测技术解决方案,掌握有价值的系统实践案例

方案痛点:

  • 如何定义需要价值对齐的标准和分类
  • 生产高质量安全评测对齐的语料,保障覆盖面全和时效性
  • 如何进行大规模安全评测和流程自动化

交通指南

北京国测国际会议会展中心

GUOCE International Convention And Exhibition Center
地址:北京市顺义区临空经济核心区汇海南路6号院20号楼
  • 微信咨询

  • 电话咨询

    联系电话:+86 17310043226

微信联系我们

如您在购票过程中遇到问题,请扫码咨询票务小助手