三笛,蚂蚁大安全技术 AI 工程团队负责人,2011 年加入蚂蚁集团,有超过十年风控专业领域技术经历,专注大数据处理、高并发架构、人工智能在风控领域的创新和应用。带领团队完成蚂蚁新一代风控技术升级,应用风险预测技术将风控耗时降低至 10ms 内,并在蚂蚁获得多项技术大奖。

三笛,蚂蚁大安全技术 AI 工程团队负责人,2011 年加入蚂蚁集团,有超过十年风控专业领域技术经历,专注大数据处理、高并发架构、人工智能在风控领域的创新和应用。带领团队完成蚂蚁新一代风控技术升级,应用风险预测技术将风控耗时降低至 10ms 内,并在蚂蚁获得多项技术大奖。
大模型在带来前所未有的技术能力变革的同时,也“涌现”出许多“类人”甚至“超人”的能力,这些能力在提升工作效率和创新力的同时,也带来了一系列安全问题,如何生成更符合人类的偏好和价值观的正向内容同样成为业界关注的焦点。
为了确保大模型的安全性和可控性,我们将安全评测能力作为驱动大模型生产内容的核心任务,本次演讲阐述在 Safe RLHF(安全强化学习与人类反馈)的实践过程中,我们遇到了一系列问题和挑战,以及在解决这个问题实践中,加强安全评测能力、优化评测方法和技术的思考,希望能共同推动 Safe RLHF 的发展,推动大模型技术的安全、可控和可持续发展。
演讲提纲:
1. 为什么关注 Safe RLHF
2. 增强模型的安全性方法
3. 落地案例分享 - 蚂蚁大模型安全检测产品:蚁鉴
4. 需长期解决的问题
听众收益:
方案痛点:



微信咨询

电话咨询
微信联系我们

