智能体安全技术体系构建:评测、解释与防御

所属专题:智能体安全实践:可控与可靠

嘉宾 : 邱寒 博士 | 清华大学副教授

会议室 : 首府5

讲师介绍

专题演讲嘉宾:邱寒 博士

清华大学副教授

邱寒,清华大学网络研究院副教授、博士生导师。博士毕业于法国巴黎高等电信大学,研究方向为机器学习安全。主持国家重点研发计划课题、自然科学基金青年项目、CCF-蚂蚁金服科研基金等科研项目,在人工智能和安全领域顶会顶刊发表60余篇论文,获ACL 2024杰出论文奖、2022年IEEE智能计算专委会数据安全青年研究奖、2023年IEEE可扩展计算专委会早期职业成就奖、入选2023-2025年斯坦福大学全球Top2%科学家榜单,担任ACL、NeurIPS、ICLR等顶会的领域主席。

议题介绍

演讲:智能体安全技术体系构建:评测、解释与防御

人工智能技术正从以大语言模型为代表的对话模型,加速向能自主规划、调用工具、执行复杂任务的智能体,以及能够理解物理世界、进行预测和规划的“具身智能”演进。近期,OpenClaw这类可直接接入邮件、日程、文件和终端环境的智能体产品快速走热,但安全问题成为约束其落地的关键因素。本次演讲我将介绍针对智能体安全体系的思考和技术实践,包括针对智能体安全的评测、针对智能体行为的解释技术、以及针对智能体风险的防范方法。

演讲提纲

  1. 背景:从语言模型到智能体技术演进的必然性
    • 从安全视角看待语言模型和智能体的本质区别
    • Safety v.s. Security的分类机制
  2. 智能体安全评测的挑战与规划
  3. 如何解释智能体大脑(大语言模型)的行为
  4. 保障智能体安全落地的技术和预期

这样的技术在实践过程中有哪些痛点?

  • 今天智能体演进速度很快,无论是什么安全方案必然存在滞后性。

演讲亮点

  • 面向智能体安全的技术体系构建方法。

听众收益

  1. 获取构建智能体安全系统的落地路径;
  2. 针对大模型/智能体的可解释性技术与实践。

交通指南

北京富力万丽酒店

Renaissance Beijing Capital Hotel
地址:北京市朝阳区东三环中路61号
  • 微信咨询

  • 电话咨询

    联系电话:+86 18514549229

微信联系我们

如您在购票过程中遇到问题,请扫码咨询票务小助手