基于 Agent Skill 的大模型自进化及其 C 端对话产品应用

所属专题:千行百业 Agent 创新实践

嘉宾 : 程鹏宇 博士 | 阿里巴巴-千问事业部强化学习方向负责人

讲师介绍

专题演讲嘉宾:程鹏宇 博士

阿里巴巴-千问事业部强化学习方向负责人

程鹏宇,阿里巴巴千问事业部大模型训练及应用团队强化学习方向负责人,主要承担千问APP主对话模型回复效果后训练,曾参与Kimi-VL、混元大模型等项目研发。于杜克大学电子计算机工程系和清华大学数学系分别获得博士和学士学位。ACL 2025/2026程序委员会领域主席,多次担任ICML/ICLR/NeurIPS等顶级会议审稿人,以第一作者/通讯作者身份在顶级会议发表论文20余篇。

议题介绍

演讲:基于 Agent Skill 的大模型自进化及其 C 端对话产品应用

Agent Skill 是一种将智能体能力与交互经验结构化、模块化封装的知识单元,为大模型持续学习和产品能力迭代提供了可复用、可组合、可验证的载体。本次分享将介绍阿里巴巴千问事业部在 Skill 驱动大模型自进化方向的近期探索,包括:从智能体交互轨迹中自动提炼 Skill;将 Skill 引入奖励评估,构建可执行、可审计的奖励系统;以及通过 Skill 驱动的 Agent 自我博弈,在减少人工标注依赖的同时持续拓展模型能力边界。在此基础上,报告将进一步探讨 Agent Skill 在 C 端对话产品中的应用,介绍如何将真实用户交互转化为可沉淀、可评估、可迭代的产品能力,形成模型持续进化的迭代闭环。

演讲提纲:

  1. 大模型自进化:从外部数据驱动到环境交互驱动
    • 大模型训练正在从一次性的数据学习走向持续的环境交互与自我改进
    • 自进化的基本闭环:任务生成、任务求解、结果评估与模型更新
    • 自生成任务是否有效、自评估奖励是否可靠,是闭环成立的关键
    • Agent Skill 为能力与经验的持续积累提供模块化载体
  2. Agent Skill:大模型能力与交互经验的结构化载体
    • Agent Skill 的基本定义与组织形式
    • 将成功经验、失败教训、操作流程和验证工具封装为可执行知识单元
    • Skill 的可复用、可组合、可验证和可迭代特性
    • Skill 如何缓解原始交互轨迹冗长、经验难复用和上下文成本高等问题
  3. 从交互轨迹中自动提炼 Skill:Trace2Skill
    • 从智能体成功与失败轨迹中发现可迁移的过程性知识
    • 通过并行轨迹分析与递归归并完成经验提炼、去重和冲突消解
    • 在减少人工编写与教师模型依赖的条件下自动构建 Skill
    • Skill 在不同模型、任务和领域之间的迁移与泛化能力
  4. 以 Skill 构建可执行的奖励系统:Skill-RM
    • 大模型奖励评估面临准则、参考答案、外部工具和验证器等异构证据
    • 将评估流程、判断准则与验证资源统一封装为 Reward-Evaluation Skill
    • 根据具体样本动态调用证据,生成结构化、可解释、可审计的评估结果
    • 为强化学习和模型持续进化提供更加可靠的信息密集型奖励信号
  5. 以 Skill 驱动 Agent 自我博弈:Skill Self-Play
    • 通过 Proposer 与 Solver 的协同进化自动生成训练任务与反馈信号
    • 结合 Skill 引导生成与开放探索,兼顾任务质量和能力覆盖面
    • 自动寻找模型能力边界,筛选具有学习价值的前沿任务
    • 在自我博弈过程中持续创建、更新和淘汰 Skill,推动模型能力演进
  6. Agent Skill 在 C 端对话产品中的应用
    • 真实用户交互 → 高价值轨迹筛选 → Skill 提炼与更新 → 自动评估 → 数据与奖励生成 → 模型训练 → 产品验证
    • 以 Agent Skill 连接产品交互、经验沉淀、奖励评估与模型训练
    • 让真实用户需求持续转化为可学习、可验证的模型能力
    • 通过产品效果反馈检验进化结果,并驱动下一轮迭代
    • 从人工维护的能力迭代逐步走向模型自主提炼、自主评估与自主进化

实践痛点:

  • 真实用户交互规模大、噪声高,如何筛选高价值轨迹,并从中提炼出不过拟合、不冲突且可复用的 Skill,是实践中的首要难点。随着 Skill 库规模增长,路由效率、推理成本、隐私合规以及训练后的能力退化也需要系统治理。

前沿亮点:

  • 这一方向的核心亮点,是以 Agent Skill 作为原始交互轨迹与模型参数之间可编辑、可验证的能力中间层。通过 Trace2Skill 提炼经验、Skill-RM 生成过程级奖励、Skill Self-Play 主动探索能力边界,可以将经验沉淀、奖励评估和训练数据生成连接成统一的模型自进化闭环。

听众收益:

  • 听众将建立 Agent Skill 驱动大模型自进化的完整认知,了解从轨迹提炼、奖励评估到自我博弈的关键技术方法。报告还将提供 C 端对话产品的落地思路,帮助听众理解如何将真实用户需求和 Bad Case 转化为可沉淀、可评估、可训练的模型能力,并提前识别其中的工程与治理风险。

交通指南

上海建工浦江皇冠假日酒店

Shanghai Construction Group Pujiang Crowne Plaza Hotel
地址:上海市闵行区陈行公路 3701 号
  • 微信咨询

  • 电话咨询

    联系电话:18514549229

微信联系我们

如您在购票过程中遇到问题,请扫码咨询票务小助手