The World Is Not a Dataset - Building AI Systems That Continuously Learn from Reality

所属专题:数据驱动的具身智能:迈向规模化之路

嘉宾 : 黄用韬 博士 | 蚂蚁灵波科技首席数据科学家

讲师介绍

专题演讲嘉宾:黄用韬 博士

蚂蚁灵波科技首席数据科学家

本科毕业于清华大学数理基础科学班,博士毕业于德州大学达拉斯分校,长期从事 AI 基础设施与分布式系统研究与实践,在自动驾驶领域拥有多年产业经验,曾任元戎启行技术合伙人,主导构建了大规模数据与训练基础设施体系,现任蚂蚁灵波科技首席数据科学家。

议题介绍

演讲:The World Is Not a Dataset - Building AI Systems That Continuously Learn from Reality

今天的 AI 越来越强调持续学习、自我改进和闭环迭代,但真实世界并不是一份预先准备好的数据集。对机器人而言,真正重要的不只是“拿什么数据训练”,而是如何理解数据产生时的任务、环境、硬件、模型版本与人工介入,如何从真实执行中识别能力缺口,并进一步决定下一轮该采什么、在哪里采、由谁执行,以及如何验证一次改进是否真正有效。

本次分享将介绍一种面向真实世界学习的系统视角:把任务、事件、状态、数据和资源组织在持续演化的时间轴上,通过端、边、云协同,把问题发现、数据产生、模型学习、评测验证和下一次行动连接成闭环。最终,数据集不再是系统的起点和终点,而是持续学习过程中动态形成的一种结果。

演讲提纲:

  1. 真实世界不是一份数据集
    • 为什么机器人学习不能只围绕静态数据集展开,以及数据集视角天然会丢失哪些关键上下文。
    • 从数据走向事件与上下文:任务创建、机器人执行、人工介入、失败、换件、标定、模型发布,本质上都属于学习系统的一部分。
  2. 学习并不是从训练开始的
    • 模型评测发现能力缺口后,需要进一步反向决定下一轮“由谁、在哪里、采什么、如何验证”。
    • 一次失败,不一定意味着再训练一次。失败可能来自模型能力,也可能来自硬件、环境、标定、数据质量或人工介入。
    • 系统需要先理解反馈,再决定下一步行动。
  3. 从数据流水线走向学习系统
    • 端、边、云不只是数据传输链路,而是一个能够协同处理问题、组织资源和驱动下一轮行动的系统。
  4. 持续学习真正需要什么
    • 核心不是单纯增加数据或扩大模型,而是缩短“发现问题—获得证据—产生改进—验证改进”的完整周期
    • 数据集不再是系统的起点和终点,而是持续学习过程中动态形成的一种结果。

实践痛点:

  1. 机器人学习若只围绕静态数据集展开,就会天然丢失任务、环境、硬件、模型版本与人工介入等关键上下文。
  2. 学习若从训练而不是从评测发现能力缺口开始,就难以反向决定下一轮由谁、在哪里、采什么、如何验证。
  3. 把一次失败简单归因于“再训练一次”,会忽略模型能力、硬件、环境、标定、数据质量或人工介入等真实原因。
  4. 端、边、云若只是数据传输链路而不能协同处理问题、组织资源和驱动下一轮行动,就无法缩短“发现问题—获得证据—产生改进—验证改进”的完整周期。

前沿亮点:

  1. 提出“真实世界不是一份数据集”的系统视角,把任务、事件、状态、数据和资源组织在持续演化的时间轴上。
  2. 重新定义学习起点,主张学习并不是从训练开始,而是从模型评测发现能力缺口、理解反馈开始。
  3. 将端、边、云从数据流水线升级为协同处理问题、组织资源和驱动下一轮行动的学习系统。
  4. 重新定义数据集与核心指标,让数据集成为持续学习过程中动态形成的结果,并以缩短“发现问题—获得证据—产生改进—验证改进”周期为目标。

听众收益:

  1. 理解为什么机器人学习不能只围绕静态数据集展开,以及数据集视角会丢失哪些关键上下文。
  2. 掌握把任务、事件、状态、数据和资源组织在持续演化时间轴上的真实世界学习系统视角。
  3. 学会从真实执行中识别能力缺口,并反向决定下一轮“由谁、在哪里、采什么、如何验证”。
  4. 获得失败归因与闭环度量框架,能够以缩短“发现问题—获得证据—产生改进—验证改进”周期来重新审视自身系统。

交通指南

上海建工浦江皇冠假日酒店

Shanghai Construction Group Pujiang Crowne Plaza Hotel
地址:上海市闵行区陈行公路 3701 号
  • 微信咨询

  • 电话咨询

    联系电话:18514549229

领取往期热门演讲视频

领取往期热门演讲视频二维码
如您在购票过程中遇到问题,请扫码咨询票务小助手