专题演讲嘉宾:王鑫

蚂蚁集团大模型训练数据处理系统 Altum 技术负责人

Apache Member(Apache 软件基金会成员),多个 Apache 顶级项目的 PMC Member、Committer,多个 Apache 孵化器项目的 Mentor。蚂蚁集团新一代大模型训练数据处理系统 Altum 技术负责人、实时智能技术负责人。加入蚂蚁集团前曾就职于阿里巴巴,并参与大数据领域早期创业。具备数据智能领域引擎、平台、数据解决方案的复合背景,当前重点关注 AI Data Infra 的建设。

by 王鑫

蚂蚁集团
大模型训练数据处理系统 Altum 技术负责人

在大模型训练数据规模持续提升、模型迭代效率持续加快的背景下,业界在模型数据处理的 GPU 效能、任务稳定性、数据交付时效等方面面临巨大挑战。蚂蚁通过新一代大模型训练数据处理系统 Altum 的建设,尝试系统化解决这些问题。本次分享将重点介绍在性能、稳定性、效率等方面提升的关键技术策略和背后的思考与取舍,以及业务生产实践案例。

演讲提纲:

  1. 背景
    • 业界、蚂蚁在大模型训练数据处理上面临的挑战;
  2. 整体方案
    • 涵盖算力、引擎、平台、数据等多个层次的体系化方案;
  3. 极致性能优化
    • 异构算力融合调度:向上兼容不同算子体系、向下支持多种算力类型,提升全局资源利用率;
    • 基于数据湖存储 Paimon 的端到端升级:从数据采集到模型训练消费的端到端优化,提升存储与网络 IO 性能;
    • 算子性能优化与增量计算(全局去重、样本重试、增量同步等),提升 GPU 计算性能;
  4. 稳定性提升
    • 样本级重试、端到端可观测与 SLA 保障、熔断保护机制、智能运维诊断;
  5. 研发效率提升
    • 端到端场景化 Pipeline:场景化研发范式、增强能力(节点、算子)、人机协同研发;
    • Agentic 数据处理:支持逐条数据的多轮 Agent 处理;
  6. 生产实践与未来展望
    • 在阿福、百灵等内部场景的落地效果;
    • AI Data Infra 发展方向。

实践痛点:

  • 跨引擎调度的统一抽象 vs 引擎特有能力损失:不同引擎的统一在一定程度上牺牲了各引擎的独有优化,需要在统一对齐上做 tradeoff,做不到「零损失抽象」;
  • 样本级重试的降本空间 vs 幂等约束与熔断阈值的平衡难题:只重跑失败样本能根治「全量重跑烧 GPU」,但失败熔断阈值在「误杀抖动」与「无效烧卡」之间难以平衡。

前沿亮点:

  • 「高失败率、低吞吐、高交付时长」三角困局下的体系化解法;
  • 从全局资源利用率、存储与网络 IO、计算性能全方位的极致性能优化;
  • 场景化、Agentic 方式的 AI 数据研发新范式。

听众收益:

  • 了解大模型背后训练数据处理的全链路;
  • 掌握全链路数据处理背后的关键技术挑战与系统性解法;
  • 获得真实业务场景下的落地路径。

交通指南

上海建工浦江皇冠假日酒店

Shanghai Construction Group Pujiang Crowne Plaza Hotel
地址:上海市闵行区陈行公路 3701 号
  • 微信咨询

  • 电话咨询

    联系电话:18514549229

微信联系我们

如您在购票过程中遇到问题,请扫码咨询票务小助手