目前是 vivo AI 研究院计算平台组的资深工程师,负责计算平台容器方向。毕业于浙江大学,曾就职于 Oracle、Rancher 等公司,有丰富的云原生技术实践经验,积极参与开源社区,是kube-batch, tf-operator 等项目的 Contributor。

目前是 vivo AI 研究院计算平台组的资深工程师,负责计算平台容器方向。毕业于浙江大学,曾就职于 Oracle、Rancher 等公司,有丰富的云原生技术实践经验,积极参与开源社区,是kube-batch, tf-operator 等项目的 Contributor。
vivo AI 研究院的业务覆盖了AI各方向,包括语音、视觉、NLP、推荐等,有众多复杂的训练推理场景,对 GPU 算力有海量需求。 GPU 设备成本昂贵,使用门槛高,整体使用率较低。AI 计算平台基于 K8s 搭建了 GPU 集群,并结合一系列开源技术实现了批调度、弹性伸缩和 GPU 算力超卖等核心特性,有效提高资源利用率和降低工程门槛。经过两年的持续迭代,平台建设和落地取得了很大进展,成为 vivo AI 领域的核心基础平台,集群有上千个节点和超过 100 PFlops 的 GPU 算力,同时运行着上千个训练任务和上百个推理服务。
演讲提纲:
1. 背景:vivo AI 业务在 GPU 上的工程痛点
2. 整体架构概览
3. 建设实践
4. 总结和展望
你将获得:



微信咨询

电话咨询
微信联系我们

