GPU 加速大规模图神经网络训练与一站式图计算:技术实践分析与展望

所属专题:异构计算

嘉宾 : 苏立 | 阿里巴巴达摩院技术专家

会议室 : 富力 1

讲师介绍

专题演讲嘉宾:苏立

阿里巴巴达摩院技术专家

阿里巴巴达摩院技术专家,加入达摩院后担任 GraphScope 图计算团队图神经网络方向负责人,主要负责图学习平台的研发和业务落地工作。阿里巴巴开源的 Actor 模型事件驱动引擎 Hiactor 项目、分布式图神经网络框架 GraphLearn-for-Pytorch 项目负责人。南丹麦大学博士,曾在哥本哈根大学从事博士后研究。多篇论文发表在 SIGMOD、VLDB、 ICDE 和 ATC 等数据库和系统相关国际会议。

议题介绍

演讲:GPU 加速大规模图神经网络训练与一站式图计算:技术实践分析与展望

图神经网络在推荐系统、网络安全、金融风控等诸多领域有着广泛的应用。工业场景中的图具有大规模(百亿到千亿级别边)、异构(点边类型多)、属性丰富等特点。工业级大图往往超出单机系统的处理能力,而以 CPU 采样为主的开源分布式训练系统在性能上难以满足业务的实际迭代需求,且存在 GPU 利用率低等,CPU 和 GPU 资源比例分配不合理等问题。本次演讲将基于开源分布式 GPU 加速图训练框架 GraphLearn-for-Pytorch(GLTorch) 和一站式图计算平台 GraphScope,介绍达摩院图计算团队和阿里云机器学习 PAI 团队在合作打造 GLTorch 过程中的技术思考和系统设计理念,并分享在一站式图计算领域的实践积累和技术探索。

演讲提纲:

1. 背景与趋势

  • 图神经网络原理和应用

2. 工业级大图在训练过程中的挑战

  • 工业级大图的特性
  • 现有系统架构在解决上述挑战是的问题和不足

3. 图神经网络训练过程中的性能瓶颈分析

  • 典型图神经网络训练流程介绍
  • 结合数据和硬件特性分析训练过程中的性能瓶颈
  • 介绍 Legion,GNNLab 等研究工作在解决 GPU 加速训练上的探索

4. 工业级 GPU 加速分布式图神经网络训练的系统实践

  • GLTorch 整体系统架构设计的思考
  • 存储层设计、NVLink 缓存加速和分布式全异步采样技术实践
  • 贴合实际应用场景的灵活部署
  • 开源生态兼容

5. 图神经网络和一站式图计算应用实践

  • 图数据 ETL,推理 / 训练不同负载的图计算需求
  • 图计算算法的应用和对图神经网络训练效果的增益

6. 一站式图计算:场景、挑战和方案

  • 实际应用中的图计算 Workflow
  • 用户使用多种图计算 / 图神经网络系统时面临的挑战和困难
  • GraphScope Flex 产品思路和技术框架
  • GraphScope Interactive/Analytics/Learning 引擎
  • 一站式图计算对图存储的技术挑战和实践
  • 跨引擎数据访问接口和标准化图数据文件格式

7. 总结和展望

你将获得:

  • 了解分布式图神经网络训练和一站式图计算领域的前沿技术趋势
  • 了解大规模分布式图神经网络和图计算系统上的工程实践经验
  • 了解图计算和图神经网络的应用落地经验

交通指南

北京·富力万丽酒店

Renaissance Beijing Hotel
地址:北京市朝阳区东三环中路61号
  • 微信咨询

  • 电话咨询

    联系电话:+86 18514549229

领取往期热门演讲视频

领取往期热门演讲视频二维码
如您在购票过程中遇到问题,请扫码咨询票务小姐姐