张文涛,焱融科技 CTO,毕业于华中科技大学计算机专业硕士,专注于分布式存储领域,拥有超过 10 年的大规模公有云存储架构开发和 AI 存储架构设计,参与主导了 YRCloudFile 高性能分布式文件存储系统从0到1的产品落地,并在 AI 场景落地具备一定的实战经验。在泛 AI,AI+行业(自动驾驶、智能制造、智能医疗)项目交付上,有着丰富的整体架构设计和性能优化经验。

张文涛,焱融科技 CTO,毕业于华中科技大学计算机专业硕士,专注于分布式存储领域,拥有超过 10 年的大规模公有云存储架构开发和 AI 存储架构设计,参与主导了 YRCloudFile 高性能分布式文件存储系统从0到1的产品落地,并在 AI 场景落地具备一定的实战经验。在泛 AI,AI+行业(自动驾驶、智能制造、智能医疗)项目交付上,有着丰富的整体架构设计和性能优化经验。
对于 AI 训练而言,基于深度学习的多模态大语言模型需要海量的算力和数据,但随着数据集和模型规模不断增加,应用程序载入数据所花费的时间变得越长,进而影响了应用程序的性能,缓慢的 I/O 严重拖累 GPU 的强大算力。如何大幅提升 GPU 载入大型数据集的速度将是计算和存储系统共同面临的最大挑战。本次演讲将从性能、规模、网络、协议以及成本等各个维度介绍当前 AI 企业面临的基础设施问题,并分享 YRCloudFile 高性能文件存储系统解决这些难题的的方法和思考。
演讲提纲:
1. 背景与趋势
2. AI 训练的存储难点及解决思路
3. YRCloudFile 高性能分布式文件存储实践
4. AI 训练的存储难点及解决思路
5. 总结与展望
你将获得:



微信咨询

电话咨询
领取往期热门演讲视频

