深耕机器学习与分布式计算,致力于构建高效可扩展的大规模 AI 与数据基础设施,擅长攻克高并发资源调度难题,主导过千卡集群的性能调优与稳定性保障。持续推动 AI 与大数据生态融合,助力企业实现算力最大化。作为 Ray、Kueue、K8s、Spark 及 Hadoop 等开源项目的维护者/贡献者,长期主导社区治理与代码演进,推动关键调度特性落地工业界。

深耕机器学习与分布式计算,致力于构建高效可扩展的大规模 AI 与数据基础设施,擅长攻克高并发资源调度难题,主导过千卡集群的性能调优与稳定性保障。持续推动 AI 与大数据生态融合,助力企业实现算力最大化。作为 Ray、Kueue、K8s、Spark 及 Hadoop 等开源项目的维护者/贡献者,长期主导社区治理与代码演进,推动关键调度特性落地工业界。
AI 领域的三大核心负载——模型训练、批量推理与模型服务,均面临相似的弹性调度挑战。尽管业界已针对在线和离线场景分别推出了开源解决方案,但这些方案往往各自为战,仅能覆盖单一负载类型。为此,我们联合 openFuyao 社区共同设计并研发了面向 AI 原生工作负载的弹性调度框架 Aether。从业务落地效果来看,训练的 ETTR 达到 97%,千卡级离线推理任务端到端任务处理时间缩短 10%,部署 PD 分离模型服务的端到端效率提升 5%。
本次演讲我将围绕 Aether 的架构设计、关键技术决策与踩坑经验进行展开,分享如何构建一个高性能、高弹性的基础设施用于支撑 AI 原生工作负载。
演讲提纲
1. 背景与挑战生态趋势
2. 整体架构设计
3. 关键技术实践
4. 落地实践
5. 总结与展望
您认为,这样的技术在实践过程中有哪些痛点?
演讲亮点
听众收益



微信咨询

电话咨询
微信联系我们

