在过去的三年中,基础设施开源软件随着大模型应用的加速而产生了翻天覆地的变化,计算... 展开 >





王旭,蚂蚁集团开源技术委员会副主席,蚂蚁开源技术增长团队和容器基础设施团队负责人。2019 年加入蚂蚁,目前负责蚂蚁的开源相关的整体战略和容器相关的基础设施的研发工作。在社区中,王旭代表蚂蚁担任开放基础设施基金会(OIF)的董事和木兰开源社区的技术委员会(TOC)成员。在加入蚂蚁之前,王旭是开源安全容器创业公司 hyper.sh 的联合创始人与 CTO,他们和 Intel、OIF 一起于 2017 年在奥斯汀发起了 Kata Containers 项目,后者自 2018 年起成为 OIF 的一个顶级开源项目。
在过去的三年中,基础设施开源软件随着大模型应用的加速而产生了翻天覆地的变化,计算任务的运算量和并行度空前增加,硬件架构异构化、分布化趋势不可逆转,传统基础软件的“操作系统+数据库”组合不仅自身在演进和适应,基础软件架构也在相应演化,新的生态位逐渐显现。本专题邀请在过去 QCon 出镜过的基础软件开源领域的大咖们来从他们的视角,回顾他们所在的领域的发展和面临的挑战,以及对未来发展和新机会的判断。
在过去近二十年,从云计算和基础设施代码化开始,到云原生和不可变基础设施的概念,IT 基础设施的可维护性和资源效能都取得了巨大的飞跃,这其中的核心系统也无一不是以开源为基础的。就在过去两三年里,随着大模型开始进入越来越多的生产环境,模型相关服务开始成为了新的基础设施,扩大了基础设施的范围,也让模型服务栈向着更加可靠、可维护、高效的基础设施化方向演进,这其中同样有大量的开源组件。本演讲我将回顾基础设施的演进历程,介绍当前的基础设施开源软件栈,并展望未来的 AI-Ready 的基础设施架构。
演讲提纲
1. 基础设施设施技术的演进
2. 架构演进:模型成为新的数据库
3. 模型为中心到基础设施
4. AI 中间件:Agent 基础设施
5. 展望:从“通算 + 智算”向通智一体的演进
高速互联总线技术正推动数据中心架构从传统多节点集群走向超节点形态。相对传统多节点集群以 Scale-Out 为主的扩展方式,超节点支持业务的 Scale-Up 扩展。这使得每个超节点都具备强大的算力。如何帮助业务用上超节点的能力,充分发挥超节点的算力极限,这对基础软件提出了更高要求。
本次演讲我将分享在超节点架构下构建开源基础软件的经验,探讨如何平滑迁移业务、最大化利用超节点的性能潜力,并提升系统的可靠性与可维护性。通过智能计算与通用计算两类超节点的对比实践,提炼可复用的设计理念与工程方法,为未来数据中心软件基础设施的演进提供参考。
演讲提纲
1. 超节点的兴起与技术驱动力
2. 超节点基础软件的架构挑战
3. 智能计算超节点的基础软件设计
4. 通用计算超节点的基础软件设计
5. 共性能力在基础软件中的落地
6. 迁移与落地实践
7. 未来展望
您认为,这样的技术在实践过程中有哪些痛点?
演讲亮点
听众收益
在过去的二十年间,我们的数据栈围绕着 3V ( Volume、 Velocity 和 Variety ) 的目标一直在进化,但是我们的数据栈构建仍然是围绕着引擎,而这没法使我们的数据栈智能化以顺应生成式 AI 时代的潮流。相反的,如果我们的数据栈围绕元数据进行重构,那么我们会从元数据中获得更多的可解释性信息,从而使我们的数据栈变得更智能化。
在本次演讲中,我将为大家介绍元数据驱动的数据架构,以 Apache Gravitino 为例,分享如何构建以元数据驱动的数据架构,并且使整个数据栈智能化,Agent 化。同时也会为大家演示如何以元数据为中心构建各种不同的数据 Agent,并通过 Agent 之间的协同解决数据领域中常见的问题。最后,在未来展望部分,探讨如何将元数据驱动的数据栈和大语言模型结合,让数据栈真正实现自动化和智能化。
演讲提纲
1. 背景
2. 现有架构的挑战和问题,尤其是面对 AGI 时代存在的问题
3. 如何才能解决这样的问题
4. 如何构建元数据驱动的数据架构
5. 使用元数据中心的数据架构搭建数据 Agent(demo)
6. 总结展望
您认为,这样的技术在实践过程中有哪些痛点?
这些挑战直接影响了智能化转型的速度和效果。
演讲亮点
听众收益
当前,生成式 AI 正以前所未有的速度发展,其大规模部署所依赖的推理基础设施面临诸多挑战。本次演讲我将深入探讨构建高效、可扩展的 LLM 推理基础设施的关键挑战与解决方案,并以 llm-d 项目作为核心参考。我们将分析 LLM 推理中普遍存在的高延迟、资源利用率低下、KV 缓存管理和复杂分布式编排等问题,首先介绍 vLLM 作为优化单节点 LLM 推理的基础引擎,阐述其如何通过 PagedAttention、持续批处理和推测解码等技术提升性能。随后我们将重点探讨如何将这些单节点优化扩展到分布式集群环境,作为 Kubernetes 原生的平台,实现 AI 感知路由和先进编排,从而构建更高效、可扩展的 LLM 基础设施。最后,我们将总结在实践中实现高性能和成本效益的“明智路径”,并呼吁行业共同参与云原生分布式推理开放标准的建设。
演讲提纲
1. 背景 & 问题
2. vLLM:单节点 LLM 推理优化
3. llm-d:分布式推理
4. 结论与行动呼吁
演讲亮点
听众收益



微信咨询

电话咨询
微信联系我们

