随着 AI 技术快速发展,持续涌现出 AI Agent、大模型训推、AI 数据处... 展开 >










博士毕业于浙江大学计算机学院,曾任职于 Ask.com、同花顺、阿里巴巴、蚂蚁集团等公司,长期从事分布式系统方向工作,涵盖搜索推荐、大数据、实时计算、在线机器学习、分布式计算、 Serverless、AI Infra 等领域,目前专注于构建统一支持包括 AI 在内各类分布式场景的通用 Serverless 分布式计算引擎 openYuanrong。
随着 AI 技术快速发展,持续涌现出 AI Agent、大模型训推、AI 数据处理等新形态计算负载,推动应用从传统 IT 和云原生时代快速迈入 AI 原生时代。面对日新月异的 AI 技术演进和与日俱增的 AI 应用落地需要,底层基础设施正朝大规模异构分布式迅速演进,要求提供多样异构资源池化管理供应、大规模动态弹性算力调度、高性能分布式数据传输共享、简单灵活的分布式应用编程等能力,以满足 AI 技术应用高速进化和高效运行需求。围绕这一确定性技术趋势,本专题重点交流探讨如何构建AI原生基础设施,包括业界容器 / Serverless 等云原生基础设施如何朝 AI 演进,以及如何利用一些新兴分布式技术构建 AI 原生基础设施等等。
涵盖方向:
虚拟化和安全隔离(XPU 虚拟化、容器、安全沙箱、轻量虚拟机等)
大规模 AI 集群管理和调度(资源池化、弹性调度、Serverless 等)
高性能 AI 数据系统(KV Cache、分布式数据缓存/传输等)
AI 分布式底座(Ray、openYuanrong、K8s等)
AI 应用框架(Agent、大模型推理、强化学习、SFT、预训练、数据处理等)
通过本专题的分享探讨,希望让听众了解和掌握 AI 基础设施领域最新技术发展趋势和业界成功实践,从中吸取经验,为自身企业选择合理的相关技术。
2026 年,AI 的核心挑战已从“模型是否足够智能”转向“基础设施是否可运维、可治理、经济可持续”。随着 AI Agent 从单体演示走向多智能体协作的分布式系统,传统云原生架构在 GPU 利用率、资源隔离、弹性调度和可观测性等方面面临严峻挑战。阿里云 AgentRun 团队基于大规模生产实践,提出以 Agentic Runtime 为核心的 AI 原生基础设施架构,深度融合容器化、XPU 虚拟化、Serverless 弹性与分布式协调能力,支撑高并发、低延迟、强隔离的 Agent 应用运行。
本次分享我将围绕以下关键方向展开:
AI 的下一阶段胜负手不在模型本身,而在基础设施能否承载责任。我将通过金融、电商等真实场景案例,展示 AgentRun 如何支撑日均亿级 Agent 调用,并分享在弹性扩缩容、故障自愈、成本归因等方面的工程实践。
演讲提纲
1、引言:AI 基础设施的范式拐点
当前 AI 应用演进趋势:从单模型调用 → 多 Agent 协作 → 企业级智能体系统
2、挑战:为什么现有云原生架构“不够用”?
3、AgentRun 架构全景:构建 AI 原生运行时底座
4、关键技术实践
5、落地案例:从 PoC 到规模化生产
6、总结与展望
您认为,这样的技术在实践过程中有哪些痛点?
1、模型能力与工程实现严重脱节(研发侧)
2、开发范式碎片化,重复造轮子(研发 & 部署侧)
3、本地体验差,云端依赖强(研发 & 用户侧)
4、成本不可控,难以规模化(部署 & 运维侧)
5、安全与信任缺失(全链路)
6. 技术与业务认知错位(组织侧)
演讲亮点
听众收益
大模型分离式推理、强化学习、AI Agent 等各类 AI 负载对分布式系统软件带来了各种诉求,例如大模型推理服务的快速伸缩/ EPD 分离/历史缓存加速,强化学习的多模型任务高效调度/训推参数异步更新/异步数据流,AI Agent 的快速弹性等。在企业落地实施时,通常一方面对现有的各种系统比如微服务系统进行扩展,另一方面针对具体场景构建各种新的分布式系统软件,最终平台需要构建和维护多个独立的软件,增加了整体方案的复杂度和维护工作量。
本次演讲我将分享 openYuanrong 解决思路,以分层架构构建 AI Infra 分布式基础设施,剖析各类 AI 负载对分布式系统软件的共性功能诉求,并在底层 openYuanrong 统一提供这些功能的高性能实现,上层面向各个场景适配扩展,从而简化了整体系统复杂度,也提升了资源的整体使用效率,在企业落地过程中取得良好的实践效果。
演讲提纲
1. 背景
2. openYuanrong 整体架构设计
3. 大模型推理实践
3. 强化学习实践
4. AI Agent 实践
5. 分布式训练实践
6. 经验总结与 Q&A
您认为,这样的技术在实践过程中有哪些痛点?
演讲亮点
听众收益
AI 领域的三大核心负载——模型训练、批量推理与模型服务,均面临相似的弹性调度挑战。尽管业界已针对在线和离线场景分别推出了开源解决方案,但这些方案往往各自为战,仅能覆盖单一负载类型。为此,我们联合 openFuyao 社区共同设计并研发了面向 AI 原生工作负载的弹性调度框架 Aether。从业务落地效果来看,训练的 ETTR 达到 97%,千卡级离线推理任务端到端任务处理时间缩短 10%,部署 PD 分离模型服务的端到端效率提升 5%。
本次演讲我将围绕 Aether 的架构设计、关键技术决策与踩坑经验进行展开,分享如何构建一个高性能、高弹性的基础设施用于支撑 AI 原生工作负载。
演讲提纲
1. 背景与挑战生态趋势
2. 整体架构设计
3. 关键技术实践
4. 落地实践
5. 总结与展望
您认为,这样的技术在实践过程中有哪些痛点?
演讲亮点
听众收益
AI 时代,开发者面临一个悖论:模型能力日趋强大,但基础设施的使用门槛却居高不下。无论是个人开发者想在单机上快速验证 Agent 应用,还是企业团队需要在私有 K8s 集群或公有云上部署生产环境,都不可避免陷入"Build Your Own Cluster"的泥潭——依赖冲突、部署复杂、运维繁重。
AKernel 是一个面向 AI 原生开发者的 Datacenter-Use 框架,核心理念是"像调用本地函数一样使用整个数据中心"。我们采用大库(monorepo)架构,300 万行代码统一维护,通过 AI 辅助开发实现 <=3 人全栈团队的高效协作。AKernel 提供一站式部署方案:无论面对单机、私有 K8s 集群,还是多云环境,均可在 10 分钟内完成部署。
技术层面,AKernel 融合了三大核心能力:基于 openYuanrong 的分布式数据系统,实现跨实例、跨节点的高性能数据共享;AFaaS fork 技术,实现 10ms 级节点侧启动、40ms 端到端延迟的极致弹性;基于 gVisor/Firecracker 的 Checkpoint/Restore 机制,赋能 Agent 的暂停恢复与克隆。在 Agent 长会话、RL 训练任务、Spark 数据处理等场景中,AKernel 显著降低了资源碎片率,提升了任务响应速度与资源利用效率。
本演讲将我将围绕 AKernel 的架构设计、关键技术决策与踩坑经验展开,分享如何在有限人力下构建可扩展、易维护的 AI 原生基础设施。
演讲提纲
1. 引言:AI 开发者正在被基础设施"劝退"
2. AKernel 架构:大库治理与 AI 辅助的工程实践
3. 一站式部署:从单机到多云
4. Agent 时代的三大技术支柱
5. 实践验证与典型场景
6. 总结与展望
您认为,这样的技术在实践过程中有哪些痛点?
演讲亮点
听众收益
随着大模型预训练和后训练的发展,Ray 已经逐步在 AI Infra 领域占据重要的生态位。K8s 作为云原生技术的核心系统,在 AI Infra 领域几乎是必选的算力基座。 本次演讲我将从调度的视角分析 K8s 和 Ray 的差异以及在技术栈上的协同,同时分享 K8s + Ray 在腾讯内部的万卡落地实践。
演讲提纲
1. AI Infra 技术栈与发展趋势
2. Ray 的调度视角
3. K8s + Ray 在腾讯内的落地实践
您认为,这样的技术在实践过程中有哪些痛点?
演讲亮点
听众收益
vLLM 一直专注于为大语言模型(LLM)提供高吞吐、低显存的推理能力。但今天的生成式模型已经远不止“文本输入、文本输出”:新的模型可以同时理解和生成文本、图像、音频、视频,背后也不再是单一自回归架构,而是由编码器、语言模型、扩散模型等异构组件拼接而成。vLLM-Omni 是最早一批支持“omni-modality”模型推理的开源框架之一,它把 vLLM 在文本推理上的性能优势,扩展到了多模态和非自回归推理领域。这是 vLLM 生态向“全模态(omni-modality)”时代迈出的关键一步,专门为新一代看得见、听得懂、会说话、能生成多种媒介的模型设计的推理框架。
本次演讲将从推理系统视角出发,解析全模态(Omni)模型给基础设施带来的新挑战,并结合 vLLM-Omni 的架构设计,分享如何在多模态输入输出、异构算子和多阶段生成链路下实现高效推理与工程优化。
演讲提纲
1. Omni 时代与系统挑战
2. vLLM-Omni 的统一架构
3. 性能优化与解耦部署
4. 能力边界与演进方向
您认为,这样的技术在实践过程中有哪些痛点?
全模态模型仍在快速发展,模型结构、生成路径和部署形态都没有完全收敛,框架设计需要避免过早绑定特定范式。相比传统文本 LLM 推理,全模态场景需要同时处理多模态输入输出、异构算子和多阶段流水线协同,系统复杂度显著增加。与此同时,解耦部署、异步 chunk、流式输出等优化虽然能够改善时延和资源利用率,但也会带来新的通信、调度、状态管理和运维复杂度,因此实践中一定存在明显 tradeoff。
演讲亮点
本次分享的亮点在于,从推理系统视角讨论 Omni 模型带来的新挑战,以及为什么它不是传统 LLM 推理框架的简单延伸。分享将结合 vLLM-Omni 的架构设计,介绍其如何基于 vLLM 生态扩展到全模态场景,并重点展开 Native Disaggregation、Async Chunk、Streaming Output、IO-Compute Overlap 等关键优化机制背后的设计思路与工程取舍。
听众收益
听众可以理解 Omni 模型对推理框架提出的新要求,建立对全模态推理系统的整体认识;同时获得一套分析解耦部署、流式传输、跨阶段调度和性能优化 tradeoff 的工程视角。对于正在关注多模态/全模态推理基础设施的团队,也能借此了解 vLLM-Omni 的适配路径和未来演进方向。
具身智能与自动驾驶的智能涌现高度依赖高质量数据闭环的转动。本次演讲我将深度剖析一套复用自百 PB 级自动驾驶经验、现已主导落地于具身智能场景的 AI 原生基础设施架构。
问题背景
演讲提纲
1. 背景:AI 原生基座的“第一性原理”
2. 存储支柱——PB 级多模态数据的存储演进
3. 调度支柱——数百张 GPU 卡的混合云精细治理
4. 闭环支柱——差异化路径下的全链路数据治理
5. 小结:反思——如何做一个“懂业务”的 Infra 架构师?
您认为,这样的技术在实践过程中有哪些痛点?
演讲亮点
听众收益



微信咨询

电话咨询
领取往期热门演讲视频

