云原生工程实践

会议室:钻石厅D
出品人:蔡峰

在数字化转型的浪潮中,云原生技术成为各大互联网公司实现敏捷开发和高效运营的关键驱... 展开 >

专题出品人:蔡峰

携程高级研发总监

蔡峰,时任携程高级研发总监。在云原生领域,我拥有多年的技术实践和领导经验,引领携程从虚拟机时代、容器化时代到如今的 Kubernetes 时代,不断演进与创新。目前,我的主要任务是建设混合云平台,以加速携程业务的全球化进程。同时,我还负责携程大数据平台,为数据仓库团队提供稳定可靠的数据服务,以确保数据的质量和降低成本。


近年来,我持续关注大模型领域的发展,并致力于为业务团队提供基础的 GPU 服务和大模型支持。在这个快速变化的技术时代,我始终保持对新技术的敏锐洞察力,并以实践与创新的态度,推动着携程的技术发展和业务拓展。我热爱技术,热爱挑战,善于团队合作与领导,始终致力于将先进的技术与业务需求相结合,为公司的发展和客户的体验不断创造更大的价值。

地点:钻石厅D

专题:云原生工程实践

在数字化转型的浪潮中,云原生技术成为各大互联网公司实现敏捷开发和高效运营的关键驱动力。本专题将聚焦云原生战略与实践,深入探讨如何通过云原生技术加速业务迭代、优化成本以及应对安全挑战,旨在为一线技术工程师和高级技术管理人员提供前沿知识和实践经验。

  1. 不同公司的云战略选择:分享各大互联网公司在云战略选择上的实践案例,揭示如何通过云原生技术实现业务快速迭代,提升市场响应速度和竞争力。
  2. 云原生架构与应用构建:深入解析微服务、无服务器计算和服务网格等常见云原生架构,探讨如何利用这些架构快速构建高可用、高扩展的应用,提升开发和运维效率。
  3. 云原生安全挑战:讨论云原生环境下的安全挑战,包括容器安全、网络安全和身份验证等,提供最佳实践和解决方案,确保系统的整体安全性。
  4. FinOps挑战与实践:在云计算成本不断增加的背景下,企业如何实现财务与运营的有效协同至关重要。本专题将介绍FinOps领域的最新挑战与实践,帮助企业优化云成本,提升投资回报率。
  5. 基础设施即代码(IaC:展示如何通过代码化的方式管理和配置基础设施,实现基础设施的版本控制和自动化部署,提升运维效率和一致性。

通过本专题,参会者将全面掌握云原生技术的最新发展和最佳实践,推动企业实现持续创新和高效增长。我们将结合行业趋势和实际案例,深入探讨云原生技术在不同业务场景中的应用,期待与您共同探索云原生时代的无限可能。

by 徐可甲

阿里云
高级技术专家

在 AIGC 浪潮推动下,Kubernetes 逐步成为众多 AI 应用运行的首选平台。越来越多用户希望在 Kubernetes 容器集群中管理 GPU 资源,开发运行深度学习和大数据任务,部署和弹性管理 AI 服务。本议题旨在深入探索如何在智能计算服务的复杂生态中,如何基于 iLogtail 构建一套先进的可观测性采集与处理 Pipeline,将深入剖析构建过程中涉及的技术原理和难点,探讨可观测性 Pipeline 的性能和稳定性策略,最后结合案例讲解面向智算服务的可观测 Pipeline 构建实践。

演讲提纲

1. 云原生智算服务核心技术栈

  • 分层介绍云原生智算服务技术栈及核心场景
  • 智算场景下 Kubernetes 使用的新趋势

2. 智算服务可观测数据采集和处理的需求和技术难点

  • 根据智算服务部署、数据规模、多租的特点,如何低成本、安全地实现高效采集及数据标准化
  • 如何应对大规模智算集群自动化采集、批量管控、可观测的难度

3. 下一代可观测 Pipeline 架构设计

  • 整体设计目标与愿景
  • 围绕性能、稳定性、可编程性、生态能力等方面,展开介绍 Pipeline 核心架构

4. 智算场景下可观测 Pipeline 技术实践

  • 面向分布式多租集群的数据采集全面性与隔离性考虑
  • 大规模集群管控实践
  • Pipeline 稳定性建设实践

5. 开源与未来展望

实践痛点

  • 如何有效管理(大规模集群便捷的管控能力)和整合异构的多模态数据源(SPL等灵活的处理能力)以便于后续的高效数据分析
  • 如何确保在资源约束下处理大规模数据的性能、实时性、隔离性与稳定性
  • 如何与业务场景相结合,在复杂 AI 应用场景实现采集数据的全面性与数据精度

内容亮点

  • 下一代可观测 Pipeline 架构精析:深入探索面向智能服务的下一代可观测 Pipeline 技术架构,该架构以卓越性能为核心,依托高稳定性的系统设计,实现了数据采集、处理的极致效率与灵活性
  • 贴近实际业务场景,大规模多租户智算环境下的可观测 Pipeline 技术实践,包括不限于自动化管控、多租隔离等

听众收益

  • 了解智算服务核心技术与发展趋势
  • 结合 Kubernetes 技术生态,深入到核心技术原理和实现细节,帮助听众理解构建可观测 Pipeline 的技术挑战
  • 展望可观测性 Pipeline 技术在智算领域的未来发展方向

by 陈丹双

携程
资深研发工程师

by 许钦

携程
技术专家

云技术的快速演进对企业 IT 架构产生了深远影响,其中混合多云架构因其成本优势与灵活性逐渐成为企业的优选方案。携程目前在原有私有云的基础上,在全球采用多个公有云的混合多云架构部署。然而,这种复杂的多云环境也为成本管理和优化带来了巨大挑战。本次演讲将探讨携程如何在混合多云架构下实施有效的成本管理和优化策略。我们将重点分享携程通过落地 FinOps 实践,在成本洞察、成本分析和成本优化三个关键方向上的具体举措和成果。

演讲提纲

1. 背景

  • 携程混合多云架构简介
  •  FinOps 概念和携程落地思路

2. 混合云架构下 FinOps 面临的挑战

  • 不同云商计费模式的差异
  • 成本分配和可视化的复杂性
  • 资源管理和优化的难度

3. 携程 FinOps 的落地实践

  • 成本洞察:基于公有云账号体系及统一的计费模型构建 cost-insight 平台,实现多云环境下的成本可视化
  • 成本分析:运用成本计费算法模型,实现精细化的成本分析,为业务决策提供支持
  • 成本优化:通过成本归因模型提高资源利用效率,确保云资源的高效使用

4. 携程 FinOps 实践总结和展望

实践痛点

  • 数据的整合和标准化,如何通过建立统一的数据模型,应对混合多云环境下数据源的多样性
  • 计费的复杂性,平台共享资源的多级计费

演讲亮点

  • 混合多云架构下统一的成本洞察平台
  • 创新的成本计费模型,精细到应用级别的成本计费方法

听众收益

  • 了解 FinOps 的概念、原则和携程实践方法论
  • 了解如何在混合多云环境下基于统一的计费模型构建 FinOps 平台
  • 了解成本分析的方法和优化的策略

by 裴明明

网易
资深云原生架构师

在云原生架构下,中间件管理方式和传统方式有较大差别。首先在 K8s 上如何管理中间件集群,其次云原生架构将运维能力下沉,如何高效利用云原生能力并实现中间件跨可用区高可用?本次演讲主要介绍了网易在云原生架构下中间件的管理实践,重点介绍基于 K8s 的集群联邦能力实现中间件有状态应用跨可用区高可用的最佳实践,演讲还会分享网易在 K8s 中管理中间件遇到的难题和解决方案,并且会分享最终的落地效果和上云收益。

演讲提纲

1. 背景

  • 云原生的特征和中间件运维管控特点
  • 通过 Operator 管理有状态中间件 

2. 通过 K8s 集群联邦实现中间件高可用 

  • 云原生联邦架构下中间件访问方式,状态同步等难点和架构设计
  • 中间件有状态应用和集群联邦的结合方式

3. 云原生可观测性能力对于可靠性的提升

  • 保障中间件的高性能和高可用
  • 给中间件集群运维带来了的增强

4. 网易云原生架构下中间件管控的实践效果和收益

5. 中间件在云原生架构下发展展望

实践痛点

  • 先进技术和传统中间件应用结合时存在难以融合的点,如何在云原生架构上实现对中间件集群的管理
  • 中间件本身对性能、可靠性要求较高,云原生技术如何实现高性能、高可靠
  • 多 K8s 集群场景下应用管理本身复杂度高,要实现中间件集群在多 K8s 集群下高效管理更具挑战性,尤其是多 K8s 集群故障场景下的集群鲁棒性和自愈能力

演讲亮点

  • 利用云原生技术栈实现中间件集群的自动化管理,提升集群管理运维效率和自愈能力,增加中间件集群的弹性
  • 利用 K8s 的集群联邦能力实现中间件这类有状态应用的跨可用高可用

听众收益

  • 了解云原生架构和中间件结合方式
  • 云原生给中间件集群管理带来的优势以及中间件上云的难点
  • 中间件跨可用区高可用在云原生架构下的最佳实践

by 沈涛

eBay
资深软件工程师

eBay 目前面临混布的降本需求以及公共节点的 noisy neighbor 问题,大量的容器 IO,Emptydir IO 以及 Local PVC IO,加上不同类型的磁盘布局和类型,构成了复杂的磁盘 IO 隔离难题。本演讲主要分享下列技术细节:

  • 容器,Emptydir 以及 Local PVC 的 IO 分别如何限制以及遇到的问题
  • 如何利用 Cgroup v2 特性做磁盘 IO QoS 以及遇到的坑
  • 如何建立磁盘 IO 调度模型并优化节点调度

演讲提纲

1. 背景与问题

  • 集群资源优化与混布
  • 细粒度 IO 资源分配

2. cgroup v2 IO 隔离技术探索

  • cgroup io controller 的技术探索
  • IO weight 与 IO cost 的技术探索
  • 云原生与 cgroup v2 的适配

3. 本地磁盘 IO 隔离设计

  • 容器、临时存储与持久化存储 IO 限制
  • 磁盘 IO QoS 设计
  • Kubernetes 磁盘 IO 调度模型设计

4. eBay磁盘 IO 隔离落地实践

  • 复杂的磁盘分配布局带来的计算问题
  • 安全地功能管理与发布
  • 为什么我们放弃使用 IO cost

实践痛点

最大的痛点来自于磁盘 IO 是一个非常不稳定的度量,受到内存,CPU,磁盘类型,Block 大小,磁盘调度算法等影响,而用户很多时候也并不清楚他们的 IO 属性,所以很难给出一个可靠的限制值。所以我们尽量让用户做更小的选择。

演讲亮点

  • 探索了 cgroup v2 前沿特性在云原生的应用和落地
  • 探索了存储资源在云原生的调度模型和调度策略

听众收益

  • 企业如何做本地磁盘的 IO 限制
  • cgroup v2 在限制 IO 过程中有哪些坑
  • 如何构建本地存储调度模型

by 何子波

蚂蚁集团
高级技术专家

以 Kubernetes 为核心的云原生技术构建了高度可配置的 Infra 使用体系,包罗万象的配置覆盖延伸到基础设施的方方面面,在配置技术方面,社区云原生生态选择了 IaD 思路 YAML 的简单子集这样一种便简单、保守的思路,这也使得云原生技术在规模化、复杂场景的配置方面缺少体系化的解决方案,很难普适化推广一线开发者。

本次演讲将重点围绕动态配置管理、平台编排器、策略代码化等热点技术方向,并结合蚂蚁过去几年围绕声明式应用配置管理的落地实践,阐述相关的技术方案和选型,以及蚂蚁开源的平台工程技术栈 - KusionStack。

演讲提纲

1. 行业洞察

  • K8s 生态配置管理工具的发展
  • 基础设施代码化 (IaC) 的持续演进

2. 困难与挑战

  • 常见配置管理技术思路的局限与挑战
  • 基础设施代码化的复杂性与辛劳

3. 蚂蚁动态配置管理的技术实现

  • 自研配置领域专用语言 - KCL
  • 平台编排器 - Kusion
  • 配置安全与合规 - 策略代码化

4. 蚂蚁内部落地实践

  • 多元化应用基于配置驱动的 CI/CD
  • 规模化应用建站
  • 经验与踩坑 - 落地实践中的经验,好与坏都是积累

5. 总结与展望

  • 更多业务场景落地
  • 云原生工程化技术的持续探索

实践痛点

  • 开发者习惯控制台模式的交互,代码化具有一定的上手门槛,如何平衡、培养开发者心智,实现规模化落地
  • 灵活性与简单性之间的矛盾,如何在这两者之间找到平衡点,即保证了产品技术的一致性,同时也能快速的交付用户需求

演讲亮点

  • 基于自研 DSL 描述应用全生命周期配置,并通过中心化大库(Monorepo)管理,结合自研平台编排器 Kusion 实现应用与基础设施的高效链接,并自动完成身份权限、资源视图的建立
  • 核心技术全面开源,通过开源驱动产品技术持续迭代

听众收益

  • 了解业界关于基础设施代码化 (IaC) 、声明式配置管理领域的相关概念、最新进展
  • 了解并学习蚂蚁如何实现规模化的应用配置代码化,并基于此实现应用跨集群、跨云的高效交付
  • 了解蚂蚁开源的平台工程技术栈 - KusionStack,以及如何基于 KusionStack 构建内部的开发者平台

by 姬军翔

亚马逊云科技
高级解决方案架构师

一个常见的依托于大语言模型的翻译系统需要同时考虑到部署成本,合规审计,状态缓存,测试与反馈等诸多问题,仿照网络的 7 层架构,自底向上,我们将大语言模型系统分成了 7 层。本次演讲将重点放在如何充分利用 Serverless 的快速迭代和低成本特性,设计一个完整的大语言模型的应用。

演讲提纲

1. 大语言模型应用的 7 层模型

2. 案例分析:基于 Serverless 的大语言模型翻译应用     

  • 应用场景
  • 架构设计

3. 大语言模型工程化的挑战

  • 部署成本弹性伸缩和资源管理

4. Serverless 大语言模型应用最佳实践
    a. Servless Inference
    b. 函数设计原则
        i. 保持简单性
        ii. 保留本地调试能力
        iii. 冷启动优化
        iv. 引入函数编排
    c. 用消息队列匹配容量
    d. 使用正确的工具和框架
        i. CDK
        ii. Chalice
5.  总结
    a. 关键要点回顾
    b. Q&A 环节

实践痛点

  • Servless Inference 模型冷启动一般需要 8-10 秒钟
  • 当前的 Servless Inference 往往只支持 CPU,因此当前应该首选将周边模型部署在 Serverless 平台上

演讲亮点

  • 纵向提出了完整的大语言模型应用的 7 层模型概念
  • 横向覆盖从业务逻辑到落地的端到端全景图

听众收益

  • 针对大语言模型的一个翻译案例,提供从业务视角到到系统落地的完整案例分析
  • 获得大语言模型应用在 Serverless 场景下的部署最佳实践

by 段绪勇

微博
高级技术主管

在数字化时代,广告系统已经成为品牌推广和用户互动的重要工具。随着互联网和移动设备的普及,广告的形式和渠道迅速多样化,传统的广告系统面临数据处理能力不足、扩展性差以及响应速度不够快等挑战。云计算技术的崛起,为广告系统的创新提供了新的机会。

本次演讲将通过云计算的弹性扩展、强大的数据处理能力,广告主能够更灵活地进行资源管理和广告投放,同时实现大规模的数据分析和实时决策。在基于云计算的广告系统架构优化后,不仅提升了广告投放的精准度和效率,还降低了系统的整体运营成本。

演讲提纲

1. 背景

  • 数字化时代广告系统的重要性
  • 广告形式与渠道的多样化
  • 传统广告系统的局限性和挑战

2. 基于云计算的现代广告系统架构

  • 微服务架构
  • 容器化技术
  • 数据流和实时分析能力
  • 高效的广告投放与优化机制

3. 现代广告系统中的关键技术

  • 大数据分析与机器学习
  • 精准投放和个性化推荐
  • 实时竞价(RTB)和程序化广告
  • 人工智能在广告优化中的应用

4. 案例分析

  • 成功案例分享:如微博、谷歌、Facebook 等广告平台如何利用云计算
  • 分析这些案例中的创新点与实际效果

5. 对未来的展望

  • 广告系统的智能化与自动化
  • 广告系统与物联网(IoT)的结合
  • 增强现实(AR)和虚拟现实(VR)广告的兴起

实践痛点

  • 由于国外技术的限制,无法使用性能更优的硬件,在算法训练调优比较难于短时间内去验证
  • 数据库技术的限制,无法更高效挖掘数据的隐性特征

演讲亮点

结合 NLP、大模型、机器学习等新技术,不断地挖掘投放中新的客户群体。

听众收益

  • 现代广告系统的业务架构和系统架构
  • 了解基于云计算广告系统的未来趋势

交通指南

上海中谷小南国花园酒店

China Grain Hotel
地址:上海市杨浦区佳木斯路777号(近营口路口)
  • 微信咨询

  • 电话咨询

    联系电话:+86 18514549229

微信联系我们

如您在购票过程中遇到问题,请扫码咨询票务小助手