云上业务架构演进

会议室:中华厅 3
出品人:黄东平

越来越多的企业正在将系统迁移到云端,利用云技术实现资源弹性扩展、成本优化和效率提... 展开 >

专题出品人:黄东平

ProtonBase 技术副总裁

黄东平,现任 ProtonBase 技术副总裁,从事存储系统的设计与研发工作。曾任阿里巴巴资深技术专家,阿里云基础产品事业部盘古团队架构负责人,负责盘古 2.0 的架构设计和研发工作。在此之前,曾就职于微软 STCA、腾讯基础架构部、阿里云计算平台事业部,长期从事分布式调度系统、存储系统和计算系统研发工作。

地点:中华厅 3

专题:云上业务架构演进

越来越多的企业正在将系统迁移到云端,利用云技术实现资源弹性扩展、成本优化和效率提升的目标。这一转型涉及从传统架构向云原生架构的转变,通过利用云计算、存储和网络资源的独特优势,并采用服务化、容器化等技术手段,构建出高效、可靠、可扩展的云上业务系统。技术前沿的团队持续探索,设计更简洁、高效的架构为业务赋能。本专题重点讨论技术团队如何设计具有扩展性和弹性的云架构,进一步探索在数据系统和业务系统方面的应用与实践。

by 袁一

中国工商银行
大数据和人工智能实验室部门经理

随着数字化转型的深入和业务需求的快速发展,工商银行在算力资源规模和引擎多样性上面临新的挑战。为应对这些挑战,工行采取了扩大单集群规模、引入在线资源池等措施,虽然基本满足了业务需求,但也带来了单集群故障域扩大、机房容纳不足等问题。为此,工行进一步规划了多地多中心部署和存算分离演进。

本次演讲将详细介绍工行在IDC搬迁、网络数据传输优化、多厂商异构融合等方面的实践经验,并展示工行的多地多中心架构和存算分离架构,探讨如何通过技术创新实现高效、稳定的算力资源管理。

演讲提纲

  1. 算力扩充的初期探索与实践
  2. 传统架构局限性与提升思考
  3. 多地部署架构落地实践
  4. 存算分离架构探索演进
  5. 未来发展展望

您认为,这样的技术在实践过程中有哪些痛点?
在多地部署架构下,数据中心之间网络数据传输量很大,成本很高,需进一步考虑数据在加工后尽可能在同园区完成计算的设计。

听众收益

  1. 金融行业大数据平台规模化地向存算分离架构演进。
  2. 金融行业在自建机房资源有限的情况下,大数据平台如何向多地部署的架构演进。

by 吕帆

哔哩哔哩科技
客服系统技术负责人

在当今数字化时代,客户服务已成为企业竞争的关键一环。传统的架构存在稳定性低和智能化低情况。云客服作为一种高效、智能的客户服务解决方案,正逐渐成为行业标配。哔哩哔哩基于云的客服架构体系从2022年低开始从0到1开始建设,到现在已经历时两年。
 

演讲提纲

1、全面迁移至云端的战略意义

(1)传统架构的局限性分析

  (2) 新一代客服系统的转型方向

2、云客服系统整体架构解析

(1)系统架构全景图

(2)核心业务流程说明

3、云IM系统实践与创新

(1)IM系统架构设计

(2)消息传输机制优化

4、智能问答系统的演进与实践

(1)知识库体系建设

(2) 智能检索技术

(3)知识增强与问答优化

5、云工作台的效能提升实践

(1)系统集成与协同

(2)智能化分析工具

(3)资源优化配置

(4)知识检索优化

6、未来展望与发展思考

(1)云客服发展蓝图

(2)AI驱动创新方向

by 杨克特

ProtonBase
技术副总裁

在云原生技术日趋成熟的背景下,数据平台正从“烟囱式”架构向融合化演进,TP/AP一体化与实时离线一体化成为核心突破方向。传统架构因计算存储强耦合、资源争用等问题,难以支撑TP和AP并存、流批数据统一处理等高阶需求。


本次演讲深度解析两大场景的技术攻坚:针对TP/AP一体化,通过分布式事务保障强一致性、行列混合存储优化资源隔离,实现TP和AP负载的高效共存;针对实时离线一体化,为了解决当前主流流批引擎的痛点,提出实时处理和增量计算技术融合的方案,突破传统Lambda架构冗余开发与时效性瓶颈。同时,分享Data Warebase如何以云原生存算分离为基础,集成统一元数据、智能资源调度等能力,简化多场景架构复杂度,为未来数据与AI深度协同提供坚实底座。

演讲提纲

1.数据平台的云原生进程

- 典型数据架构的演进过程
- 数据本身对上云带来的挑战

2.当前数据平台的痛点和新场景需求

- 常见痛点介绍
- TP / AP 一体化需求
- 离线实时融合需求
- AI 数据协同

3.云原生数据平台的基础架构设计
- 如何保证数据系统扩展性
- 数据分片策略的取舍
- 解决分布式数据不一致的问题
- 如何保证数据系统的弹性
- 实时读写给弹性带来的挑战
- 选择合适的存算分离架构

4.TP / AP 一体化需求
- 常见场景介绍
- 介绍核心技术挑战和实践
- 如何保证 TP 和 AP 的数据一致性
- 如何保证 TP 和 AP 的资源隔离和公平性
- 介绍多种性能优化手段

5.离线实时一体化
- 介绍 lambda,kappa 等架构的演进
- 介绍现有方案在时效性、性能、资源开销三方面的取舍
- 介绍现有方案的核心痛点
- 提出新的实时处理和增量技术给这个场景带来的全新选择

6.AI 和数据的协同
- 介绍 RAG 的基本原理
- 传统搜索技术和向量检索的混合

7.Data Warebase 的实践和展望
- Data Warebase 如何有效的融合这些核心技术
- 通过 Data Warebase 简化数据架构的实践

您认为,这样的技术在实践过程中有哪些痛点?

一体化的方案,往往需要在用户开箱体验和单一场景极致优化中做出选择。为了系统尽可能的简单易用,我们选择了尽量减少配置,保障开箱体验的路线,但这样会牺牲一些极端单一场景的支持。

演讲亮点

- 在TP/AP一体化的场景下,大部分系统的方案还是通过数据同步(比如一份行存,一份列存)来实现。我们选择了在一份混合存储上来支持这个负载。
- 在离线实时一体化场景下,当下主流的选择是一个流计算系统加一个批处理系统的lambda架构,或者以流计算系统为基础的kappa架构。我们提出了实时加增量计算融合的全新思路。

听众收益

- 了解当下数据平台的核心痛点和全新需求
- 了解TP/AP一体化的挑战和实践方案
- 了解离线实时体化的场景,挑战和实践方案

by 李勇

中国银联股份有限公司
高级工程师

随着云计算和微服务架构的迅猛发展,企业对服务治理能力的需求日益迫切。作为金融行业的领导者,中国银联自主研发了服务网格产品,旨在解决大规模服务治理难题。本次演讲将分享银联服务网格产品的大规模落地实践,展示其如何在金融软硬件基础设施环境下,自 2018 年以来稳步演进,实现一站式标准化服务治理能力。

演讲提纲
1. 背景与目标

  • 技术背景:传统应用架构的局限
  • 落地目标:应用架构转型的方向

2. 架构实践

  • 服务网格总体框架:架构设计全景图
  • 服务网格升级实践:2.0~3.0升级
  • 关键设计
    • 异构协议治理:形成服务治理闭环
    • 存量系统迁移:大规模应用迁移方案
    • 弹性扩缩容:弹性扩缩方案设计

3. 应用实践

  • 高可用实践:金融级应用服务可用性实践
  • 可观测实践:技术+业务统一融合监控
  • 经验与踩坑
    • 金融异构软硬件环境适配
    • 数据面进程与流量治理
    • 边缘代理应用实践

4. 总结与展望

  • 总结银联服务网格落地实践效果
  • 展望未来服务网格的趋势与发展


演讲亮点
1. 很少有项目谈及自研服务网格云上架构,并直面解决大规模服务实践中的服务治理、高可用、平滑迁移、可观测问题
2. 贴近实际金融应用场景讲解如何使用服务网格技术平滑演进策略,带来收益


听众收益
1. 技术深度:掌握金融级服务网格自研架构演进路径,解析异构协议治理、存量系统迁移、弹性扩缩容等核心挑战的解决方案。
2. 业务价值:通过跨境支付、核心转接等真实案例,学习服务网格如何支撑金融级高可用与高效运维,时延<50ms。
3. 架构演进方法论:理解从传统架构到云原生服务网格的演进逻辑,掌握异构云环境中下的平滑迁移策略和成本控制方法,适配企业级复杂场景。

by 刘裕惺

快手
技术专家

随着云原生技术的飞速发展,有状态业务的上云已成为企业进一步释放云原生红利的关键领域。然而,由于有状态业务本身的复杂性,其云原生化过程面临诸多挑战,包括编排与调度、状态管理、流量治理、弹性扩展、运行时管控以及监控告警等多方面的难题。在这一过程中,快手经历了从传统运维到容器化,再到 Kubernetes 化,并最终实现 Operator 成熟化的多阶段技术演进。在有状态业务云原生化的实践中,快手积累了丰富的经验,覆盖数据库(如 MySQL、Redis、图数据库等)、大数据(如 ClickHouse、Doris、Hbase 等)等关键领域的应用与探索。


本次分享将重点聚焦快手在有状态业务云原生化过程中的最佳实践,详细剖析实际场景中的技术难点与解决方案。同时,我们希望与大家共同探讨有状态业务上云的未来发展方向与广阔前景。

演讲提纲

  1. 有状态业务上云带来的新的复杂度
  2. 快手有状态业务云原生化演进关键路径
  3. 快手有状态业务云原生化方案落地实践经验
    • 有状态业务上云迁移方案
      • 面向过程与面向终态的冲突与低成本转换
    • 有状态业务上云稳定性保障:
      • 编排调度,状态生命周期管理 & 高可用调度能力
      • 运行时管控,自动化与稳定性的双螺旋提升
      • 灰度变更,有状态业务 rollout 的新挑战及其解决方案
  4. 探讨有状态业务上云的未来趋势与发展

您认为,这样的技术在实践过程中有哪些痛点?

  1. 相比与无状态业务上云来看,有状态业务的上云需要较高的初期投入成本
  2. 由于有状态业务的复杂性与独特性,分享中提到的的实践经验与沉淀更多的是提供框架性的能力,而具体的落地仍需结合业务场景深入分析

演讲内容的前沿亮点

  1. 深度剖析有状态业务特性与 K8S 运维能力:清晰解析了有状态业务的核心特性,并结合 K8S 的原生能力,抽丝剥茧揭示有状态业务向云原生迁移的关键路径。
  2. 体系化的有状态业务上云实践经验:演讲以系统化的方式总结了有状态业务上云的经验,并提供了一条清晰的实现路径。这不仅降低了上云的试错成本,也为推动业界最佳实践的形成奠定了基础。
  3. 降低有状态业务上云的综合成本:通过分享具体的优化方案和实践案例,大幅降低了有状态业务上云的技术门槛和成本,助力企业更高效地完成云原生转型。

听众收益点:

  1. 深入理解有状态业务上云的复杂性及其本质。
  2. 掌握一条清晰的有状态业务上云的实践思路。
  3. 获取在有状态业务大规模上云过程中可能遇到的问题及相应解决方案的参考。

by 孙伟祥

小红书
容器研发

混合云环境下资源异构化和资源碎片化一直是制约资源效能的核心问题,而联邦化的弹性调度是解决这类问题的有效手段。近一年多以来,小红书内部逐渐将在线搜索推荐这类重数据、高敏感型业务,以及最近兴起的依赖GPU等异构算力的大语言模型(LLM)业务纳入到统一的联邦集群弹性调度架构体系,整合多云与多集群的碎片化资源形成全局资源池,实现了跨集群及跨云的弹性调度,以及在离线服务之间的弹性混部,在资源效能方面取得了不错的结果,也很好地应对了“Tiktok 难民潮” 等突发流量洪峰场景。本次分享将介绍小红书内部混合云架构下的联邦集群弹性调度的一些实践和探索。

演讲提纲

1. 背景与业务挑战

  • 混合云环境现状及痛点
    • 小红书混合云业务架构
    • 资源异构与资源碎片(CPU/GPU/NPU、跨云API差异)
    • 成本与效率的平衡(预留资源浪费 vs 突发需求响应)
  • 小红书业务场景特性
    • 搜索推荐:重数据、高并发、实时性、流量波动显著
    • LLM场景:GPU卡型异构、资源分散、离在线推理以及训推资源分配使用不均

2. 混合云联邦集群架构设计

  • 联邦调度核心框架
    • 统一多云、多集群接入层(联邦化的 K8s API)
    • 联邦应用编排(有状态、无状态、AI工作负载)
    • 联邦分级调度(全局资源视图 + 调度优化)
  • 统一资源池化
  • 跨云资源纳管(自建IDC & 云上)

3. 搜推与LLM场景实践与探索

  • 搜索推荐场景的跨云跨集群弹性
    • 有状态服务动态跨云、跨集群分发
    • 数据跨云多级缓存以及优化手段
  • LLM推理场景的成本效率优化
    • 全局统一推理资源池弹性调度
    • 在离线推理混部与弹性能力探索

4. 总结和展望

  • LLM在离线任务的深度协同
    • 统一资源池下的多类型异构体资源负载混合负载调度(GPU/CPU混部)
  • 硬件异构性的持续算力统一
    • 异构硬件调度视角算力标准化,异构算力下的负载均衡等

听众收益

  • 了解小红书内部多云多集群架构实践
  • 分享可复制的单集群接口兼容的联邦集群方案
  • 分享多云多集群场景下一些统一调度和弹性的落地实践

by 李洋

小米
高级云原生研发工程师

在 Kubernetes(简称 K8s)场景中,很多原生包括扩展的策略都是依托于不同维度的资源数据进行开发的,可以理解为资源数据是最能直接影响到策略结果的因素之一。然而无论是小到容器,还是大到集群,都拥有各自独特的资源属性,不能一概而论。但在通用型场景下,也不能重复造轮子。

资源画像,就是朝着K8s中最根本的资源方向,对不同类型的负载分层分类的刻画出更高维度的聚合数据,用数据丰富上游各种维度策略或提升现有策略准确性,从而解决“稳定性”、“交付”和“成本”等场景中的实际问题。本次分享将为大家介绍小米内部在资源画像方面的实践,以及解决了哪些业务场景问题,带来了哪些收益,希望能为大家提供一些新的思路。

演讲提纲


1. 从真实场景中分析不同维度遇到的挑战

  • 交付&成本:资源浪费导致集群容量不足,发布“pending”,间接导致无法容纳更多的业务,导致集群资源利用率低。
  • 稳定性:静态分配调度转实时负载感知调度后仍然有单机热点问题,影响业务稳定性。
  • 稳定性:弹性扩缩滞后,业务稳定性受到影响。

2. 画像体系构建与架构设计

  • 组织阵型搭建:资源画像研发小组及基础架构的设计。
  • 画像架构设计:能力拆解、组件划分、目标一致、各司其职。

3. 业务场景实践

  • 预测workload申请资源压缩,减少浪费,提高利用率。
  • 预测node真实用量调度,减少热点,提高稳定性。
  • 预测HPA提前扩容,避免无效缩容,提高稳定性。

4. 总结展望

  • 总结小米在资源画像实践中的效果。
  • 探讨更多机制设计与思考。

内容亮点

  1. 很少有项目能从“资源预测”与“特征训练”等层面直接解决用户与 K8s 间的痛点问题。
  2. 贴近实际业务场景来讲解如何使用资源画像增强策略,带来收益。

听众收益

  1. 学习如何通过特征提取、预测与算法等技术,为 K8s 场景赋能。
  2. 了解小米内部如何通过资源画像解决真实业务问题

交通指南

北京石景山万达嘉华酒店

Wanda Jin
地址:北京市石景山区石景山路甲18号院
  • 微信咨询

  • 电话咨询

    联系电话:+86 18514549229

领取往期热门演讲视频

领取往期热门演讲视频二维码
如您在购票过程中遇到问题,请扫码咨询票务小助手