B端应用在接入AI能力后,面临一个核心矛盾:纯云端推理延迟高、成本贵、数据出域合规风险大;纯端侧推理又受限于设备算力,无法处理复杂任务。如何找到端与云的最优分工?
我们构建了一套端云协同调度系统,核心是三层决策机制:规则引擎短路→ 端侧推理→ 云端推理,并支持混合流水线。调度器实时评估任务复杂度、端侧模型就绪状态、设备性能、网络质量,动态决策执行路径,云端失败时自动降级。
系统已在B端桌面端完成集成,规则引擎可覆盖60%+高频场景,端侧推理延迟稳定在100ms以内。本演讲将分享调度器的设计思路、端侧模型选型、混合流水线的工程实现,以及“端侧优先”原则下的取舍与踩坑。
演讲提纲
- 为什么B端场景需要端云协同?
- B端AI化的现状与困境:B端场景接入AI后普遍面临的“延迟高、成本贵、数据出域”三大痛点
- 行业正在形成共识:梳理行业端云协同进展,当前“端侧优先处理高频轻量任务”已成为行业技术共识
- 端侧不是万能的:指出端侧模型受限于设备算力和内存,复杂任务仍需云端处理,阐明“不是二选一,而是如何分工”的核心命题。
- 结论:不是二选一,而是如何分工
- 端云协同调度器的设计
- 设计目标与核心原则:明确调度器的设计目标是在成本、延迟、隐私、效果之间找到动态平衡,核心原则是“端侧优先,云端兜底,规则短路,混合增效”。
- 三层决策机制:详解规则引擎短路、端侧推理、云端推理的递进式决策链,以及各层的触发条件和切换逻辑。
- 调度决策的四个维度:说明调度器如何综合评估任务复杂度、端侧模型就绪状态、网络质量、隐私敏感度,实时做出最优执行路径决策。
- 混合流水线:端云协同的进阶形态:介绍端侧预处理+云端推理+端侧后处理的混合流水线模式,通过“查订单”案例展示端云协同的完整数据流。
- 端侧模型选型与性能优化
- 端侧模型选型对比:对比不同方案在推理性能、内存占用、框架兼容性等维度的差异,以及选型决策逻辑。
- 性能优化的三板斧:介绍量化、预加载等优化手段及其实际效果数据
- 落地效果与未来规划
- 当前进展:介绍SDK架构搭建、桌面版集成、配置平台开发等已完成工作,展示端智能体系的建设现状
- 预期收益:量化研发提效、成本降低、体验提升三大核心收益,明确方案的业务价值。
- 未来规划:说明Agent Runtime打磨、真实场景AB对比、配置平台上线等后续关键里程碑,展示持续演进路径。
实践痛点
- 端侧模型能力上限 vs 业务复杂度:端侧算力有限,需在业务覆盖与效果之间做取舍,动态判断何时切换云端。
- 设备碎片化与兼容性:不同设备存在差异,需在适配成本与兼容性覆盖之间权衡。
- 调度决策的“信息不全”困境:决策时模型是否就绪、网络是否稳定均不确定,需兼顾速度与容错。
- 端侧推理的“冷启动”问题:模型加载耗时数秒,预加载虽能优化,但对低端设备有额外资源压力。
- 混合流水线的状态管理复杂度:端云跨环节执行,状态传递与异常恢复复杂,需解决格式一致与兼容问题
前沿亮点
- 三层递进式调度决策体系
- 调度器设计了规则引擎短路→端侧推理→云端推理的三层决策链,并支持混合流水线。调度器综合评估任务复杂度、设备性能、网络质量实时决策,云端失败时自动降级。
- 端侧推理的“乐观路由+执行中重评估”策略
- 设计了乐观路由+执行中重评估机制:先按最优路径执行,执行过程中持续监测状态,遇到问题实时降级,而非追求100%准确的预决策。这种“边执行边决策”的思路在端云协同场景中具有独创性。
听众收益
- 理解端云协同在B端场景的落地逻辑
- 掌握端云协同调度器的设计方法
- 获取端侧模型选型与性能优化的实战经验
- 了解端云协同的六大痛点与应对方案
- 理解“端侧优先”原则下的架构取舍