端云协同与 AI Native 终端生态:从端侧模型到智能体应用

会议室:待定
出品人:潘鹏举

过去一年,端侧 AI 已经从“把小模型跑在手机、车机、IoT 上 &... 展开 >

专题出品人:潘鹏举

蔚来搜推 & 大模型算法负责人

潘鹏举,蔚来搜推 & 大模型算法负责人,负责垂类大模型算法、搜推算法、营销算法的技术规划和算法应用实践,致力于借助大模型技术帮助用户创造超越期待的用户体验,曾任携程、平安银行的算法团队负责人,主导和推动人工智能算法的研发和应用。

专题:端云协同与 AI Native 终端生态:从端侧模型到智能体应用

过去一年,端侧 AI 已经从“把小模型跑在手机、车机、IoT 上 ” 进入到”让终端成为智能体Agent入口”的阶段。AI 手机、可穿戴设备、车载终端、机器人和超级 App 都在重新设计自己的智能架构:

  • 端侧负责感知、低延迟交互、隐私保护、个性化记忆和本地工具调用;
  • 云端负责复杂推理、知识更新、多 Agent 编排和跨设备协同。真正的挑战不再只是模型压缩或 NPU 加速,而是如何在模型、芯片、OS、App、云服务和体验设计之间建立一套可规模化演进的 AI Native 终端体系。

本专题聚焦 AI Native 硬件与端云协同系统的真实落地,讨论端侧模型、NPU/异构计算、端云联合推理、OS Agent、多模态感知、以及跨设备智能体体验如何从 Demo 走向量产。

专题受众:终端设备厂商、AI PC/手机/车载/IoT 团队,客户端架构师,端智能负责人,推理框架与芯片生态工程师,大模型平台团队,超级 App 技术负责人,以及正在推进 AI Native 产品落地的技术管理者和产品负责人。

by 李东东

快手
电商 B 端商家前端负责人

B端应用在接入AI能力后,面临一个核心矛盾:纯云端推理延迟高、成本贵、数据出域合规风险大;纯端侧推理又受限于设备算力,无法处理复杂任务。如何找到端与云的最优分工?
我们构建了一套端云协同调度系统,核心是三层决策机制:规则引擎短路→ 端侧推理→ 云端推理,并支持混合流水线。调度器实时评估任务复杂度、端侧模型就绪状态、设备性能、网络质量,动态决策执行路径,云端失败时自动降级。
系统已在B端桌面端完成集成,规则引擎可覆盖60%+高频场景,端侧推理延迟稳定在100ms以内。本演讲将分享调度器的设计思路、端侧模型选型、混合流水线的工程实现,以及“端侧优先”原则下的取舍与踩坑。

演讲提纲

  1. 为什么B端场景需要端云协同?
    • B端AI化的现状与困境:B端场景接入AI后普遍面临的“延迟高、成本贵、数据出域”三大痛点
    • 行业正在形成共识:梳理行业端云协同进展,当前“端侧优先处理高频轻量任务”已成为行业技术共识
    • 端侧不是万能的:指出端侧模型受限于设备算力和内存,复杂任务仍需云端处理,阐明“不是二选一,而是如何分工”的核心命题。
    • 结论:不是二选一,而是如何分工
  2. 端云协同调度器的设计
    • 设计目标与核心原则:明确调度器的设计目标是在成本、延迟、隐私、效果之间找到动态平衡,核心原则是“端侧优先,云端兜底,规则短路,混合增效”。
    • 三层决策机制:详解规则引擎短路、端侧推理、云端推理的递进式决策链,以及各层的触发条件和切换逻辑。
    • 调度决策的四个维度:说明调度器如何综合评估任务复杂度、端侧模型就绪状态、网络质量、隐私敏感度,实时做出最优执行路径决策。
    • 混合流水线:端云协同的进阶形态:介绍端侧预处理+云端推理+端侧后处理的混合流水线模式,通过“查订单”案例展示端云协同的完整数据流。
  3. 端侧模型选型与性能优化
    • 端侧模型选型对比:对比不同方案在推理性能、内存占用、框架兼容性等维度的差异,以及选型决策逻辑。
    • 性能优化的三板斧:介绍量化、预加载等优化手段及其实际效果数据
  4. 落地效果与未来规划
    • 当前进展:介绍SDK架构搭建、桌面版集成、配置平台开发等已完成工作,展示端智能体系的建设现状
    • 预期收益:量化研发提效、成本降低、体验提升三大核心收益,明确方案的业务价值。
    • 未来规划:说明Agent Runtime打磨、真实场景AB对比、配置平台上线等后续关键里程碑,展示持续演进路径。

实践痛点

  1. 端侧模型能力上限 vs 业务复杂度:端侧算力有限,需在业务覆盖与效果之间做取舍,动态判断何时切换云端。
  2. 设备碎片化与兼容性:不同设备存在差异,需在适配成本与兼容性覆盖之间权衡。
  3. 调度决策的“信息不全”困境:决策时模型是否就绪、网络是否稳定均不确定,需兼顾速度与容错。
  4. 端侧推理的“冷启动”问题:模型加载耗时数秒,预加载虽能优化,但对低端设备有额外资源压力。
  5. 混合流水线的状态管理复杂度:端云跨环节执行,状态传递与异常恢复复杂,需解决格式一致与兼容问题

前沿亮点

  1. 三层递进式调度决策体系
    • 调度器设计了规则引擎短路→端侧推理→云端推理的三层决策链,并支持混合流水线。调度器综合评估任务复杂度、设备性能、网络质量实时决策,云端失败时自动降级。
  2. 端侧推理的“乐观路由+执行中重评估”策略
    • 设计了乐观路由+执行中重评估机制:先按最优路径执行,执行过程中持续监测状态,遇到问题实时降级,而非追求100%准确的预决策。这种“边执行边决策”的思路在端云协同场景中具有独创性。

听众收益

  • 理解端云协同在B端场景的落地逻辑
  • 掌握端云协同调度器的设计方法
  • 获取端侧模型选型与性能优化的实战经验
  • 了解端云协同的六大痛点与应对方案
  • 理解“端侧优先”原则下的架构取舍

by 樊强

蔚来
算法专家

NOMI 问答是蔚来面向车辆、品牌、服务等场景打造的座舱知识问答能力。随着用户需求不断复杂化,其产品定位也从最初“支持语音搜索的车辆说明书”,逐步演进为“懂车、懂用户、能办实事的车载专家伙伴”。
这一过程中,传统问答链路面临多方面挑战:一方面,大量长尾和复杂问题难以被有效覆盖,问答兜底率和用户满意度仍有提升空间;另一方面,车辆状态类问题需要实时联动车端信号与云端模型,单纯依赖云端知识检索难以满足实际用车场景。
本次分享将介绍 NOMI 在问答技术体系上的工程升级实践,包括 Query 理解、多源检索、RAG 优化、Agentic Search 与知识图谱等技术在复杂问答中的应用,以及端侧车辆实时信号与云端大模型协同的问答链路。经过优化,整体问答兜底率由 36% 降至约 10%,并支持上百种车辆状态信号问答。在此基础上,NOMI 也在进一步探索从“回答问题”走向“咨询—诊断—执行”的完整车载智能服务闭环。

演讲大纲

  1. 从车辆说明书到车载专家:NOMI 问答为什么需要端云协同
    • NOMI 知识问答是一套端云一体的问答系统,需要结合云端知识、模型能力与端侧车辆实时信号共同完成用户需求。在持续迭代过程中,主要面临四类问题:
      • 问答兜底率较高:大量用户提问会触发“我还不知道呢”等兜底回复,影响使用体验;
      • 用户满意度有待提升:部分问题只能返回部分相关信息,难以准确命中用户真实诉求;
      • 长尾复杂问题难以处理:传统问答链路难以覆盖车载场景下多样、复杂的用户问题;
      • 实时车辆状态问答能力不足:车辆运行过程中涉及大量实时状态信号,传统模板化问答难以充分利用端云协同能力。
  2. NOMI 问答技术体系的全链路升级
    • 问答系统整体架构升级:融合 FAQ、KBQA、RAG、Deep Research、Agentic Search 等技术方案,构建覆盖用车问答、品牌知识、服务问答及车辆状态查询等场景的问答系统,为数百万车主提供实时问答服务。
    • Query 理解、检索与生成链路优化:围绕汽车问答全流程,对 Query 理解、文本 Chunk、多源混合检索及回复生成等关键环节进行系统优化,提升基础问答能力与复杂场景覆盖率。
    • Agentic Search 与知识图谱解决复杂问答:针对汽车场景中的复杂问题进行业务路径拆解,搭建自研 Agentic Search 架构,并结合 NOMI 自研知识图谱,形成从复杂 QA 样本生成、专项模型训练到系统架构优化的完整链路,提升复杂问题处理效果。
  3. 端侧实时车辆状态如何进入云端大模型问答链路
    • 针对功能信号及非功能状态类问题,构建从端侧数据采集、云端数据存储到云端大模型理解与回复的完整链路,实现端侧车辆状态与云端模型能力的结合,目前已支持上百种车辆状态信号问答。
    • 重点分享:车辆实时状态信号如何进入问答系统;用户自然语言问题如何与车辆状态进行匹配;云端模型如何基于实时状态生成更自然、更准确的回答。
  4. 落地效果与未来规划:
    • 当前收益:整体问答兜底率从优化前的36%降到10%左右,用户体验也有大幅提升。复杂问题解决有大幅提升。实现了端云一体的车辆实时信号问答技术,为后续车辆更复杂的综合智能打造了很好的基础。
    • 未来计划:多模态问答需求感知,实现对用户需求的深层理解与精准识别。端到端问题解决,深度打通车机状态与后台服务,形成“咨询-诊断-执行”的完整闭环,提供真正有价值的解决方案。

前沿亮点:

  1. 面向超百万用户的业内领先的问答效果,面向用户的问答兜底率降到10%以下。
    • 从端侧版本控制/端侧信号上传,query理解,chunk优化,多源检索,回复生成优化等,做全链路的nomi问答技术升级。
  2. deepsearch及知识图谱在 nomi复杂问题问答下的应用与实践。
    • 设计了从业务复杂问题划分,到基于知识图谱的训练数据采样,到自研agentic-search的解决框架。

实践痛点

  1. 车机联动:问答的最终目标是落地问题解决;系统联动车机状态、车载服务与整车功能,实现从单纯答疑到闭环处置的完整链路。
  2. 多源搜索:针对用户模糊且复合化的提问意图,系统需动态路由至多类数据源,完成跨渠道信息的融合与整合后,再生成统一答复。
  3. 复杂推理问题:业务复杂问题种类多,利用强化学习过的大模型依旧存在推理严谨度不足、推理过程不稳定的缺陷。需要抽象出关键模式,设计专项解决方案。
  4. 品牌保护问题:面对用户多样的观点类提问,疏漏的回答容易造成品牌负面舆情;需健全品牌防护机制,规范应答内容,贴合品牌人设与核心价值观。

听众收益:

  1. 了解汽车行业问答技术的特点和发展趋势。
  2. 了解未来问答技术的框架和实践效果。
  3. 了解汽车行业如何联动端侧信号进行实时语音问答。
  4. 问答系统的搭建与效果优化,为开发人员提供一些优化思路。
  5. 如何满足用户实际问答需求,为产品经理提供业务思路。

by 刘宗明

蚂蚁集团
支付宝高级技术专家

随着手机、车载设备和可穿戴设备逐渐拥有自己的 Agent,应用与终端之间的关系正在发生变化。原本封装在单个 App 内的生态能力,需要跨越设备、系统和交互入口,在多个终端之间安全流转、协同执行,并保持连续一致的用户体验。
本次分享将介绍一套面向多端互联的 Agentic 端云协同架构。端侧承担即时交互、设备上下文和本地能力,云端承担复杂推理、能力组织与任务协同;AHA 连接不同终端和应用中的 Agent,xUI 负责生成式交互,MCP 与 UI Agent 连接生态能力与执行环境。通过统一的协议、运行时和能力描述,应用可以在不同终端上参与同一个任务过程。

演讲提纲:

  1. 终端 Agent 正在成为新的生态入口
    • 终端交互正在从“用户打开 App”转向“用户向 Agent 表达意图”
    • 应用能力跨越设备与交互入口后面临的新问题
    • 端云协同在多端互联中的价值与边界
  2. 多端互联下的端云协同架构
    • 端侧与云侧如何根据场景特点划分职责
    • 应用、终端与云端之间的协作关系
    • 上下文、任务与交互状态如何在端云之间连续传递
    • 用户任务如何在不同设备和能力环境之间接续
  3. 多端连接与智能体协同
    • 不同终端、应用与智能体之间如何建立统一连接
    • 多主体协作中的身份、权限和数据边界
    • 任务、消息与上下文的统一表达
    • 长链路任务中的生命周期管理与状态一致性
  4. 生成式交互的工程设计
    • 面向真实任务的生成式交互有哪些核心要求
    • 如何在生成的灵活性与交互的确定性之间取得平衡
    • 用户确认、过程反馈和异常恢复的设计原则
    • 不同终端形态下的体验一致性与差异化适配
  5. Agent 执行的工程实践
    • 不同类型的任务如何选择合适的执行方式
    • 如何连接生态能力、存量应用与终端执行环境
    • 确定性执行与智能推理如何协同
    • 泛化能力、执行效果、响应体验与工程成本之间的取舍
  6. 从多端互联到 Agentic 终端生态
    • AI Native 终端如何连接和组合应用生态能力
    • 能力如何跟随用户和任务在多个设备之间流转
    • 平台化能力如何降低多方协作与持续演进成本
    • 多端互联与伴随式 Agent 的未来形态

实践痛点:

  1. 不同终端和应用中的 Agent 缺少统一、可信的通信与会话机制。
  2. 开放式模型生成难以同时满足交互确定性、安全性要求。
  3. 不同终端在渲染能力、系统权限、进程模型和生命周期上存在差异,容易造成大量重复适配。
  4. 端侧即时执行与云端复杂推理各有边界,需要在任务运行过程中动态选择和切换执行路径。

前沿亮点:

  1. 面向多终端 Agent 建立统一的生态能力开放架构,让应用能力参与跨设备任务。
  2. 通过 AHA 与 A2A 连接终端 Agent、应用 Agent 和能力 Agent,统一任务与上下文的传递方式。
  3. 使用 xUI 声明式协议将开放式模型输出约束为终端能够安全解释的组件、状态与动作。
  4. 将 MCP、UI Agent 与确定性流程组合为分层执行体系。
  5. 通过统一能力描述和运行时适配,让生态能力进入多类终端。

听众收益:

  1. 理解多端互联场景中的端云职责划分,以及任务状态如何连续传递。
  2. 掌握多 Agent 通信、会话管理和可信调用的架构设计要点。
  3. 了解生成式 UI 进入真实任务场景时需要建立的协议约束。
  4. 获得 MCP、UI Agent 与确定性流程组合使用的工程方法。
  5. 了解生态能力进入多类终端时,协议、能力描述和运行时应如何分层。

交通指南

上海建工浦江皇冠假日酒店

Shanghai Construction Group Pujiang Crowne Plaza Hotel
地址:上海市闵行区陈行公路 3701 号
  • 微信咨询

  • 电话咨询

    联系电话:18514549229

领取往期热门演讲视频

领取往期热门演讲视频二维码
如您在购票过程中遇到问题,请扫码咨询票务小助手