AI的发展正从“Chat问答”走向“Reasoning推理”,再到“Coding生成”,而下一个必然的浪潮,是向“终端”的全面渗透。大模型的能力正在从云端走向车端、手机端、可穿戴设备、智能家居、IoT终端——从“能回答问题”进化为“能理解场景、执行任务、交付体验”。这意味着模型不仅要跑得动,还要跑得快、跑得稳——面向百万辆级别的量产交付,端侧模型压缩、混合部署、OTA迭代、数据飞轮等工程化能力成为真正的壁垒。
下一代Realtime Voice Agent框架正在重塑人机交互范式;而交互和物理世界的深度融合,则让大模型成为连接座舱感知与智驾规划的“统一认知中枢”。在汽车、手机、可穿戴设备、智能家居等终端领域加速落地。汽车座舱正在飞速被重新定义,舱驾融合横跨交互与物理世界,手机端的AI助手正在从“问答工具”进化为“个人Agent”,能理解屏幕内容、自动执行跨应用操作、管理日程与通知;智能手表上的端侧模型正在实现健康监测的实时推理与预警,无需依赖云端;智能家居中枢正在通过轻量级模型实现本地化的场景理解与跨设备联动,让“一句话控制全屋”成为现实。
AI 落地的终局,不在云端,而在用户触手可及的终端设备里——在每一次点火启动让 AI帮你抵达目的地的瞬间,在每一次抬手看表的刹那,在每一次语音唤醒的交互中。当大模型真正跑进每一台设备、服务每一个用户,我们才真正迎来AI终端的时代。
演讲提纲
- 行业趋势与AI终端现状
- AI发展的必然浪潮:从云端走向终端。
- 跨终端场景的落地现状。汽车座舱、手机端、可穿戴设备、智能家居正在加速落地。
- 技术选型与架构设计:下一代 Realtime Voice Agent 框架
- 传统级联式语音交互的瓶颈。ASR→NLU→DM→TTS 架构带来的延迟累积、语义断层、无法打断等问题,无法满足用户对实时性、自然度、可打断性的体验需求。
- Realtime Voice Agent 框架设计。端到端流式多模态架构:语音输入到意图理解到动作执行到语音输出的全链路实时化,端到端延迟控制在 200ms 以内。流式打断与动态响应:支持用户随时打断、修正指令,模型理解上下文并动态调整执行逻辑。多模态融合输入:语音加视觉加传感器信号的联合理解,提升意图识别准确率与鲁棒性。
- Agentic 能力与任务执行。任务分解与自主执行:用户输入一句自然语言,Agent 自动拆解为多步任务并执行。工具调用与 API 编排:内生调用车控接口、导航 SDK、健康监测 API、智能家居协议等,实现跨终端互联。记忆与上下文管理:短期对话记忆、长期用户偏好记忆、跨设备场景记忆的融合。
- 端云协同框架
- 端侧模型部署的现状与挑战。当前端侧模型尺寸仍然不够大,性能不够强,延迟相对较长。模型压缩与量化在不同终端芯片上的实测效果与取舍。混合部署策略:端侧轻量模型处理高频离线场景,云端大模型处理复杂推理。
- 端云协同的工程化方案。离线优先架构:核心功能端侧可完成,云侧作为能力增强。断网续连机制、隐私保护、差分隐私与联邦学习的终端适用性。
- 跨终端场景的深度融合
- 汽车座舱:舱驾深度融合。大模型成为连接座舱感知与智驾规划的“统一认知中枢”。自然语言控制智驾:用户通过语音指令表达意图,模型调用智驾规划接口。动态交互策略生成:依据智驾系统可靠度与场景复杂度,动态生成 HMI 策略。
- 手机端和 IOT 设备:从问答工具到个人 Agent。理解屏幕内容、自动执行跨应用操作、管理日程与通知。端侧模型的隐私保护与离线推理能力。
- 落地实践与踩坑经验
- 当前端侧模型的真实瓶颈。模型尺寸不够大:受限于终端芯片内存与存储,无法部署大参数模型。性能不够强:复杂推理任务仍需上云,端侧仅能处理轻量级场景。延迟比较长:端侧推理速度难以满足实时交互需求,端云切换带来额外延迟。
- 数据飞轮与持续优化。脱敏数据回流、用户行为反馈闭环、模型迭代周期从月级压缩到周级。半监督评测体系:自动评测覆盖 90% 基础场景,人工专家评测聚焦 10% 长尾边缘场景。
- 跨终端交互的挑战。同一用户在不同终端上的体验连贯性。跨设备场景记忆的同步与隐私保护的平衡。
实践痛点
- 端侧模型尺寸不够大、性能不够强、时延比较长
- 对于物理世界的感知和理解现状没有太好的方案,只能涉及皮毛
前沿亮点:
- 模型在终端领域实际量产落地的前沿探索
- 下一代的 Realtime Voice Agent 框架
- 端侧模型及端云融合方案的探索
- 在 AI+终端领域实际跑的最前的面向与 c 端用户实际大批量量产的前沿案例(100 万以上),面向百万用户级别的模型交付实践
听众收益:
- 从基础模型公司视角分享模型在汽车、终端行业落地的前沿实践
- 了解新一代的交互 Agent 框架、端云结合框架
- 了解下一个注定的 AI+终端 方向当前的探索现状