千行百业 Agent 创新实践

会议室:待定
出品人:王仿

AI应用正加速从“生成式输出”迈向“任务执行... 展开 >

专题出品人:王仿

NoDesk AICTO

王仿,NoDesk AI CTO 。专注于企业级 AI 落地,具备“基模训练—工程实战—商业闭环”全链路能力。曾就职于智谱,从 0 到 1 搭建华东区大模型与解决方案团队,服务电商、医疗、制造等多个行业;此前在搜狗、阿里负责高并发 AI 系统建设。现创业 NoDesk AI,专注于企业级 Agent Infra 与执行系统建设,帮助企业将 AI Agent 从 Demo 推向生产环境并持续创造业务价值。

专题:千行百业 Agent 创新实践

AI应用正加速从“生成式输出”迈向“任务执行”。以智能体(Agent)为代表的新一代应用形态,能够自主解析目标、拆解复杂任务、灵活调用工具,并基于执行反馈动态优化行动路径。如今,Agent已深入渗透至电商客服、智能制造、研发协同、医疗辅助、金融运营及政务服务等真实业务链条,驱动业务流程的实质性重构。

本专题聚焦Agent在不同行业的创新应用与落地探索,深度拆解从技术能力到业务价值转化的完整链路。拟探讨主流Agent技术架构与演进趋势,分享不同行业领先企业的前沿实践成果,解析多智能体协同、工具调用、记忆与推理等关键技术突破,剖析场景落地中的工程化挑战与解决方案,探索Agent从单点试验到规模化复制的可行路径,加速智能体赋能产业升级。

专题受众

  • Agent架构师与算法研究员:聚焦Agent架构设计、多智能体协同机制及工具调用优化,推动技术方案在真实业务场景中高效落地。
  • 行业解决方案架构师与技术负责人:聚焦跨行业场景适配与系统集成,打通Agent与现有业务系统的技术壁垒,实现端到端交付。
  • 企业决策者与产品管理者:依托行业落地案例评估技术投入产出比,把握Agent赋能业务的关键机会窗口,制定智能化升级战略。

by 吕德涛

飞猪
算法专家

旅行场景天然存在价格库存实时波动、成交不可逆、产品迭代快等挑战,对 Agent 的准确性要求极高。

飞猪的实践表明,制约旅行 Agent 能力上限的,并非模型代际的强弱,而是框架与边界的设计。模型幻觉(如捏造房型 ID、沿用失效价格)不会随模型升级自然消失——根本原因在于错误代价的不对等:模型输出成本低,但错误撤回成本极高。

为此,飞猪以"错了能不能撤回"为核心原则,划定模型与工程的边界:

  • 决策归模型
  • 执行归工程
  • 表达归产品

本次分享将围绕循环、边界、上下文、评测四个维度,展开飞猪旅行 Agent 落地过程中的思考与实践。

演讲提纲

1. 场景与判据:不可逆性决定边界在哪里

  • 旅行场景的难点
  • 模型与代码的边界原则

2. Loop:确定性由代码保证,不由模型自述

  • 终止判据与中断阈值
  • 循环控制与状态治理

3. 职责边界:三件事分别交给谁

  • 能算清楚的交给求解器
  • 不可逆的动作交给用户
  • 呈现方式交给产品

4. Context:模型可见事实,不可见标识

  • 模型只接收可读事实
  • 标识只在代码侧流转
  • 出屏前整批校验

5. 评测:先定位根因,再决定怎么修

  • 三层评测结构
  • 失败样本分类与修复路径

实践痛点

  • 自主性 vs 确定性:要接住口语化的改单就得给模型空间,要让成交可预测就得收紧;旅行的成交动作不可逆,容错窗口比问答类场景窄
  • 边界的精确位置没有现成答案:太靠代码,可枚举的分支越铺越多、对话变僵;太靠模型,一次措辞漂移就可能变成资损。熔断阈值同样缺理论依据,只能经验取值,靠单一事实源保证各处一致
  • 表达外置的代价:正文的呈现规范交给模型执行后,一致性不再由代码兜底,只能靠评测发现、prompt 迭代收敛;产品每改一版,模型侧就要重新对齐一次
  • Judge 模型自身的校准:分数收进代码只解决了漂移,一旦错在事实层,映射只会把错误精确地传下去;而标注集随业务口径变动就得重做,这部分难以自动化

演讲亮点

  • 区别于把边界画在“模型能不能做”上,我们按“错了能不能撤回”划:模型只提议方案,票种组合由求解器算定,创单与支付不注册为工具,酒店房型标识不进模型、卡片由代码用当轮检索结果现拼
  • 区别于业界只在模型与代码之间划边界,我们把产品态表达也单列一层:卡片字段与正文的排版口吻由产品定义、运行时注入,卡片由代码渲染,模型只按规范组织正文
  • 区别于把打分直接交给 Judge 模型,我们让它只输出事实、分数由代码按规则计算:三层评测分层下钻先定位到出错的那一步,同一批样本可复算

听众收益

  • 获得一条可复用的边界判据 按“错了能不能撤回”决定每一步交给谁——查询、筛选、改单提议放开给模型,票种组合交给求解器,创单支付交给用户;决策归模型、执行归代码、表达归产品
  • 掌握与框架无关的 Loop 与 Context 做法 终止判据只看行为不问模型、阈值收敛为单一事实源、真实标识不进上下文、跨轮改单用显式作废信号
  • 带走一套可复算、能回流的评测方法 三层分层下钻控制 Judge 模型调用量,Judge 模型只出事实、分数由代码算,失败样本按根因归类,回流 prompt 迭代与模型定向优化

by 程鹏宇 博士

阿里巴巴-千问事业部
强化学习方向负责人

Agent Skill 是一种将智能体能力与交互经验结构化、模块化封装的知识单元,为大模型持续学习和产品能力迭代提供了可复用、可组合、可验证的载体。本次分享将介绍阿里巴巴千问事业部在 Skill 驱动大模型自进化方向的近期探索,包括:从智能体交互轨迹中自动提炼 Skill;将 Skill 引入奖励评估,构建可执行、可审计的奖励系统;以及通过 Skill 驱动的 Agent 自我博弈,在减少人工标注依赖的同时持续拓展模型能力边界。在此基础上,报告将进一步探讨 Agent Skill 在 C 端对话产品中的应用,介绍如何将真实用户交互转化为可沉淀、可评估、可迭代的产品能力,形成模型持续进化的迭代闭环。

演讲提纲:

  1. 大模型自进化:从外部数据驱动到环境交互驱动
    • 大模型训练正在从一次性的数据学习走向持续的环境交互与自我改进
    • 自进化的基本闭环:任务生成、任务求解、结果评估与模型更新
    • 自生成任务是否有效、自评估奖励是否可靠,是闭环成立的关键
    • Agent Skill 为能力与经验的持续积累提供模块化载体
  2. Agent Skill:大模型能力与交互经验的结构化载体
    • Agent Skill 的基本定义与组织形式
    • 将成功经验、失败教训、操作流程和验证工具封装为可执行知识单元
    • Skill 的可复用、可组合、可验证和可迭代特性
    • Skill 如何缓解原始交互轨迹冗长、经验难复用和上下文成本高等问题
  3. 从交互轨迹中自动提炼 Skill:Trace2Skill
    • 从智能体成功与失败轨迹中发现可迁移的过程性知识
    • 通过并行轨迹分析与递归归并完成经验提炼、去重和冲突消解
    • 在减少人工编写与教师模型依赖的条件下自动构建 Skill
    • Skill 在不同模型、任务和领域之间的迁移与泛化能力
  4. 以 Skill 构建可执行的奖励系统:Skill-RM
    • 大模型奖励评估面临准则、参考答案、外部工具和验证器等异构证据
    • 将评估流程、判断准则与验证资源统一封装为 Reward-Evaluation Skill
    • 根据具体样本动态调用证据,生成结构化、可解释、可审计的评估结果
    • 为强化学习和模型持续进化提供更加可靠的信息密集型奖励信号
  5. 以 Skill 驱动 Agent 自我博弈:Skill Self-Play
    • 通过 Proposer 与 Solver 的协同进化自动生成训练任务与反馈信号
    • 结合 Skill 引导生成与开放探索,兼顾任务质量和能力覆盖面
    • 自动寻找模型能力边界,筛选具有学习价值的前沿任务
    • 在自我博弈过程中持续创建、更新和淘汰 Skill,推动模型能力演进
  6. Agent Skill 在 C 端对话产品中的应用
    • 真实用户交互 → 高价值轨迹筛选 → Skill 提炼与更新 → 自动评估 → 数据与奖励生成 → 模型训练 → 产品验证
    • 以 Agent Skill 连接产品交互、经验沉淀、奖励评估与模型训练
    • 让真实用户需求持续转化为可学习、可验证的模型能力
    • 通过产品效果反馈检验进化结果,并驱动下一轮迭代
    • 从人工维护的能力迭代逐步走向模型自主提炼、自主评估与自主进化

实践痛点:

  • 真实用户交互规模大、噪声高,如何筛选高价值轨迹,并从中提炼出不过拟合、不冲突且可复用的 Skill,是实践中的首要难点。随着 Skill 库规模增长,路由效率、推理成本、隐私合规以及训练后的能力退化也需要系统治理。

前沿亮点:

  • 这一方向的核心亮点,是以 Agent Skill 作为原始交互轨迹与模型参数之间可编辑、可验证的能力中间层。通过 Trace2Skill 提炼经验、Skill-RM 生成过程级奖励、Skill Self-Play 主动探索能力边界,可以将经验沉淀、奖励评估和训练数据生成连接成统一的模型自进化闭环。

听众收益:

  • 听众将建立 Agent Skill 驱动大模型自进化的完整认知,了解从轨迹提炼、奖励评估到自我博弈的关键技术方法。报告还将提供 C 端对话产品的落地思路,帮助听众理解如何将真实用户需求和 Bad Case 转化为可沉淀、可评估、可训练的模型能力,并提前识别其中的工程与治理风险。

by 冯旻伟

网易智企
云商 AI 技术负责人

传统客服机器人依赖规则与固定流程,难以处理复杂意图、跨系统操作和服务营销协同;直接接入大模型,又面临幻觉、成本、稳定性与知识退化问题。基于多个真实项目,我们总结客服营销 Agent 从 Demo 走向生产必须跨越的“敢上线、敢交办、敢放量、敢长用”四道关,并拆解意图路由与多 Agent、知识萃取与混合检索、Workflow/Skill 执行、大小模型调度、AOP 风控、人机协同及 Benchmark+TraceID 评测闭环。实践中,代表项目实现意图匹配率 99%+、问题解决率 80%+、满意度提升 20%+;另一项目解决率由 65%+ 提升至 94%+,每周减少超 1000 通人工会话。

演讲大纲

  1. 背景:客服 Agent 为什么最容易落地,也最容易“翻车”
    • 客服系统从规则机器人、大模型问答、Workflow 走向业务 Agent 的演进路径。
    • 客服营销场景的三重压力:海量实时响应、个性化服务升级、服务与转化链路融合。
    • Demo 与生产的差距:回答得像人,不等于能够稳定、安全地承担业务结果。
    • 高价值场景的选择方法:综合评估业务频次、规则成熟度、系统可连接性、风险等级和结果可量化程度。
    • 为什么应从高频、边界清晰、可度量的场景起步,再逐步进入复杂决策与主动营销。
  2. 产品方案:从“回答问题”到“完成业务”的服务营销一体化 Agent
    • 构建“路由中枢+专家 Agent”体系:售前导购 Agent、订单服务 Agent、售后处理 Agent、会员服务 Agent与人工兜底。
    • 售前场景:结合商品知识、库存、渠道和用户偏好完成选品推荐、商品对比、门店导航与多语种服务。
    • 售中售后场景:通过 Skill 连接商品、订单、会员、物流和工单系统,执行查询、修改、催办、退款与售后流程。
    • 会员服务场景:结合会员等级、历史行为、情绪和上下文,提供个性化关怀与权益服务。
    • 交互形态升级:从纯文本回复转向商品卡片、订单卡片、导航卡片等可交互结果,缩短从咨询到行动的路径。
  3. 技术方案:让企业“敢上线、敢交办、敢放量、敢长用”的四道生产关
    • 敢上线:建立生产级安全与稳定底座
      • 租户、部门、角色、用户与知识范围的多层权限隔离。
      • 输入、输出及工具调用的横切风控:敏感信息、Prompt 注入、违规承诺、服务边界和高风险操作拦截。
      • 多模型冗余、限流熔断、故障隔离与灰度发布,避免单一模型或单个 Agent 故障扩大。
      • 每次对话生成唯一 TraceID,串联意图、模型、知识、工具和答案生成链路,实现审计与问题回放。
    • 敢交办:让 Agent 真正理解业务并完成任务
      • 从历史会话、工单和业务文档中萃取结构化知识,解决一线经验难沉淀的问题。
      • 通过 Query 改写、关键词检索、向量检索、元数据过滤和 Rerank 构建混合召回链路。
      • 使用实体关系处理商品昵称、型号、机芯、业务规则等多层映射,提升行业术语理解能力。
      • Workflow 优先承载确定性流程,ReAct 仅用于边界较模糊、需要跨知识源探索的任务。
      • 通过 Skill 调用真实业务系统,使 Agent 可以查库存、查订单、改地址、建工单和执行售后动作。
    • 敢放量:在效果、成本与风险之间取得平衡
      • 以规则、小模型和大模型分层处理不同复杂度问题,避免所有流量都进入高成本大模型。
      • 采用规则匹配、语义向量和 LLM 判断组合的混合路由,低置信度时主动澄清而不是强行分流。
      • 将安全合规风控与业务质量风控分层:前者守红线,后者处理情绪、话术、价格、库存与服务规则。
      • 按风险等级设计 AI 自主处理、AI 建议人工确认、纯人工决策三类人机协同模式。
      • 通过业务指标而非模型指标验收:问题解决率、转人工率、满意度、响应时效、人效与业务转化。
    • 敢长用:建立可持续评测与运营闭环
      • 从线上会话持续提取答错、卡住、跳出等 Bad Case,区分路由、知识、工具、Prompt 和模型问题。
      • 建立黄金测试集与场景化 Benchmark,每次知识、Prompt、模型或流程变更后自动回归。
      • 新版本先对小比例用户灰度发布,验证效果优于旧版本后再逐步放量。
      • 通过 TraceID 回放完整决策链,定位“召回错、切片错、工具错、生成错”的具体环节。
      • 将人工修正、未知问题和评测结果反哺知识库与测试集,形成数据飞轮。
  4. 案例拆解:三类业务如何跨过四道生产关
    • 孩子王:多 Agent 与业务系统联动,处理近 600 个细分场景
      • 打通商品库、订单中心和会员中心,将退换货、价保、赠品和会员规则转化为可执行流程。
      • 通过多 Agent 分流、工作流决策树和角色/技能/边界三层约束,同时解决准确性与情绪价值问题。
      • 上线半年内意图匹配率达到 99%+、问题解决率达到 80%+、满意度提升 20%+,Agent 承载超过 70% 的高频咨询。
    • 酷家乐:大小模型与人机协同,解决复杂售后问题
      • 将问题分为单轮、多轮和复杂流程三类,通过场景洞察确定优先级。
      • 小模型负责高频、确定性问题,大模型负责复杂语义和多轮判断,人工处理低置信度与高风险请求。
      • 问题解决率由 65%+ 提升至 94%+,转人工率下降近 3 个百分点,每周减少超过 1000 通人工会话。
    • 王府井集团:从客服应答走向多语种推荐与线下导航
      • Agent 同时承担商品推荐、门店导航、离境退税咨询和多语种服务,将服务入口转化为导购入口。
      • 根据用户入口识别所在门店,调用商品和门店数据,返回商品卡片与精确到楼层的导航信息。
      • 超过 90% 的问题实现自动化解决,转人工率仅 5.97%,并补足非工作时段 23% 的咨询缺口。
  5. 实施经验:Agent 落地不是模型项目,而是持续运营的业务工程
    • 先定义业务目标和效果基线,再选择模型与架构,避免从技术能力倒推伪需求。
    • 采用“内部 Copilot 验证—小流量 Agent 试点—分场景逐步放量”的渐进式上线策略。
    • 组织上需要业务、客服运营、知识运营、算法和工程共同负责,不能把效果问题只交给模型团队。
    • Agent 的最终价值不是生成了多少内容,而是独立完成了多少业务、降低了多少人工负担、减少了多少风险并创造了多少增量价值。
    • 未来方向:从单个客服 Agent 走向覆盖售前、售中、售后与会员运营的智能服务团队。

技术实践痛点

  • 核心矛盾:客服营销 Agent 需要足够的自主性来理解口语化需求、处理流程跳转和调用多个业务系统,但企业生产环境又要求路径可预测、结果可审计、成本可控制、风险可兜底。自主性越强,灵活性越高,但确定性、稳定性和审计难度也随之上升。
  • 具体痛点:
    • 多 Agent 路由容易转错或卡住:同一句话可能同时包含商品咨询、物流查询和退款诉求,纯靠大模型分类不稳定;用户中途跳出工作流后,原任务也容易丢失。
    • 知识召回正确不等于答案正确:问题可能出在文档解析、切片、召回、重排或最终生成任一环节;大模型还可能对正确参数进行“创造性改写”。
    • Workflow 与 ReAct 难以一刀切:Workflow 可控、可审计,但面对长尾问题适应性不足;ReAct 灵活,却存在路径不确定、Token 成本高和重复调用工具的风险。
    • 自动化率与业务风险相互制约:风控阈值过严会导致大量转人工,阈值过松又可能造成错误承诺、情绪升级或业务资损。
    • 上线效果会随业务变化退化:商品、政策、流程和模型版本持续变化,仅靠上线前测试无法保证长期质量。

当前应对方式

  • 使用“规则+向量语义+LLM”混合路由,低置信度时追问澄清或转人工;通过状态机挂起与记忆栈恢复被打断的工作流。
  • 确定性业务坚持 Workflow 优先,ReAct 被限制在明确的工具白名单、预算、最大步骤数与安全围栏内。
  • 对产品参数、政策规则和高风险内容要求知识来源可追溯;生成前后增加一致性检查与 AOP 拦截。
  • 使用大小模型分层处理,在延迟、成本和回答质量之间动态取舍;高风险决策始终保留人工确认。
  • 建立黄金测试集、自动 Benchmark、小流量灰度、TraceID 回放和 Bad Case 数据飞轮,但长尾场景覆盖率与自动评测可信度仍需要持续提升。

听众收益

  • 获得一套高价值场景选择与 ROI 验证方法:能够根据业务频次、规则成熟度、风险等级、系统可连接性和指标可量化程度,判断哪些 Agent 场景值得优先投入。
  • 掌握一套生产级客服营销 Agent 架构:理解如何组合多 Agent 路由、知识系统、Workflow/Skill、大小模型调度、AOP 风控与人机协同,使 Agent 从“能聊”升级为“能办事”。
  • 带走一套上线后的持续运营闭环:学习如何通过黄金测试集、场景化 Benchmark、灰度发布、TraceID 与 Bad Case 复盘,持续发现并修复路由、知识、工具和模型问题。
  • 获取多个企业级Agent的落地实践案例:覆盖母婴、商综商超、B2B等各个行业,拆解孩子王、王府井集团、酷家乐等企业的Agent落地挑战、应用场景和业务收益。

by 亓隆基

货拉拉
技术总监

随着大模型能力从内容生成走向任务执行,AI Agent 正开始进入企业核心业务系统。但相比知识问答和办公协同,实时交易系统对 Agent 提出了更高要求:它既要理解用户目标,也要面对实时状态、复杂约束、多目标决策和高可靠执行等工程挑战。
本次分享将结合货拉拉在 AI 下单、智能调度、司机找单和 AI 运营 Agent 等场景中的实践,介绍 Agent 如何逐步进入实时交易系统的“理解、决策、执行、反馈”链路,并重点分享 Agent 与推荐、预测、运筹优化、规则及交易系统的协同方式,以及在 Context Engineering、Tool Calling、决策边界、评测体系和生产可靠性等方面的实践经验。通过这些案例,我们也将总结 Agent 从单点能力走向业务闭环、从 Copilot 走向更高程度自主执行的演进路径。

演讲提纲:

  1. 背景:Agent 为什么开始进入实时交易系统
    • 从“生成内容”走向“理解目标、参与决策、执行任务”
    • 实时交易系统对 Agent 带来的新挑战:强实时、复杂约束、高可靠、结果可执行
    • 货拉拉 Agent 实践的整体演进:理解 → 决策 → 执行 → 反馈
  2. AI 下单:从自然语言理解到真实交易执行
    • 将用户自然语言需求转换为结构化订单
    • 多轮信息补全、任务状态管理与 Tool Calling
    • Agent 与地图、计价、车型、规则、订单等现有系统的集成
    • 如何控制大模型幻觉,保证交易链路的确定性与可靠性
  3. AI 调度:Agent 如何参与复杂实时决策
    • 实时供需场景下多目标、多约束决策的特点
    • Agent 与预测、推荐、运筹优化、规则系统的能力分工
    • 构建 LLM Reasoning + ML Prediction + OR Optimization + Business Rules 的组合式决策架构
    • 如何通过执行反馈持续优化 Agent 的决策效果
  4. 司机 Agent:从推荐订单到代表司机寻找交易机会
    • 从“平台推荐什么”转向“司机把目标委托给 Agent”
    • 综合位置、方向、时间、收入目标、司机偏好和实时订单进行任务规划
    • Agent 与推荐、地图、交易系统结合,持续帮助司机寻找合适订单
    • 从 Recommendation 到 Delegation 的产品与技术范式变化
  5. AI 运营 Agent:从辅助分析到业务自主闭环
    • Agent 自动完成业务观察、异常诊断、策略规划、工具执行和效果评估
    • 打通数据、运营 SOP、实验、配置和触达等业务工具
    • 构建 Observe → Diagnose → Plan → Act → Evaluate 的持续反馈闭环
    • 从运营 Copilot 向 Autonomous Business Agent 演进
  6. 从 Demo 到生产:Agent 落地实时交易系统的关键工程挑战
    • Context Engineering:如何构建实时、可信的业务上下文
    • Tool Engineering:如何将传统业务能力封装为 Agent 可调用工具
    •  Decision Boundary:如何划分 Agent、规则系统与人工决策边界
    • Evaluation:从模型正确率转向任务完成率和业务指标
    • Reliability:降级、重试、幂等、审计与人工接管机制
  7. 总结:Agent 进入业务系统的四级演进
    • AI Interface:AI 下单
    • Personal Agent:司机找单
    • Decision Agent:AI 调度
    • Autonomous Business Agent:AI 运营
    • 从单点 Agent 能力走向实时交易系统端到端智能化

实践痛点:

  1. 概率性与确定性的冲突
    • Agent 擅长处理模糊问题,但交易、计价、派单等系统要求结果稳定、可审计。
    • 需要在 Agent 自主性和规则约束之间做平衡。
  2. 效果、实时性与成本的取舍
    • 更复杂的推理、更大的 Context、更多 Tool Calling 往往意味着更高延迟和成本。
    • 实时调度场景不能一味追求模型能力。
  3. Agent 与传统算法的边界难划分
    • 推荐、预测、运筹优化等传统算法仍然更适合大规模数值计算。
    • Agent 更适合目标理解、复杂推理和工具编排,两者需要合理分工。
  4. Tool Calling 带来真实业务风险
    • Agent 从“回答错误”变成“执行错误”后,风险显著放大。
    • 需要完善权限、校验、幂等、回滚、降级和人工兜底机制。
  5. 评测和线上治理更复杂
    • 不能只看模型准确率,还需要关注任务完成率、业务指标、人工接管率、延迟和成本。
    • 从 Demo 到生产,还需要解决可观测性、状态管理、异常恢复等工程问题。

听众收益:

  1. 了解 Agent 进入核心业务系统的完整路径
    • 从 AI 下单、司机找单,到智能调度和运营 Agent,理解 Agent 如何从单点能力逐步进入业务主链路。
  2. 掌握 Agent 与传统算法系统的融合方式
    • 理解 LLM、推荐、预测、运筹优化和规则系统之间如何分工协作,而不是简单用 Agent 替代已有系统。
  3. 获得可复用的 Agent 生产化架构经验
    • 包括 Context Engineering、Tool Calling、状态管理、决策边界、Guardrail、降级和人工接管等关键设计。
  4. 理解 Agent 落地中的核心 Tradeoff
    • 如何在效果、实时性、成本、自主性和业务风险之间做取舍,避免 Agent 只停留在 Demo 阶段。
  5. 获得从单点应用走向规模化复制的方法论
    • 通过实时交易场景的实践,总结从 AI Interface、Personal Agent、Decision Agent 到 Autonomous Business Agent 的演进路径,为其他行业 Agent 落地提供参考。

by 袁俊杰

阶跃星辰
AI 终端解决方案架构师

AI的发展正从“Chat问答”走向“Reasoning推理”,再到“Coding生成”,而下一个必然的浪潮,是向“终端”的全面渗透。大模型的能力正在从云端走向车端、手机端、可穿戴设备、智能家居、IoT终端——从“能回答问题”进化为“能理解场景、执行任务、交付体验”。这意味着模型不仅要跑得动,还要跑得快、跑得稳——面向百万辆级别的量产交付,端侧模型压缩、混合部署、OTA迭代、数据飞轮等工程化能力成为真正的壁垒。

下一代Realtime Voice Agent框架正在重塑人机交互范式;而交互和物理世界的深度融合,则让大模型成为连接座舱感知与智驾规划的“统一认知中枢”。在汽车、手机、可穿戴设备、智能家居等终端领域加速落地。汽车座舱正在飞速被重新定义,舱驾融合横跨交互与物理世界,手机端的AI助手正在从“问答工具”进化为“个人Agent”,能理解屏幕内容、自动执行跨应用操作、管理日程与通知;智能手表上的端侧模型正在实现健康监测的实时推理与预警,无需依赖云端;智能家居中枢正在通过轻量级模型实现本地化的场景理解与跨设备联动,让“一句话控制全屋”成为现实。


AI 落地的终局,不在云端,而在用户触手可及的终端设备里——在每一次点火启动让 AI帮你抵达目的地的瞬间,在每一次抬手看表的刹那,在每一次语音唤醒的交互中。当大模型真正跑进每一台设备、服务每一个用户,我们才真正迎来AI终端的时代。

演讲提纲

  1. 行业趋势与AI终端现状
    • AI发展的必然浪潮:从云端走向终端。
    • 跨终端场景的落地现状。汽车座舱、手机端、可穿戴设备、智能家居正在加速落地。
  2. 技术选型与架构设计:下一代 Realtime Voice Agent 框架
    • 传统级联式语音交互的瓶颈。ASR→NLU→DM→TTS 架构带来的延迟累积、语义断层、无法打断等问题,无法满足用户对实时性、自然度、可打断性的体验需求。
    • Realtime Voice Agent 框架设计。端到端流式多模态架构:语音输入到意图理解到动作执行到语音输出的全链路实时化,端到端延迟控制在 200ms 以内。流式打断与动态响应:支持用户随时打断、修正指令,模型理解上下文并动态调整执行逻辑。多模态融合输入:语音加视觉加传感器信号的联合理解,提升意图识别准确率与鲁棒性。
    • Agentic 能力与任务执行。任务分解与自主执行:用户输入一句自然语言,Agent 自动拆解为多步任务并执行。工具调用与 API 编排:内生调用车控接口、导航 SDK、健康监测 API、智能家居协议等,实现跨终端互联。记忆与上下文管理:短期对话记忆、长期用户偏好记忆、跨设备场景记忆的融合。
  3. 端云协同框架
    • 端侧模型部署的现状与挑战。当前端侧模型尺寸仍然不够大,性能不够强,延迟相对较长。模型压缩与量化在不同终端芯片上的实测效果与取舍。混合部署策略:端侧轻量模型处理高频离线场景,云端大模型处理复杂推理。
    • 端云协同的工程化方案。离线优先架构:核心功能端侧可完成,云侧作为能力增强。断网续连机制、隐私保护、差分隐私与联邦学习的终端适用性。
  4. 跨终端场景的深度融合
    • 汽车座舱:舱驾深度融合。大模型成为连接座舱感知与智驾规划的“统一认知中枢”。自然语言控制智驾:用户通过语音指令表达意图,模型调用智驾规划接口。动态交互策略生成:依据智驾系统可靠度与场景复杂度,动态生成 HMI 策略。
    • 手机端和 IOT 设备:从问答工具到个人 Agent。理解屏幕内容、自动执行跨应用操作、管理日程与通知。端侧模型的隐私保护与离线推理能力。
  5. 落地实践与踩坑经验
    • 当前端侧模型的真实瓶颈。模型尺寸不够大:受限于终端芯片内存与存储,无法部署大参数模型。性能不够强:复杂推理任务仍需上云,端侧仅能处理轻量级场景。延迟比较长:端侧推理速度难以满足实时交互需求,端云切换带来额外延迟。
    • 数据飞轮与持续优化。脱敏数据回流、用户行为反馈闭环、模型迭代周期从月级压缩到周级。半监督评测体系:自动评测覆盖 90% 基础场景,人工专家评测聚焦 10% 长尾边缘场景。
    • 跨终端交互的挑战。同一用户在不同终端上的体验连贯性。跨设备场景记忆的同步与隐私保护的平衡。

实践痛点

  1. 端侧模型尺寸不够大、性能不够强、时延比较长
  2. 对于物理世界的感知和理解现状没有太好的方案,只能涉及皮毛

前沿亮点:

  1. 模型在终端领域实际量产落地的前沿探索
  2. 下一代的 Realtime Voice Agent 框架
  3. 端侧模型及端云融合方案的探索
  4. 在 AI+终端领域实际跑的最前的面向与 c 端用户实际大批量量产的前沿案例(100 万以上),面向百万用户级别的模型交付实践

听众收益:

  1. 从基础模型公司视角分享模型在汽车、终端行业落地的前沿实践
  2. 了解新一代的交互 Agent 框架、端云结合框架
  3. 了解下一个注定的 AI+终端 方向当前的探索现状

by 李琳琳

小影科技
业务 VP/智慧视频创作服务负责人

视频模型发展迅猛,但在硬件这类高度标准化体验的领域,试错成本极高,用户画像以素人为主——仅在“拍摄”维度做智能已很难打动今天的市场,“创作”环节的智能化才是新战场。Agent 时代,手机、车载、穿戴等硬件厂商纷纷向智能创作发力,但普遍卡在两个问题上:生成式技术如何规模化落地服务海量素人用户?规模化之后,高昂的推理成本如何转化为可持续的商业模式?

小影科技与荣耀、传音等头部硬件厂商合作,目前荣耀全系机型相册中的创作功能均由小影提供技术支撑,服务约 7000万日活用户。在此基础上,我们正与厂商共建创作 Agent,核心是两层能力:一是端云结合架构——将素材解析、高光识别等放在端侧,将用户意图识别、创作策略、认读调度等放在云侧,大幅降低创作成本;二是全球化运营能力,针对海外用户的内容偏好和素材库做本地化适配。

以上,我们得出的结论是:硬件+Agent 创作是下一个必争窗口,但真正的壁垒不在模型本身,而在端云成本结构与本地化运营能力的组合。

演讲提纲

  1. 终端 AI 影像创作的供需困境
    • 影像终端硬件能力持续升级:各家拍摄体验差距不断缩小,单纯依靠拍摄能力,很难形成产品差异化优势。
    • 用户素材量持续增长,但创作门槛仍然存在:用户日常拍摄积累了海量照片、视频素材,但普遍存在剪辑门槛高、无创作思路、操作耗时的问题,大量优质素材长期闲置在相册。
    • 用户需求从“拍得好”转向“表达得好”:用户不再只满足清晰拍摄,更希望低成本、高效率把日常素材转化为有故事、有氛围、可分享的视频内容,完成个人内容表达。
    • Agent 成为终端创作的新型产品形态:传统剪辑依赖用户手动操作、学习功能,而 AI 视频创作 Agent 可以基于用户意图自主完成素材理解、任务拆解与流程编排,适配大众轻量化创作需求。
  2. 端云协同的 Agent 架构设计
    • 端云协同架构选型考量:全云端方案在统一算力和开发效率上更简单,但在用户隐私、数据传输、实时体验、离线能力和规模化成本方面存在约束,因此需要基于任务属性做端云推理与计算拆分。
    • 端云协同 Agent:采用端侧执行引擎、云端智能中枢、终端应用与反馈三层架构设计。端侧负责素材理解与解析、画面高光识别、基础素材预处理、视频剪辑与最终渲染;云端 Agent 负责用户意图理解、故事线规划、创作策略制定、Skill 调度与全局创作决策。
    • 从固定模板到原子化创作能力:将百万级视频模板进一步拆解为音乐、转场、滤镜、贴纸等原子化素材能力,由 Agent 根据用户意图、素材特征和故事结构动态组合调用。
  3. 端到端 Agent 创作 Workflow 与多场景适配
    • 创作场景存在天然差异化特征:旅行、日常记录、演唱会、亲子等场景的素材来源、内容逻辑、叙事节奏和用户预期存在明显差异,统一创作流程容易导致成片同质化、贴合度低。因此,需要针对各类高频场景设计专属 Agent Skill 能力。
    • 以亲子场景为例拆解完整创作 Workflow:用户提出创作需求、Agent 识别场景、梳理素材线索、规划故事线、动态调度原子能力,最终完成剪辑渲染与成片输出。
    • 依托全球用户真实创作行为与内容经验,持续沉淀场景 Skill 和专属创作策略,让 Agent 不只是 “听懂用户指令”,也能理解不同市场、不同场景用户的内容表达习惯。
  4. 从 Demo 验证到规模化落地
    • 异构终端环境适配:针对不同机型的算力、存储、系统和网络环境,动态调整端云任务分配,使同一套 Agent 能力适配不同终端。
    • 海量用户高并发保障:面向大规模用户并发与持续使用,需要在保证创作体验的同时控制推理、带宽和计算成本。
    • 用户创作反馈闭环:持续结合用户成片效果、手动调整行为、场景使用数据等反馈,迭代素材筛选、Skill 组合和创作策略,使 Agent 的创作结果持续贴近用户预期。
    • 全球化交付与本地化适配:针对不同区域的内容审美、热点场景、版权规范与隐私合规要求,迭代本地化素材体系和创作策略,支持 AI 视频创作能力在不同终端和市场规模化落地。

实践痛点:

行业里容易有一种错觉:模型能力越强,落地就越容易——尤其是近两年智能硬件融资和模型发展都很快,很容易让人觉得“智能硬件已经很先进了”。但从我们和荣耀这类头部手机厂商的实际合作来看,情况恰恰相反:用户画像的年龄跨度大、二三线城市占比高,大部分是素人而非内容创作者。这意味着,即使我们把足够先进的生成式模型部署到相册这样的高频场景里,真正的难点也不是“模型能不能生成”,而是如何让一个完全不懂 Prompt、不理解创作逻辑的普通用户,只需要最小操作,就能得到一个“满意”的作品——这里的“满意”本身也是一个高度主观、因人而异的标准,很难用单一的评估指标去衡量。

换句话说,当下能把 Agent 用得游刃有余的,基本还是有一定专业背景或学习成本容忍度的用户。前沿技术真正走向大众,尤其是走向像荣耀这样覆盖极广年龄层和城市层级的用户群体,可能还有很长的路要走——而且这条路的难点甚至不在最后一公里的体验打磨,而在于更前面,如何重新定义“好的创作”这件事本身,让它适配一个没有创作经验的普通人。这也是我们认为这个 case 有意思的地方:它是一次前沿生成式技术在真正意义上的“大众化”实践。

前沿亮点:

  1. 端云结合的三层 Agent 架构:区别于市面上“全云端调用大模型”或“端侧轻量模型”的单一路线,分享云端做智能决策与规划、端侧做高光识别/素材理解/剪辑渲染的分工设计,以及这种分工如何同时解决算力分化、成本不可控、隐私合规三个互相冲突的约束。
  2. “拍得好≠表达得好”的供需拆解视角:跳出“影像能力=拍摄能力”的行业惯性认知,提出硬件厂商的下一个增长点在“内容体验”而非参数竞赛,并给出对应的产品化路径,而非停留在趋势判断层面。
  3. 规模化落地的三重验证框架:技术可实现性、用户需求普适性、商业可持续性——一套可复用的判断方法,而非单一案例的经验分享。
  4. 海外本地化的完整闭环拆解:把“本地化”从“翻译”这个常见误解,还原成人群洞察、素材生产、热点运营、合规交付四个环节,分享跨越多个海外市场沉淀出的具体打法。

听众收益:

  1. 理解智能影像终端从“拍摄竞争”转向“创作/表达竞争”的行业拐点,以及背后的产品逻辑;
  2. 获得一套可迁移的端云 Agent 架构设计思路,尤其适合终端算力有限、又需要复杂 AI 能力落地的场景;
  3. 掌握判断一个生成式 AI 功能“是否值得规模化投入”的三个关键问题,避免技术可行但商业不可持续的陷阱;
  4. 了解出海产品本地化不止是语言翻译,还包括素材、运营、合规在内的完整体系,可直接参考应用于自身出海项目。

by 王上淇

江苏移动
AI 方向 CTO

企业里不缺系统,缺的是把系统串起来的人。一位政企客户经理要准备一次客户走访,得在客户关系管理、商机、工单、经营分析、方案库、报价等六七个生产系统之间来回切换,手工查数、复制、拼装,一次准备将近一小时,而这只是他一天中很小的一块工作。AI 落地的真正难点不在模型能力,而在存量生产系统缺少一种“可被对话调用”的能力形态。

江苏移动把 AI 工作台做成企业系统的统一对话入口:为存量系统逐一建立能力适配层,把“查客户、查在用产品、查近期故障、建商机、出方案、回填走访记录”等系统能力注册为可被对话调用的能力单元;由工作台完成意图理解、任务编排、多系统调用与结果回写,员工用一句话即可驱动多个系统完成一件完整的工作。本次演讲以政企客户走访这一真实场景为主线,拆解能力接入规范、任务编排引擎、执行回写机制、身份代理与观测运营的完整技术方案,并给出可复制的企业内部改造路径与量化成效。

演讲提纲

  1. 场景与痛点:一位客户经理的“六系统之旅”
    • 真实场景:准备一次客户走访,要在 6—7 个生产系统之间切换,手工整合近一小时;走访结束后还要把记录再逐个系统回填。
    • 三层割裂:入口割裂(每个系统一个账号一个入口)、数据割裂(客户、产品、故障、经营数据分散在不同系统)、能力割裂(同样一件事,在不同系统重复做多遍)。
    • 核心判断:AI 落地的瓶颈不是模型能力,而是存量系统只有“人用的界面”,没有“可被调用的能力”。
  2. 总体思路:把生产系统变成“可对话的能力”
    • 四层架构:对话入口层 → 理解与编排层 → 能力接入层 → 存量系统层。
    • 关键转变:走“能力接入”而不是“应用重构”,存量系统业务逻辑不动,外围加能力适配层。
    • 一句话概括:对话框在前面,生产线在后面,任务把两端串起来。
  3. 技术方案一:存量系统能力如何标准化接入
    • 四种接入模式与适用边界:MCP 连接器(系统既有 API)、Skills(需要交互界面的能力包)、H5-API(页面级能力复用)、Agent-UI(多步复杂任务)。
    • 能力描述规范(可直接照抄的字段):能力 ID、供模型理解的语义描述、入参/出参 Schema、权限域、幂等键、超时与错误码、读写属性、是否需人工确认。
    • 零改造适配层设计:统一鉴权代理、协议与报文转换、字段映射、限流与降级。
    • 能力的注册、版本与上下架管理:新增能力不改工作台主体,接入即生效。
  4. 技术方案二:从一句自然语言到跨系统任务编排
    • 意图识别与槽位补全:缺参数时的三种处理——上下文继承、默认策略、反问澄清。
    • 任务规划:把一次业务任务拆成能力调用图,支持串行、并行、条件分支与人工确认点。
    • 执行引擎:请求合并、超时重试、部分失败降级、断点续跑、结果收敛。
    • 多智能体协同:一个任务按职责拆给若干专职智能体,由编排层统一收敛结果,避免“一个万能智能体”的不可控。
  5. 技术方案三:真执行、真回写
    • 写操作分级:可自动执行 / 需确认执行 / 禁止执行,按能力粒度配置。
    • 身份代理:以用户自身身份调用系统,权限不放大;每一次调用可追溯、可审计。
    • 写操作三道闸:执行前确认、幂等键防重、执行后回执与撤销。
    • 结果回写:写入生产系统,保证系统始终是唯一事实源,而不是在对话里留一份“影子数据”。
  6. 技术方案四:上下文、记忆与多轮续接
    • 三层记忆:会话上下文、工作日记、长期偏好,分别解决“这一轮说什么”“这几天做了什么”“这个人习惯怎么做”。
    • 跨会话续接:任务状态持久化,昨天没做完的走访准备今天接着做。
    • 记忆边界:什么写入、什么不写入,以及个人数据与组织数据的隔离。
  7. 技术方案五:安全、成本与可观测
    • 分级安全网关:强制拦截 / 风险预警 / 免责核验三级,避免“一刀切”误伤正常业务。
    • 算力成本:模型网关分层 KV 缓存提升单位算力 Token 吞吐,个人/部门/系统三级 Token 配额与超额熔断。
    • 可观测:全链路调用追踪、任务成功率、人工介入率、Token 计量,让每个场景的投入产出可核算。
  8. 上线路径与量化成效
    • 场景选择四条标准:跨系统、高频、规则明确、价值可量化。
    • 五步上线:能力接入 → 评测门禁 → 小范围灰度 → 扩面 → 常态化运营。
    • 量化成效:改造前后关键指标对比与测算口径。
  9. 总结与展望
    • 技术演进:对话框越来越小,能力越来越无形,系统被“调用”而不只是被“打开”。
    • 组织演进:从改造一个系统到改造一批系统,从交付一个项目到沉淀一套规范。

方案与业界现有方案的区别和优势

  1. 以“能力接入”替代“应用重构”的存量系统改造路径。业界常见做法有两种:一是把 AI 塞进某个系统做成“系统内助手”,能力出不了这个系统,员工依然要逐个系统登录;二是为 AI 另建一套应用,存量系统的流程、权限、数据要重新对齐一遍,代价大且上线即落后。我们走第三条路:不动存量系统的业务逻辑,只在其外围增加能力适配层,把系统既有能力按统一规范注册为可被对话调用的能力单元——同一个“查客户在用产品”的能力,既能被对话调用,也能被页面调用、被其他能力编排调用。企业内部接第 1 个系统和接第 20 个系统,用的是同一套规范、同一套流程,边际成本持续下降。
  2. 对话直连生产系统的“真执行”链路。多数企业 AI 助手停留在“查询 + 建议”:能告诉你该做什么,但不能替你做,落地效果止步于“提效不明显”。我们打通了写操作——以用户身份代理调用(权限不放大)、写操作分级(可自动执行 / 需确认执行 / 禁止执行)、幂等键防重、执行后回执与撤销。客户经理在对话里说“把这个商机推进到方案确认阶段”,工作台调用商机系统接口真实变更状态,而不是只回一句建议。这一步是“从对话框到生产线”的关键分水岭,也是企业最谨慎、最难打通的一段。
  3. 面向任务的跨系统编排引擎,而非单点智能体。单点智能体解决的是“一件事在一个系统里做完”,而企业里真实的工作天然跨系统:一次走访准备要同时读客户档案、读在用产品、读近期故障、读经营数据,再生成走访方案。我们把能力编排成有向图,支持串行、并行、条件分支与人工确认点;缺参数时按上下文继承、默认策略、反问澄清三种方式补全;执行中支持超时重试、部分失败降级与断点续跑。用户看到的是“一句话出结果”,背后是多个异构系统能力的稳定调度。
  4. 交付的是一套可复制的接入与上线规范,而不是一个项目。我们沉淀了四种接入模式的适用边界、能力描述字段规范、场景选择四条标准,以及“能力接入 → 评测门禁 → 小范围灰度 → 扩面 → 常态化运营”的五步上线流程,并配套能力准入与质量门禁机制。其他企业可以照搬这套规范完成自身存量系统的 AI 化改造,不必从零摸索架构,这是本方案对企业级 AI 落地最直接的借鉴价值。

本技术在实践过程中的痛点问题

  1. 能力接入的标准化与存量系统差异性之间的矛盾。规范越统一,接入越顺畅,但存量系统由不同厂商建设、接口风格与字段口径各异,适配层往往要为每个系统做一次“方言翻译”。哪些差异应在适配层消化、哪些必须反向推动系统侧整改,是我们持续在权衡的问题。
  2. 从“给答案”到“动系统”的信任与责任边界。写操作分级是按能力粒度配置的,但同一能力在不同业务场景下的风险并不相同——同样是“修改商机状态”,日常场景可以自动执行,重大商机可能必须人工确认。如何用更细的场景化策略替代粗粒度开关,目前仍在实践中摸索。
  3. 跨系统编排的稳定性与部分失败处理。一个任务跨 4—5 个系统,任何一个系统超时或返回异常,都会影响整体体验。我们通过重试、降级、断点续跑缓解,但“部分成功如何向用户解释、如何让用户接着做完”仍是需要反复打磨的地方。
  4. 权限代理与安全合规的精细度。以用户身份执行保证了权限不放大,但也意味着 AI 的能力上限被个人权限锁死;跨部门协作任务中,用户权限之外的数据如何安全获得,需要在合规框架内另行设计。
  5. 规模化之后的算力成本控制。推广面越大,Token 消耗增长越快。KV 缓存与配额制能压住成本曲线,但“业务价值 / Token”这一目标本身难以短期量化,容易陷入只看用量、不看效果的误区。

听众收益

  1. 拿到一套“存量系统可对话化”的完整技术方案。包括能力接入规范、能力描述字段清单、四种接入模式的适用边界(MCP 连接器 / Skills / H5-API / Agent-UI),可直接用于评估自身企业的系统改造范围与工作量。
  2. 掌握跨系统任务编排与“真执行”的工程做法。意图理解与槽位补全、任务编排图设计、写操作分级、身份代理与幂等回滚、结果回写生产系统——这套组合拳是把 AI 从“聊天”推进到“干活”的具体路径。
  3. 了解规模化推广中安全与成本的管控方法。**分级安全网关如何在守住合规红线的同时不误伤业务、身份代理如何保证权限不放大、分层 KV 缓存与三级 Token 配额如何把算力花在刀刃上。
  4. 获得可复制的企业内部改造路径与场景选择标准。包括选场景的四条标准、五步上线流程、能力准入与质量门禁机制,避免把 AI 落地做成单点 Demo 或推倒重来的大工程。

交通指南

上海建工浦江皇冠假日酒店

Shanghai Construction Group Pujiang Crowne Plaza Hotel
地址:上海市闵行区陈行公路 3701 号
  • 微信咨询

  • 电话咨询

    联系电话:18514549229

领取往期热门演讲视频

领取往期热门演讲视频二维码
如您在购票过程中遇到问题,请扫码咨询票务小助手