面向硬件场景的智慧视频创作Agent规模化落地实践

所属专题:千行百业 Agent 创新实践

嘉宾 : 李琳琳 | 小影科技业务 VP/智慧视频创作服务负责人

讲师介绍

专题演讲嘉宾:李琳琳

小影科技业务 VP/智慧视频创作服务负责人

小影科技初创核心成员,深耕互联网出海十余年,全程参与公司全球化业务搭建。最早期负责公司首款出海产品vivavideo 的产品架构搭建,该产品上线 1 年多便实现全球用户破亿,后小影科技旗下 C 端App产品矩阵累计服务全球超 25 亿用户。现负责 ToB 智慧视频创作解决方案业务,该业务聚合了小影科技 C 端应用矩阵业务中的算法、技术、全球本地化等能力,成功赋能多家海内外头部智能终端厂商(荣耀、传音、科大讯飞等),落地 AI 驱动的音视频解决方案。

议题介绍

演讲:面向硬件场景的智慧视频创作Agent规模化落地实践

视频模型发展迅猛,但在硬件这类高度标准化体验的领域,试错成本极高,用户画像以素人为主——仅在“拍摄”维度做智能已很难打动今天的市场,“创作”环节的智能化才是新战场。Agent 时代,手机、车载、穿戴等硬件厂商纷纷向智能创作发力,但普遍卡在两个问题上:生成式技术如何规模化落地服务海量素人用户?规模化之后,高昂的推理成本如何转化为可持续的商业模式?

小影科技与荣耀、传音等头部硬件厂商合作,目前荣耀全系机型相册中的创作功能均由小影提供技术支撑,服务约 7000万日活用户。在此基础上,我们正与厂商共建创作 Agent,核心是两层能力:一是端云结合架构——将素材解析、高光识别等放在端侧,将用户意图识别、创作策略、认读调度等放在云侧,大幅降低创作成本;二是全球化运营能力,针对海外用户的内容偏好和素材库做本地化适配。

以上,我们得出的结论是:硬件+Agent 创作是下一个必争窗口,但真正的壁垒不在模型本身,而在端云成本结构与本地化运营能力的组合。

演讲提纲

  1. 终端 AI 影像创作的供需困境
    • 影像终端硬件能力持续升级:各家拍摄体验差距不断缩小,单纯依靠拍摄能力,很难形成产品差异化优势。
    • 用户素材量持续增长,但创作门槛仍然存在:用户日常拍摄积累了海量照片、视频素材,但普遍存在剪辑门槛高、无创作思路、操作耗时的问题,大量优质素材长期闲置在相册。
    • 用户需求从“拍得好”转向“表达得好”:用户不再只满足清晰拍摄,更希望低成本、高效率把日常素材转化为有故事、有氛围、可分享的视频内容,完成个人内容表达。
    • Agent 成为终端创作的新型产品形态:传统剪辑依赖用户手动操作、学习功能,而 AI 视频创作 Agent 可以基于用户意图自主完成素材理解、任务拆解与流程编排,适配大众轻量化创作需求。
  2. 端云协同的 Agent 架构设计
    • 端云协同架构选型考量:全云端方案在统一算力和开发效率上更简单,但在用户隐私、数据传输、实时体验、离线能力和规模化成本方面存在约束,因此需要基于任务属性做端云推理与计算拆分。
    • 端云协同 Agent:采用端侧执行引擎、云端智能中枢、终端应用与反馈三层架构设计。端侧负责素材理解与解析、画面高光识别、基础素材预处理、视频剪辑与最终渲染;云端 Agent 负责用户意图理解、故事线规划、创作策略制定、Skill 调度与全局创作决策。
    • 从固定模板到原子化创作能力:将百万级视频模板进一步拆解为音乐、转场、滤镜、贴纸等原子化素材能力,由 Agent 根据用户意图、素材特征和故事结构动态组合调用。
  3. 端到端 Agent 创作 Workflow 与多场景适配
    • 创作场景存在天然差异化特征:旅行、日常记录、演唱会、亲子等场景的素材来源、内容逻辑、叙事节奏和用户预期存在明显差异,统一创作流程容易导致成片同质化、贴合度低。因此,需要针对各类高频场景设计专属 Agent Skill 能力。
    • 以亲子场景为例拆解完整创作 Workflow:用户提出创作需求、Agent 识别场景、梳理素材线索、规划故事线、动态调度原子能力,最终完成剪辑渲染与成片输出。
    • 依托全球用户真实创作行为与内容经验,持续沉淀场景 Skill 和专属创作策略,让 Agent 不只是 “听懂用户指令”,也能理解不同市场、不同场景用户的内容表达习惯。
  4. 从 Demo 验证到规模化落地
    • 异构终端环境适配:针对不同机型的算力、存储、系统和网络环境,动态调整端云任务分配,使同一套 Agent 能力适配不同终端。
    • 海量用户高并发保障:面向大规模用户并发与持续使用,需要在保证创作体验的同时控制推理、带宽和计算成本。
    • 用户创作反馈闭环:持续结合用户成片效果、手动调整行为、场景使用数据等反馈,迭代素材筛选、Skill 组合和创作策略,使 Agent 的创作结果持续贴近用户预期。
    • 全球化交付与本地化适配:针对不同区域的内容审美、热点场景、版权规范与隐私合规要求,迭代本地化素材体系和创作策略,支持 AI 视频创作能力在不同终端和市场规模化落地。

实践痛点:

行业里容易有一种错觉:模型能力越强,落地就越容易——尤其是近两年智能硬件融资和模型发展都很快,很容易让人觉得“智能硬件已经很先进了”。但从我们和荣耀这类头部手机厂商的实际合作来看,情况恰恰相反:用户画像的年龄跨度大、二三线城市占比高,大部分是素人而非内容创作者。这意味着,即使我们把足够先进的生成式模型部署到相册这样的高频场景里,真正的难点也不是“模型能不能生成”,而是如何让一个完全不懂 Prompt、不理解创作逻辑的普通用户,只需要最小操作,就能得到一个“满意”的作品——这里的“满意”本身也是一个高度主观、因人而异的标准,很难用单一的评估指标去衡量。

换句话说,当下能把 Agent 用得游刃有余的,基本还是有一定专业背景或学习成本容忍度的用户。前沿技术真正走向大众,尤其是走向像荣耀这样覆盖极广年龄层和城市层级的用户群体,可能还有很长的路要走——而且这条路的难点甚至不在最后一公里的体验打磨,而在于更前面,如何重新定义“好的创作”这件事本身,让它适配一个没有创作经验的普通人。这也是我们认为这个 case 有意思的地方:它是一次前沿生成式技术在真正意义上的“大众化”实践。

前沿亮点:

  1. 端云结合的三层 Agent 架构:区别于市面上“全云端调用大模型”或“端侧轻量模型”的单一路线,分享云端做智能决策与规划、端侧做高光识别/素材理解/剪辑渲染的分工设计,以及这种分工如何同时解决算力分化、成本不可控、隐私合规三个互相冲突的约束。
  2. “拍得好≠表达得好”的供需拆解视角:跳出“影像能力=拍摄能力”的行业惯性认知,提出硬件厂商的下一个增长点在“内容体验”而非参数竞赛,并给出对应的产品化路径,而非停留在趋势判断层面。
  3. 规模化落地的三重验证框架:技术可实现性、用户需求普适性、商业可持续性——一套可复用的判断方法,而非单一案例的经验分享。
  4. 海外本地化的完整闭环拆解:把“本地化”从“翻译”这个常见误解,还原成人群洞察、素材生产、热点运营、合规交付四个环节,分享跨越多个海外市场沉淀出的具体打法。

听众收益:

  1. 理解智能影像终端从“拍摄竞争”转向“创作/表达竞争”的行业拐点,以及背后的产品逻辑;
  2. 获得一套可迁移的端云 Agent 架构设计思路,尤其适合终端算力有限、又需要复杂 AI 能力落地的场景;
  3. 掌握判断一个生成式 AI 功能“是否值得规模化投入”的三个关键问题,避免技术可行但商业不可持续的陷阱;
  4. 了解出海产品本地化不止是语言翻译,还包括素材、运营、合规在内的完整体系,可直接参考应用于自身出海项目。

交通指南

上海建工浦江皇冠假日酒店

Shanghai Construction Group Pujiang Crowne Plaza Hotel
地址:上海市闵行区陈行公路 3701 号
  • 微信咨询

  • 电话咨询

    联系电话:18514549229

微信联系我们

如您在购票过程中遇到问题,请扫码咨询票务小助手