AIGC 内容工业化

会议室:待定
出品人:鲜嘉麒

随着生成式 AI(AIGC)技术的爆发式增长,大语言模型与多模态模型已逐步走出实... 展开 >

专题出品人:鲜嘉麒

快手电商智能体技术负责人

快手电商智能体技术负责人,十余年电商/商业化/云计算基础架构建设经验,从2025年开始探索将AIGC生产用于规模化业务素材供给,目前已经在快手电商短视频/商品/商城等领域产生规模性的效果收益,近一年在创作智能体、生成成本提效、可控式生成、全链路可观测、有效机审上有着比较深入的实践成果。

专题:AIGC 内容工业化

随着生成式 AI(AIGC)技术的爆发式增长,大语言模型与多模态模型已逐步走出实验室,成为驱动企业数字化转型的核心引擎。然而,如何在保障数据安全与合规的前提下,实现模型的高效推理与训练?如何将大模型能力真正无缝沉淀到复杂的业务场景中,并带来确定性的业务价值?这成为了当前工业界亟待破解的难题。

本专题将聚焦于 AIGC 技术在真实业务场景中的“工程化落地”与“价值转化”。

我们将邀请行业顶尖的 AI 架构师与技术专家,共同探讨以下核心议题:

  • 工业级 AIGC 基础设施与降本增效: 拒绝盲目堆砌算力,聚焦在真实工业生产环境中,如何实现DiT/ViT大模型的低成本模型训练、高吞吐推理加速、动态算力调度以及吞吐量与延迟的极致平衡。
  • AIGC 生产流的安全、合规与确定性治理: 解决 AIGC 走向工业生产的最大幻觉与安全确定性痛点。探讨自动化提示词工程的可控性评测、工业级护栏架构、数据隐私合规审查以及输出结果的确定性对齐方案。
  • 复杂业务场景下的 AIGC 流程编排与流水线: 探讨如何将 AIGC 能力像传统软件工程一样模块化。聚焦多 Agent 协同流在复杂工业级业务中的高可用架构设计、异常容错机制与状态管理。
  • AIGC 工业化落地的量化评估与闭环演进: 工业化的核心是可量化。分享如何建立客观的 AIGC 业务效果评估体系,以及如何通过用户反馈、线上数据影子测试实现模型的自动化迭代与数据飞轮闭环。
  • 端侧 AI 与多模态落地: AIGC 在端侧设备上的轻量化部署,以及图像、音视频等多模态技术的场景应用。

本专题旨在为探索者拨开迷雾,拒绝纯理论的“纸上谈兵”,分享源于一线实践、经过大规模业务验证的落地方法论,帮助技术团队构建可落地、可参考的 AIGC 落地蓝图。

专题受众:

  • AI/算法架构师与工程师: 希望了解行业前沿的 LLMOps、RAG 调优、AI Agent 架构设计与模型加速实践的研发人员。
  • 技术负责人 / CTO / VPs: 正在评估 AIGC 技术可行性、规划企业 AI 路线图,或正在带队进行技术转型的中高层技术管理者。
  • 资深工程架构师(后端/大数据/前端): 关注如何将大模型能力引入现有业务系统,解决高并发、数据安全、系统稳定性等工程挑战的架构师。
  • AI 产品经理与创新业务负责人: 希望洞察技术边界、探寻 AIGC 落地场景与商业化机会的业务思考者。

by 路香菊 博士

爱奇艺
AI 高级算法总监

大模型用于剧本创作时,常出现结构松散、台词悬浮、“AI味”明显及情绪臆想等问题。本次分享将介绍纳逗PRO·剧本空间如何构建VibeWriting模式:以主对话框驱动多Agent协作,将自由交互与专业剧本工作流、量化评估方法论结合,并通过专业知识库增强,实现“边创作、边评估”。分享将重点解析情节逻辑一致性、如何实现剧本结构符合商业化叙事、台词优化及去AI味等技术方案,以及多Agent冲突、上下文漂移、废话累积和评估压制创意等踩坑经验。实践中,剧本开发效率极大提升,为AIGC专业内容生产提供可实现路径。

演讲提纲

  1. 从“生成文字”到“专业剧本创作”:问题与挑战
    • 通用大模型在剧本创作中的典型问题
      • 缺乏专业性的商业化叙事意识:情节割裂、结构松散。
      • 长文本创作容易遗忘设定,出现人物性格漂移、时间线冲突和伏笔失联。
      • 台词空洞、缺少人物身份个性。
      • “AI味”重。
    • 纳逗PRO·剧本空间的目标
      • 将开放式对话的创意自由,与专业剧本工作流的结合。
      • 建立“创作—评估—定位问题—局部修改—再次评估”的VibeWriting闭环。
  2. VibeWriting总体架构:主对话框如何驱动多Agent
    • 主对话框识别用户意图,当前处于讨论、检索、创作、评估还是修改阶段。
    • 从自然语言中提取创作对象、操作类型、约束条件和期望交付物。
    • 判断应该直接生成、调用专业工作流,还是进一步澄清需求。
    • 多Agent的专业分工与协作
  3. 专业剧本工作流:让创意自由,但创作过程可控
    • 从创意到成稿的分阶段工作流、工作流原子化
    • 主对话框与工作流的融合
    • 系统根据意图自动定位受影响的创作资产,避免每次从头生成。
    • 修改前分析影响范围,修改后自动检查人物、事件、时间线与伏笔。
    • 支持局部改写、版本对比和回滚,保留编剧的最终决策权。
  4. “边创作、边评估”:剧本量化评估如何反哺生成
    • 创意阶段评估题材辨识度、核心冲突和市场沟通效率。
    • 大纲阶段评估因果完整性、转折有效性及商业结构紧凑度。
    • 人物阶段评估人物目标、关系张力、行为一致性和成长弧光。
    • 分集阶段评估信息增量、情绪曲线、冲突密度及结尾钩子。
    • 场景阶段评估场景必要性、人物行动、潜台词和可视化程度。
    • 台词阶段评估身份差异、口语感、信息效率和“AI味”。
    • 评估结果的结构化表达
  5. 三项关键技术实践
    • AI写作“去AI味”用专业知识指导AI的生成,用专业的方法论评估与监督生成的质量
    • 角色台词优化为角色建立年龄、地域、职业、教育程度、权力位置及语言习惯等台词画像。
    • 降低大模型臆想IP改编时建立原作事实清单,对新增人物和情节进行明确标记。在生成后增加事实与设定校验,检查是否违反世界观、人物履历及时间线。
  6. 实际踩坑与解决方案
    • 坑一:上下文越长,模型反而越容易忘记关键设定
      • 现象:将完整剧本放入上下文后,模型仍然混淆人物关系和前期伏笔。
      • 原因:关键信息被正文稀释,简单摘要又会丢失细节。
      • 解决:将人物、事件、时间线、伏笔及世界观拆成结构化记忆,按任务动态召回相关内容。
    • 坑二:过度追求量化分数,内容越来越工整却越来越平庸
      • 现象:结构得分提高,但人物的独特性、意外感和作者风格下降。
      • 原因:把类型经验和风格偏好都设计成了刚性指标。
      • 解决:将指标分为逻辑底线、商业建议和风格选择;只强制修复逻辑错误,创意建议交由编剧决定。
    • 坑三:“去AI味”的关键是利用专业方法论的指导
      • 原因:AI味的根源不是词语,而是缺少具体人物、具体关系和具体行动。
      • 解决:从场景任务和人物行动出发重写,要求每句台词改变关系、信息或行动状态。
  7. 结论:多Agent的价值不是“多”,而是专业闭环
    • VibeWriting不是一次性生成剧本,而是让自然语言交互持续驱动专业创作流程。
    • 多Agent的核心价值在于专业分工、上下文隔离、协作协议与结果复核,而非Agent数量。
    • “边创作、边评估”能够更早发现结构和人物问题,降低成稿后的整体返工成本。
    • 量化评估服务于创作而非替代审美,最终目标是让AI承担重复劳动,让编剧保留创意判断与表达权。

实践痛点

  • 实践中的首要难点是准确理解创作者意图。剧本需求往往模糊、跳跃且持续变化,系统既要主动补全,又不能越俎代庖;澄清过多会打断灵感,直接执行又可能造成方向性偏差。其次,长篇创作中的上下文污染具有明显的连锁效应:一个错误设定进入人物卡、大纲、分集和正文后,可能被多个Agent反复引用、相互强化,最终形成“看似一致、实际错误”的结果。
  • 自由编辑同样存在代价。创作者希望随时修改任意人物、场景和台词,但一次局部调整可能影响后续情节、伏笔及人物弧光,因此需要复杂的中间文件、依赖关系、版本管理和回滚体系;管理越严格,交互越不自由。经典剧本库可以提供结构经验和类型参照,却也可能导致桥段趋同、创作模板化,甚至带来版权与素材污染风险;强调创新又会降低商业类型规律的可控性。此外,量化评估能发现结构与逻辑问题,但艺术价值难以被完全指标化,过度追求高分可能抹平作者风格。因此,系统必须在意图理解与执行效率、长期一致性与上下文成本、自由创作与工程管理、经典规律与艺术创新之间持续取舍。

前沿亮点

  • 自由对话与专业工作流的双层协同架构
    • 不同于仅依赖Prompt或固定工作流的方案,VibeWriting以主对话框理解创作者开放、动态的意图,再将任务路由至人物、结构、场景、台词等专业Agent;通过结构化任务单连接自由交互与确定性流程,在创意自由度和生产可控性之间取得平衡。
  • “边创作、边评估”的闭环式多Agent协作
    • 将剧本量化评估嵌入创作过程,针对商业结构、人物弧光、情节因果、台词生活化及“去AI味”等维度,输出带原文证据的问题定位和局部修改建议。创作Agent与评估Agent进行上下文隔离,避免相互迎合及错误自我强化。
  • 面向长篇创作的结构化记忆与影响分析
    • 不单纯依赖超长上下文,而是将人物、事件、时间线、伏笔和世界观沉淀为可检索的创作资产;局部编辑后自动分析影响范围并触发一致性检查,降低上下文污染、人物失真及错误设定在多Agent间扩散的风险。

听众收益

  • 对内容创作者:了解如何将AI真正融入剧本创作,而非停留在简单文本生成;掌握从创意、大纲、人物、分集到台词优化及量化评估的协同方法,获得兼顾创作自由与专业规范的AI使用经验。
  • 对技术研发者:获得一个基于大模型和多Agent架构构建垂直领域应用的完整案例,了解意图识别、任务路由、专业工作流、结构化记忆、知识检索及“创作—评估—修改”闭环的设计与实现。
  • 对AI产品及行业从业者:理解大模型在长文本创作中的能力边界与工程取舍,包括上下文污染、Agent协作冲突、幻觉控制、版本管理,以及创意自由度与流程标准化之间的平衡,并获得可迁移至其他专业内容生产场景的实践经验。

by 袁瑗

快手
磁力引擎安全与生态算法专家

AIGC 快速发展大幅降低广告内容生产门槛,也对合规治理带来新挑战。传统“审核反馈 + 手工修复”链路冗长、通过率低,商家为规避风险常主动弱化表达,导致合规与营销难以兼容。
为此,我们构建了基于 Agentic AIGC 的素材修复架构:将审核结论解构为结构化任务,通过对文字、图像、视频的局部精准编辑与片段生成/替换消除风险、保留素材价值,并借助多目标强化学习在合规与营销吸引力之间动态求解。本次演讲将围绕风险理解、编辑与生成协同、多目标优化等技术实践展开,探讨合规与营销的对抗、千万级素材吞吐下的质量与成本权衡,帮助企业构建安全与增长兼得的柔性内容治理能力,助力商家实现长期经营增长。

演讲提纲

  1. AIGC 时代下的广告素材合规难题
    • AIGC 大幅降低广告素材生产门槛,素材产出与投放节奏进入指数级增长,AIGC生成与改写也逐步融入商家的日常素材生产。但对拒审素材而言,商家自行修复缺乏对审核规则与风险边界的精准理解,容易反复被拒,或因过度改写削弱营销表达;素材合规修复仍高度依赖“审核反馈 +手工修复”,成本高、周期长、通过率低,与 AIGC 的产出节奏形成明显落差。
  2. 把 AIGC 塞进修复链路,为什么没那么简单?
    • 风险归因与定位:知其违规,更知其所以然
    • 安全与营销博弈:既要过审,也要有效
    • 编辑的时空一致性:局部改动,全局自洽
    • 质量与成本权衡:要修得好,也要修得快
  3. Agentic AIGC 修复架构:理解、决策、生成的协同
    • 整体架构:以多 Agent 协同驱动素材合规修复,覆盖文字、图像、视频多场景与多风险类型
    • 风险结构化理解:将审核结论解构成可执行任务
    • 多目标强化学习:在合规与营销吸引力多目标约束下动态求解
    • 多模态编辑与生成协同:文字、图像、视频编辑与生成的联动,兼顾时空一致性
    • 指令驱动的端到端视频编辑:一句话完成从素材到合规成片的编辑
  4. 未来展望:生成即合规
    • 理解与生成统一架构:统一建模,推动从“先生成、后审核”演进为“生成即合规”
    • Agent 从“补丁”走向“共创”:合规能力从事后修补前置为创作阶段的原生能力

实践痛点

  • 修复策略难以标准化:不同品类、不同风险类型的修复逻辑差异大,规则化与人工经验都难以覆盖全场景
  • 合规与营销的表达冲突:营销追求强表达以提升转化,合规要求在边界内呈现,两者在实际素材上频繁冲突
  • 多模态编辑一致性难保障:视频局部改动容易出现穿帮、风格漂移,图像/文本改写易脱离原素材语境
  • 规模化修复的成本压力:高质量生成模型推理成本高、时延大,难以在大规模素材修复场景下全量落地

前沿亮点

  • 规模化落地的 Agentic 素材合规修复体系:覆盖文字、图像、视频全模态,服务千万级素材场景
  • 一句话完成端到端视频编辑:无需分镜拆解与逐帧标注,指令驱动即可产出合规且连贯的成片,显著降低生成成本
  • 柔性治理的边界方法论:为生成式 AI 参与内容治理提供可复用的边界框架
  • 合规与营销的联合优化范式:不止于守住合规底线,通过多目标建模让修复后的素材同时保留营销表达力

听众收益

  • 关键技术实践:风险结构化、多目标强化学习、多模态编辑与生成协同的落地经验
  • 工程权衡思路:合规与营销的对抗、质量与成本的取舍、柔性治理的边界划定
  • 业务视角启发:如何在守住安全底线的同时释放营销表达空间,实现“安全与增长兼得”
  • 前瞻趋势判断:把握合规从“事后审核”前置到“生成阶段"的行业演进,为业务落地生成式 AI 提供参考

by 邹娟

阿里巴巴
资深技术专家

生成式 AI 让“一句话出视频”成为现实,但行业落地的挑战不仅在于高质量 Clip 生成,也在于如何将数十个 AI 片段加工、编排并渲染合成为数分钟的完整成片。本次分享介绍万镜一刻的工程实践:通过L型架构实现能力复用与产品解耦;设计四层 API,让 AI 视频能力可组装、可编排;构建 Multi-Agent 协作体系,让创意发现、编剧、导演、剪辑等 Agent 在统一 Timeline 上完成端到端成片流水线。同时分享多模型调度一致性、长时间线渲染稳定性、Agent间上下文传递等踩坑经验。该架构已支撑短剧、营销、电商等多行业场景的规模化视频生产。

演讲提纲:

  1. 从Clip到Timeline:问题定义
    • 生成式视频的“最后一公里”困境:模型日新月异,但从单个Clip到可交付成片之间存在工程空白。
    • 成片 ≠ 片段拼接:一致性、节奏、转场、配音对齐、质检等问题,到Timeline阶段才集中爆发。
    • 万镜一刻的定位:覆盖创意到成片交付的全链路,与素材生成类平台有本质差异。
  2. L型架构与多层API设计
    • 为什么是L型:横向PaaS同时支撑AIGC通用服务能力,纵向SaaS/Agent快速适配不同AIGC场景的特性能力。
    • 多层API:每层解决什么问题,层间如何递进。
    • 踩坑:各种边界的划分与重叠——过早抽象,API爆炸;过晚抽象,重复建设;过度抽象,效率低。
  3. 长程任务与多模型调度
    • 长程任务拆解与执行策略。
    • 内容一致性优化。
    • 模型路由与降级:同一物理模型多供应商主备切换的调度设计。
    • 踩坑:
      • SubAgent“过度指挥”——约束太强,丧失多样性。
      • 长成片Context窗口溢出——分段传递 vs. 摘要传递的取舍。
      • 配音时长与视频时长对不齐——动态变速 + 静音填充 + 画面延伸。
  4. 落地效果与展望
    • 当前支撑的行业场景。
    • 从分钟级成片到更长内容的技术挑战。

实践痛点:

生成模型的不可控性是最大痛点。AI 生成输出在叙事语义、运镜手法、情绪表达、风格氛围、多人站位关系上都存在不确定性。一条成片调用数十次生成模型,任何一次“跑偏”都影响整体。
长程任务的状态管理复杂度远超预期。数十个异步子任务、复杂依赖关系、长尾延迟与偶发失败,部分重试、状态回滚的工程量占系统相当比例,但对外完全不可见。

Trade-off:

  • 质量 vs. 速度。每增加一轮质检环节,Pipeline耗时都会增加。目前采用“分场景、分级质检”的模式,代价是仍会漏过低质量片段。
  • 通用性 vs. 场景深度。PaaS抽象越通用,场景体验越平庸;做得越垂直,复用价值越低。目前妥协为“底层通用,场景层按行业分叉”,代价是场景层维护成本有所增长。

前沿亮点:

  • 成片制作Know-how原生嵌入生成链路
    • 业界主流方案的核心竞争力在单段Clip的生成质量,成片组装仍依赖人工剪辑或简单拼接。我们的差异在于将视频制作的结构化Know-how重构为Agent约束和Timeline编排,使系统以成片交付标准反向指导每个片段该生成什么、多长、什么景别、如何衔接——这是从秒级Clip跨越到分钟级成片的关键路径。
  • AI生成与音视频处理的帧级原生融合
    • 业界常见架构是“AI生成”和“视频处理”两套独立系统:先调模型生成Clip文件,再导入传统Pipeline做拼接、渲染。这种割裂带来效果和性能的双重问题。我们将部分场景的AI推理与媒体引擎的帧处理Pipeline原生融合,在同一数据流中完成生成、增强与渲染,避免中间态落盘带来的效果与性能损失。

听众收益:

  1. 了解AI视频从Clip生成到分钟级成片交付之间的工程化Gap,以及“成片思维”与“素材思维”的本质差异。
  2. 获得一套经过生产验证的AIGC PaaS + SaaS/Agent分层架构设计经验。
  3. 掌握长程AI任务中多模型调度、上下文传递、状态管理的实战踩坑与应对策略。

by 郑重

生数科技
解决方案负责人

视频生成模型正在从“生成一段可看的视频”进入更复杂的阶段:它需要在多主体、多镜头、长时序和交互场景下保持一致性、可控性和实时响应能力。这些问题不仅决定了生成效果,也决定了视频 AIGC 能否真正进入专业内容生产和实时互动场景。
本次分享将围绕视频生成中的关键技术挑战展开,包括角色与场景一致性、参考驱动生成、镜头与叙事控制、流式视频生成以及世界模型方向的探索。分享将结合 Vidu 在模型迭代和场景实践中的技术路径,讨论视频生成模型如何从离线生成工具,逐步演进为可控、可交互、可扩展的内容生产基础能力。

演讲大纲

  1. 视频生成模型面临的关键挑战:从图像生成到视频生成,难点不只是增加时间维度,而是如何在连续画面中保持主体、场景、动作、风格和叙事逻辑的一致。分享将首先拆解当前视频生成在多主体一致性、长时序稳定性、动作控制、镜头语言和实时响应方面的主要瓶颈。
  2. 一致性:从随机生成到参考驱动生成
    • 视频内容生产需要模型稳定复现角色、商品、场景和风格。分享将介绍参考生视频、参考生图、主体保持等能力所解决的问题,以及它们如何降低多镜头、多场景创作中的断裂感。
  3. 可控性:从画面生成到镜头与叙事控制
    • 专业视频创作并不只是生成画面,还需要理解剧本、角色关系、情绪变化、动作节奏和镜头调度。分享将结合 AI 剧创作场景,讨论模型如何完成脚本理解、智能分镜、运镜规划和多镜头一致性控制。
  4. 实时性:从离线生成到流式交互
    • 传统视频生成通常是输入提示词后等待结果,难以支撑实时互动体验。分享将介绍 Vidu S1 流式视频生成模型的方向,重点讨论秒级响应、无限互动时长、双向感知、即时指令遵循和多模态输入输出对交互式内容生产的意义。
  5. 从世界生成到世界行动
    • 视频模型不仅生成画面,也在学习对时空、动作和物理世界的理解。分享将介绍生数科技在世界行动模型方向的探索,讨论视频生成、世界模型与具身智能之间的关系。
  6. 总结:视频 AIGC 的技术演进路径
    • 回到整体技术路线,总结视频生成模型如何从“可生成”走向“可控生成”,再走向“实时交互”和“世界理解”。


听众收益  

  • 理解视频生成模型在一致性、可控性、长时序和实时交互上的核心难点。  
  • 了解参考驱动生成、智能分镜、镜头控制、流式生成等能力背后的技术价值。  
  • 获得视频 AIGC 从 Demo 走向专业内容生产场景时需要解决的问题框架。  
  • 看到视频生成模型向世界模型、具身智能方向演进的技术趋势。

交通指南

上海建工浦江皇冠假日酒店

Shanghai Construction Group Pujiang Crowne Plaza Hotel
地址:上海市闵行区陈行公路 3701 号
  • 微信咨询

  • 电话咨询

    联系电话:18514549229

领取往期热门演讲视频

领取往期热门演讲视频二维码
如您在购票过程中遇到问题,请扫码咨询票务小助手