进入 2026 年,企业在 AI Token 和工具上的投入持续增长。对于大型研发组织,问题已经不是“有没有使用 AI”,而是这些投入能否缩短交付周期、改善质量,并转化为组织效能。传音拥有大量历史业务信息、复杂存量系统和技术债务,无法推倒重来,只能在保障交付和质量稳定的同时逐步改造。本次分享聚焦 AI 从 L2 流程嵌入走向 L3 Agent 驱动的关键阶段,介绍传音如何自上而下规划精品 Agent、自下而上培养超级个体和涌现领域 Agent,如何用知识与 Harness 支撑业务交付流和质量改进流,以及如何通过任务吞吐量、质量结果和人效判断 AI 提效是否真正有效。
演讲提纲
1. 为什么单点变快了,整体交付没有同步变快
- AI 已经在文档、设计、编码和故障分析等环节产生局部效果,但当任务跨越产品、设计、开发和测试等多个职能后,瓶颈往往转移到信息解释、评审等待、任务交接和质量返工上
- 对千人级研发组织来说,从 L2 走向 L3,组织和协作方式的影响大于技术本身。整体思路可以概括为:组织提效 = 超级个体 × AI 杠杆 ÷ 协作摩擦
2. 组织层面:怎样让一千多人真正开始改变
- 一方面,自上而下从业务交付流和质量改进流中选择高价值任务,明确 Agent 的输入、输出和验收标准,由平台团队建设通用能力
- 另一方面,从一线选择种子选手,通过真实项目培养能够拆解任务、调动知识和多个 Agent、判断输出质量的超级个体。再由超级个体、领域专家和平台人员组成内部 FDE 小队,从现场沉淀领域 Agent、Skill 和规则
- 自上而下规划的 Agent 与一线涌现的 Agent,通过统一的知识边界、工具权限、验收方式和人工接管标准进行对齐。组织机制上,既让沉淀可复用能力、主动分享并带动他人的成员获得更多发展机会,也通过任务周期、质量结果和上下游效率变化传递转型压力
3. 技术层面:Agent 怎样进入研发流程
- Agent 需要两部分信息:一部分是需求、项目、代码、测试、缺陷和版本等业务数据,由现有 SaaS 系统持续更新;另一部分是产品规范、Review 规则、测试策略、故障案例和专家经验,在知识平台、结构化研发产物、Harness 和 Agent/Skill 之间不断修正
- 业务交付流从洞察、PRD、SDD/Spec、设计、Demo 延伸到编码和交付,重点减少上下游重复理解和人工转译。特性树用于组织业务范围和价值点,并检查需求及产物覆盖情况
- 质量改进流从编码、Code Review、Test、故障分析、根因分析回到修复。Issue 覆盖稳定性、性能、功耗、通信、三方应用和业务应用等类型,通过故障树分类分层;再用 Harness 约束 Review,收敛测试范围,持续调整测试 Case,并通过视觉、功能和日志结果验收
4. 度量与规模化:最后回到任务结果
- 目前部分场景已经出现明确变化:PRD 辅助生成由约1周缩短到1天;某前后端 MVP 的研发投入由80人日降至25人日,整体周期缩短63.6%;三方应用六类场景的根因分析准确率达到80.7%,样本为150单
- 这些数据只能证明局部场景有效。进一步需要以真实任务为单位,观察任务吞吐量、交付周期、一次通过率、Issue 覆盖、根因准确率、测试投入和人均任务承接量。目前正在通过 Multica 等平台补齐任务过程观测
- 同时,将能够参与端到端 AI 任务的超级个体占比作为组织能力指标,H2 目标是在重点业务线的目标人群中逐步提升到 30% 以上。只有稳定改善任务结果的 Agent、Skill 和工作方式,才向其他业务线复制
实践痛点
- 任务划分和拆解的口径
- 统计维度和能力建设投入不足
- 内部 FDE 组织建设和实施难度
演讲亮点
- 在存量大型研发组织中牵引AI提效落地,我们多数在单点/单场景提效,对于商业企业而言这是远远不够的,我们需要让 AI 提效的成果显性化和体系化
听众收益
- 了解千人级研发组织如何启动和运行 AI2D 提效实践
- 掌握自上而下规划 Agent、自下而上涌现 Agent,以及培养超级个体和组建 FDE 小队的方法
- 理解业务数据、研发经验、特性树、故障树和 Harness 如何进入真实研发流程
- 了解如何通过任务吞吐量、交付周期和质量结果,判断 AI 提效的实际价值