泠乐,负责淘宝客户端及移动基础设施的质量保障,对 APP 稳定性、性能体验优化、质量效率、安全生产等领域有多年的研究和实践,现深入研究 AI 技术在移动端研发效能、质量保障等领域的应用。

泠乐,负责淘宝客户端及移动基础设施的质量保障,对 APP 稳定性、性能体验优化、质量效率、安全生产等领域有多年的研究和实践,现深入研究 AI 技术在移动端研发效能、质量保障等领域的应用。
AI 编程助手把代码的生产速度放大了,验证能力却没有同步跃升。但"多招几个测试"解决不了这件事——我们复盘后发现真正的堵点有两个,且是乘法关系:
判据缺失:AI 不知道"什么算对"。需求、技术方案、基建规范、团队约束都散在文档里,无法被消费,于是 AI 只能追求"看起来能跑通"。
信号缺失:AI 拿不到"对不对"的客观反馈。它看不见屏幕、读不到运行时、点不动按钮、没法把 App 拉到目标状态。我们量化过:AI 生成 100 个用例,环境搭建 60% × 数据构造 50% × 执行 40% × 工具自动化率 70%,综合可执行率只有 6.4%。
任一为零,自主性就是零。TEKO 的答案是同时补两根柱子:
判据侧:把质量能力做成可在任意研发环节调用的 Skill,让"验收条件"成为一个在链路上逐级传递、逐级细化的结构化数据对象:需求文档产出需求验收条件;技术方案 + 基建规范 + 团队约束产出技术验收条件;代码 diff + context7 + 领域知识产出风险点与配套用例;构建产物产出单测 / 白盒 / UI 自动化用例。最反直觉的一步是把验收条件回喂给生码环节——判据先行,这才是 AI 原生的 TDD。
信号侧:把 App 从"只能被人看的交付物"改造成"能被 Agent 寻址、观测、驱动、复现的可编程环境",并往下打到根因:自动化上不去往往不是用例不够,而是系统本身不可测。我们用终端环境全局切面 + SDK 可测性基线与 CI 卡口去改造"物理法则"。
两根柱子合流,Agent 的循环长度才能从 1 变成 N——从"生成后交给人"变成"生成、执行、观测、判断、修复、复跑"全程无人;线上 Crash 与舆情也能反过来自动转化为回归用例,让用例库有机生长而非靠人工建设。本场交底架构、工程取舍、一个可自评的成熟度阶梯(L0→L5),以及量化效果与尚未解决的问题。
演讲提纲
AI 生码放大了生产速度,验证能力没有同步。三个诊断——变更快过用例的老病、"能跑通≠逻辑对"的新伤,以及最易被忽略的根因:系统本身不可测。提出全场骨架:自主性 = 判据 × 信号,二者是乘法关系,只补一边等于没补。
一、判据:把"什么算对"变成可传递的数据:需求文档不适合生成用例,但它是判据的天然来源——判据左移,验证右锚。四级验收条件流水线:需求文档→需求验收条件;技术方案+基建规范+团队约束→技术验收条件;代码 diff+TBContext7+领域知识→风险点与配套用例;构建产物→单测/白盒/UI 用例。最反直觉的一步是把验收条件回喂给生码环节,即 AI 原生的 TDD。含三源上下文(改了什么/影响了谁/意味着什么)、可执行性过滤与双模召回、以及为什么做成 Skill 而非平台。
二、让判据生产线跑得稳:Session-Stage 编排与五路并行、多 Agent 容错、AI 产出多策略修复链(解析成功率 80%→99%+)、全链路 Trace 与两层评估。主张:AI 系统必须是白盒。
三、信号:把待测对象改造成可编程环境,提供编码反馈的环境层:对人是交付物,对 Agent 必须是环境。四个必要条件、6.4% 可执行率的连乘诊断、三层信号(单测/白盒/UI)、三个工程取舍(侵入边界、结构优先视觉兜底、会话解耦)、可测性治理与 L0→L5 成熟度阶梯。主张:自主性的地板是可测性。
四、合流:循环长度从 1 到 N,改变的是 Agent 能承担的任务类型;三个闭环证据 + 线上负向信号转回归用例的反向飞轮。
五、效果与代价:三端 100% 覆盖、单次分析 12 分钟、1.5w+ 入库用例、96% 操作成功率、性能报告 10 人日→1 人日;坦诚讲鸿蒙短板、运营成本与组织阻力。
六、总结收尾:更高的自主性来自更严的约束;质量工程师的价值转向设计判据、构建信号、改造环境。
实践痛点
演讲亮点
听众收益
适合听众
测试与质量效能负责人、研发效能与工程基础设施团队、移动端研发与架构、AI Agent 平台建设者。
预备知识
了解 LLM / Agent 基本概念,用过任一 AI Coding 工具(Cursor / Claude Code / Qoder)。



微信咨询

电话咨询
微信联系我们

