随着 AI Coding 工具普及,代码生成大幅提速,但测试验证没有同步跟上——生成与验证之间的缺口正沉淀为一笔“验证债”,传统后置测试已难以偿还。
本次分享基于飞猪真实业务的落地实践,介绍我们“还债”的基本思路:QA 判断前置、质量左移,由 AI 承担规模化执行。目前用例采纳率稳定在 85% 以上,80% 左右的用例可由平台自动执行,UI 自动化成功率稳定在 85% 以上,单需求平均验证周期从 3 天缩短至 1 天左右。内容以一个真实需求为主线,讲清落地要跨过的三道坎——测得准(AI 与人在用例生成、执行上的认知对齐)、接得住(与产品、研发、视觉等多角色协同完成上线闭环)、铺得开(接口与 UI 自动化从跑通链路到真正覆盖业务)。
分享结合真实 Case,说明 AI 在各测试环节的效果、依赖条件与能力边界,以及哪些环节还得靠人。
演讲提纲
1. 什么是“验证债”:AI 一天写出的代码,我们测了一周
- 速度断层的形成:代码生成效率大幅跃升,验证能力原地踏步,缺口持续累积为“验证债”
- 传统后置测试无法承接:用例编写、执行、结果判定集中压后,量级一旦放大将无法承接
- 还债的基本思路:质量判断前置,QA 角色左移,由 AI 承接规模化执行
2. 如何“还债”:AI Native 测试在飞猪的落地实践
- 测得准:对齐“测什么、怎么算对”
- 认知偏差根源:需求上下文缺失、判定标准不一致
- 生成怎么保证准:生成前先对需求/技术方案做完备性检查,识别缺失信息并补齐后再生成;业务知识库与历史用例作为生成输入;生成结果定位为候选池,由 QA 按业务规则 Review 收敛,以采纳率量化生成质量并反哺生成规则
- 执行怎么保证准:用例自带结构化验证点,机器转译为可执行断言(接口侧转译为断言表达式,UI 侧采用文本 + 视觉语义双重检查点),执行阶段不做二次理解
- 前后一致性怎么做到:用例生成、case 识别、数据构造、执行共用同一份结构化用例契约,验证点从生成端直通执行端,执行结果回写到用例粒度,全程可追溯
- 接得住:AI 融入多角色协同的全流程
- 质量前置:与产品、开发协同,提测前基于完备性检查清单完成需求准入的问题识别,把字段、交互、异常分支的缺口清单化
- 质量后置:与视觉、开发打通,通过设计稿与页面实际渲染的自动化比对,完成视觉稿的自动化验收闭环,差异以清单形式回流
- AI 在各环节的实际介入方式与效果:AI 产出、人工在准入与准出等关键节点做确认门禁
- 铺得开:从“跑通链路”到“真实业务覆盖”
- 用例分轨机制:按数据构造能力与执行引擎能力边界,将用例自动判定为接口自动化 / UI 自动化 / 人工三轨,避免把执行不了的用例硬塞给 AI
- 接口与 UI 自动化方案的迭代演进与执行成功率提升:断言分层转译、执行加固(显式等待、异常弹窗处理、失败重试)
- 规模化交付路径与真实案例演示:Skill 与后台 Agent 两种交付形态,支撑批量需求测试
3. 对账:AI 能做什么,哪些仍需依赖人
- 能力边界:AI 已可承担新功能用例生成、接口/UI 自动化执行;仍需 QA 接入的是存量场景影响评估、业务数据构造、风险研判与准出结论
- 演进制约:业务知识与历史用例沉淀不均衡;数据构造的瓶颈在于特定业务状态的生成
- 下一阶段的债:失败用例自动归因、数据构造能力建设、知识库自更新机制探索
实践痛点
- 认知不一致的问题很难做到彻底消除,只能在“前置 Review”和“后置 Review”里找平衡
- 效率本质没有想象中提升的那么多,因为自动化覆盖的天花板不在 AI,而在于数据和环境
演讲亮点
- AI Native 测试在飞猪真实需求中跑通并产生实效,可为同类团队直接借鉴
- 把零散的 AI 测试实践收敛成一个可复用的三支柱模型,并配真实 case 与能力边界分析
- 明确 AI 已能承担与仍依赖 QA 的环节,以及落地所需的数据构造、知识沉淀等前提
听众收益
- 理解 AI 生成代码时代“验证债”的成因,以及质量左移 + AI 规模化执行的应对框架
- 掌握 AI 与人在用例生成、执行环节的认知对齐与信息补齐方法
- 掌握接口 / UI 自动化从链路跑通到完整覆盖业务需求的演进路径
- 获得一份可迁移的落地清单:AI 能接哪些环节、需要什么前置条件、还有哪些坑