随着 Cursor、Codex、Claude Code 等 AI Coding ... 展开 >





先后就职于华为,蚂蚁集团,阿里集团。现任阿里国际 AE 技术部 App 技术负责人。曾深度参与负责支付宝App,AliExpress App 业务和架构开发工作,近两年深入参与终端领域 D2C 生码,Coding Agent Harness 工程实践等工作。在终端研发,架构治理,工程效能,AI Coding Agent 有丰富的实战积累。当前聚焦在不断迭代打磨自研 Coding Agent 能力,包括不限于提升 Agent 自验证和自校验能力等,并在 AliExpress C端业务开发中全面落地推进,持续探索效能提升的最优解。
随着 Cursor、Codex、Claude Code 等 AI Coding 工具的快速普及,软件开发正在从“人工编码驱动”进入“人机协同生成驱动”的新阶段。开发者能够以前所未有的速度完成需求拆解、代码生成、单元测试补全和问题修复,但与此同时,代码理解、质量评审、测试覆盖和发布验证并没有同步完成体系化升级,软件质量保障正面临新的断层。
本专题将深入探讨 AI 生成代码时代的软件质量挑战与工程化解法,关注 Vibe Coding 带来的 Verification Debt、AI 生成代码的透明度与可维护性问题,以及如何通过智能化测试、代码用例生成、缺陷识别、风险预测、GUI Agent、自动化回归和质量平台建设,将质量保障从事后检查转向研发过程中的实时反馈、持续验证与质量内建,最终提升 AI 时代的软件交付可信度。
专题受众
软件测试 / 质量工程师:关注 AI 生成代码带来的测试缺口,探索如何通过智能化测试、自动化回归、缺陷预测、GUI Agent 和质量平台提升测试效率与质量覆盖。
软件开发 / 技术负责人:关注 AI Coding、Vibe Coding、代码生成、Prompt 工程和代码质量治理,希望在提升研发效率的同时,建立面向 AI 生成代码的评审、测试、验证和发布门禁机制。
AI Coding 与 Vibe Coding 正在大幅提升软件交付速度,但自动化测试、回归验证与质量门禁并没有同步演进,Verification Debt 正成为 AI 软件工程的新挑战。传统 GUI 自动化依赖大量脚本编写和维护,面对多端形态、频繁变更和复杂交互时,验证成本很难随研发速度线性扩展。
本次分享将介绍一个全平台 GUI 持续验证框架的实践路径:第一阶段通过 MCP 将 GUI 操作、界面观察和录制能力接入 Coding Agent,验证 AI 辅助录制与测试生成的可行性;第二阶段进一步演进为独立的自动化生成 Agent,以自然语言 Case 作为核心测试资产,通过需求上下文、历史用例、录制轨迹和界面状态生成结构化验证规格,并结合可插拔 Driver、共享 Harness、证据包与独立验证机制,支持 Windows、macOS、Android、iOS 和 Web 的统一 GUI 验证。分享将重点介绍架构演进、自然语言 Case 到验证规格的生成思路、跨平台执行抽象、稳定性治理和实践效果。
演讲提纲
1. 背景:AI Coding 提速后的 GUI 验证断层
2. 第一阶段:通过 MCP 把 GUI 自动化能力接入 Coding Agent
3. 第二阶段:Agent 驱动的验证规格生成
4. 关键技术设计与工程取舍
5. 未来展望:从自动化录制走向持续验证闭环
实践痛点
这类技术并不是把 GUI 自动化复杂性完全消灭,而是把复杂性从“人工写脚本”转移到“用例表达、规格生成、跨平台执行和结果可信度”上。
前沿亮点
听众收益
本次演讲源于支付宝生活缴费一个包含约 60 万行 Java 代码、600 多个接口的核心在线系统跨语言重构实践。系统包含复杂的业务分支、机构差异配置、分布式调用链和外部依赖。传统依靠代码评审、补充用例和上线观察的交付方式,能够发现局部实现问题,却难以证明新系统在预期业务边界内保持了老系统的关键行为。
为此,我们将重构目标从“迁移代码”转变为“迁移行为”,建立两个相互校验的 Loop:Loop 1 从老系统提取业务行为,通过 PERS 建模、Case-Forge 路径压缩和人机协同完成场景生成;Loop 2 使用 Bubble 在新系统回放相同场景,验证实际执行路径,判定新老系统的行为差异,并结合真实流量回放为分阶段切流提供依据。
本次演讲重点剖析两个工程问题:一是如何从复杂分支中提取规模可控但不失真的行为集合;二是如何识别 AI 生成用例中的路径偏移与假覆盖,并将差分结果转化为可发布、可观测、可回退的工程决策。
演讲提纲
1. 现象:代码完成了,为什么重构还没有完成
2. 思路:把跨语言重构转化为行为迁移
3. 方法:双 Loop 如何贯穿重构与上线
4. 技术深挖一:如何得到规模可控但不失真的行为集合
5. 技术深挖二:如何识别假覆盖并完成差分验真
6. 经验:最终沉淀下来的工程判断
实践痛点
演讲亮点
听众收益
AI 提升了编码效率,但一人完成三端交付仍面临业务理解不一致、长流程易中断和评测成本高等问题。本分享介绍 Hybrid Coding Agent 的 Harness 实践:外环统一契约与任务编排,内环将验证贯穿方案、编码与构建,以反馈驱动各端生码和修复;通过结构化 Journey、脚本执行和封存证据提高评测可靠性,并将失败与修复沉淀为知识、Skill 和回归用例,驱动生码与评测共同演进。实践覆盖 10 大场景、约 65.5 万行代码重构与评测上线,线上 Bug 下降 80%,展示如何将单端编码提效转化为三端交付能力。
演讲提纲
1. 背景:从单端编码提效走向一人主导三端交付
2. 架构:外环协同编排与内环生码验证
3. 关键设计一:通过契约与上下文工程提高三端生成一致性
4. 关键设计二:以持续验证反馈驱动生码与可信验收
5. 持续演进:让真实问题同时改善三端生码与评测
6. 实践效果:业务覆盖、代码产出与线上质量
实践痛点
前沿亮点
听众收益
Vibe Coding 时代,代码生产力激增,质量债加速累积,传统 AI 审查“只发现不闭环”。本课题分享 AICR 以点破面的实践:通过 MCP 上下文扩展、多 Agent 异构协同、增量追踪与集成交付闭环,将审查从“能审”推进到“审准、审得起、审出闭环”;并进一步联动 SonarQube 静态扫描、部署、单测、接口自动化等节点,借助 ACP 编排业务自定义 Agent,双向印证、降噪提效。最终展望静态 AICR 与动态智能测试双向补齐,构建多 Agent 协同的质量网络,为 Vibe Coding 时代的新质量债提供可落地的治理范式。
演讲提纲
1. Vibe Coding 时代,Code Review 的质量挑战
2. 让 AI 从“看代码”到“懂业务”
3. 多 Agent 与增量:放大审查效果,完成工具层闭环
4. 集成交付与反思闭环:让审查结果真正落地
5. 自动化节点与 AICR 双向联动及 ACP 编排
6. Coding 时代质量保障体系的未来演进与规模化落地
实践痛点
演讲亮点
听众收益
本演讲将帮助听众看清 Vibe Coding 时代质量债的根源,理解为何“只发现不闭环”的 AI 审查必然失效;掌握 AICR 以点破面的可复用框架——MCP 上下文扩展、多 Agent 异构协同、增量追踪与集成交付闭环,并可迁移到测试生成、文档巡检等场景;学会更高效地使用 AICR,知道它擅长抓哪些高危问题、如何通过采纳/忽略反馈让它越用越准;了解传统自动化工具与 AICR 双向联动的落地方法,实现降噪、召回、提效、可追溯;并获得动静结合的质量体系演进视野,为团队治理新质量债提供可落地的路径参考。
随着 AI Coding 工具普及,代码生成大幅提速,但测试验证没有同步跟上——生成与验证之间的缺口正沉淀为一笔“验证债”,传统后置测试已难以偿还。
本次分享基于飞猪真实业务的落地实践,介绍我们“还债”的基本思路:QA 判断前置、质量左移,由 AI 承担规模化执行。目前用例采纳率稳定在 85% 以上,80% 左右的用例可由平台自动执行,UI 自动化成功率稳定在 85% 以上,单需求平均验证周期从 3 天缩短至 1 天左右。内容以一个真实需求为主线,讲清落地要跨过的三道坎——测得准(AI 与人在用例生成、执行上的认知对齐)、接得住(与产品、研发、视觉等多角色协同完成上线闭环)、铺得开(接口与 UI 自动化从跑通链路到真正覆盖业务)。
分享结合真实 Case,说明 AI 在各测试环节的效果、依赖条件与能力边界,以及哪些环节还得靠人。
演讲提纲
1. 什么是“验证债”:AI 一天写出的代码,我们测了一周
2. 如何“还债”:AI Native 测试在飞猪的落地实践
3. 对账:AI 能做什么,哪些仍需依赖人
实践痛点
演讲亮点
听众收益



微信咨询

电话咨询
领取往期热门演讲视频

