长程复杂优化任务的难点,在于跨轮次保留有效状态、判断反馈是否可信,并在有限资源下持续调整方向。本次分享结合异构芯片算子优化实践,介绍为何将策略调整、候选执行与结果验证适度分离,以及如何衔接任务状态、利用失败记录、决定继续探索或人工介入。通过匿名算子案例呈现不同硬件环境下的优化结果与收益差异,讨论持续执行如何服务于任务进展,以及验证成本、协作开销和局部收益对实际应用的限制。
演讲提纲
1. 场景与问题:复杂优化任务为什么需要持续推进
- 以多种国产芯片上的算子优化为场景,介绍目标明确、路径不确定、实验反馈不断改变后续方向的任务特点
- 梳理持续优化中的主要成本:专业知识获取、反复实现与验证、跨轮次信息交接,以及不同硬件环境下的适配
- 明确系统希望带来的价值:让团队能够持续推进有价值的实验,把专家时间更多用于方向判断、关键问题和结果确认
2. 系统设计:长程任务为什么需要职责分离
- 策略需要根据反馈调整,结果验证则需要保持标准稳定。围绕这一差异,说明为何将探索决策、候选执行与验证适度分离,以及哪些环节无需单独设置 Agent
- 长程探索会积累大量尝试记录,后续决策需要区分已验证结论与待验证假设。讨论如何整理必要上下文,避免过期判断和无效结果持续影响任务。
- 职责分离也会增加交接和验证成本。结合任务依赖、资源约束与专家参与,说明何时值得拆分、何时保留在同一执行单元中。
3. 持续执行:长程任务的状态管理与反馈迭代
- 围绕当前候选、已验证结论和待处理问题保留任务状态,讨论多轮执行、失败后继续及人工接手时,哪些信息需要延续
- 将候选生成与独立验证连接起来,区分验证未通过、结果无改善和出现有效进展等反馈,说明它们如何影响下一轮方向
- 结合收益变化、重复尝试和资源消耗设置停止与转向依据,讨论持续探索的空间和无效循环的成本如何平衡
4. 案例与结果:异构芯片优化的任务过程与收益差异
- 以单个算子优化任务为线索,串联优化目标、候选实现、编译与正确性检查、性能比较及下一轮决策,说明每个环节为后续工作提供什么依据
- 现有记录中,某筛选类算子在 8 组芯片配置下的加速比约为 2.20–7.00 倍;某注意力类算子为 0.317–4.527 倍,部分配置出现性能回退。结合这些差异,讨论收益不足时应重新检查哪些条件
- 面向更普适性的 Infra 层面的推理优化场景,也具备能力的迁移可复用性,在整网模型推理优化在 NV 和异构芯片上均带来了效能的提升
5. 价值与边界:如何判断系统是否值得持续投入
- 结合有效优化结果、达到目标的投入、人工参与和经验复用情况评价系统价值,将算子性能改善与工作方式本身的增益分别讨论
- 说明算子级收益进入真实模型时,还需要考虑调用占比、集成成本和其他系统开销;模型端到端收益是后续验证方向
- 总结适合采用这类系统的任务条件:目标可验证、允许多轮探索、工具能够执行、资源投入可控;讨论其向其他工程优化任务延伸时需要重新验证的部分
实践痛点
- 持续执行与有效进展之间存在距离。长程任务会不断产生新方案和新结果,但更多轮次未必带来更好的结果。系统需要根据已有证据判断是否值得继续,并保留停止和人工调整方向的空间;控制过严可能错失有价值的探索,放开过多又会消耗资源
- 专业分工也会增加协作成本。策略、实现和验证之间需要传递足够的背景与结论。拆分过细容易增加交接负担,信息共享过多又会引入噪声和过期判断。需要围绕真实任务选择合适的分工方式,并明确关键结果由谁确认
- 验证质量决定反馈是否可信。优化结果受输入、运行环境和测量条件影响,局部加速也可能伴随正确性问题或其他代价。验证需要独立于候选生成,避免系统持续沿着错误反馈优化;更充分的验证同时会占用时间和算力
- 跨芯片经验复用存在条件。不同芯片的工具链和运行特征存在差异,同一优化思路的收益也可能不同。可以复用的是问题分析、实验组织和验证方法,具体实现与效果仍需在目标环境中确认,经验整理也需要保留适用条件
- 局部效果与整体价值需要分别衡量。已有实践记录提供了算子级优化的基础,模型端到端收益、相对原有工作方式的投入变化仍需进一步验证。评估时还要计入模型调用、实验算力、专家参与和维护成本,避免仅凭单项最佳结果判断系统价值
演讲亮点
- 围绕长程任务的工程问题展开。以状态延续、反馈可信度和探索成本为主线,结合优化任务说明 Agent 持续执行时需要处理的问题与设计取舍
- 从真实硬件优化任务提炼系统设计。结合多种国产芯片上的算子优化记录,把系统讨论落到可执行、可验证的任务中,呈现环境差异、效果判断与专业知识带来的实际约束
- 解释职责分离的原因。结合探索方向需要变化、验证标准需要稳定这一矛盾,讨论职责分离如何约束错误反馈的累积,以及由此增加的协调和验证成本
- 从小团队的实际使用观察投入价值。结合团队与 Agent 共同推进优化任务的工作方式,讨论专业分工、人工参与和经验积累,帮助听众判断这类系统适合承担什么工作、值得投入到什么程度
听众收益
- 任务选择方法:了解哪些复杂任务适合由多 Agent 持续推进,以及如何从目标可验证性、实验反馈和资源投入判断采用条件
- 系统设计思路:了解长程任务中状态交接、独立验证、反馈更新和停止条件的设计思路,以及职责分离所解决的问题
- 价值评估视角:了解如何结合任务结果、人工投入、资源成本和复用情况评估系统价值,区分局部优化效果与整体交付收益
- 真实场景参考:通过同时包含加速和性能回退的匿名算子案例,理解硬件适配、验证条件和探索取舍对结果的影响