作为搜推广业务稳定性负责人,负责并参与到搜推广业务稳定性建设,长期从事搜索、推荐、广告等核心业务的稳定性与架构治理,负责 AI 核心链路的可靠性工程建设,覆盖模型、推理框架、GPU 算力与成本治理等方向。近年来聚焦 AI-in-SRE 体系实践,推动 AI 系统从“可用”走向“可控、可规模化”,探索 SRE Agent 与 AI 系统自演进能力建设。

作为搜推广业务稳定性负责人,负责并参与到搜推广业务稳定性建设,长期从事搜索、推荐、广告等核心业务的稳定性与架构治理,负责 AI 核心链路的可靠性工程建设,覆盖模型、推理框架、GPU 算力与成本治理等方向。近年来聚焦 AI-in-SRE 体系实践,推动 AI 系统从“可用”走向“可控、可规模化”,探索 SRE Agent 与 AI 系统自演进能力建设。
在小红书业务中随着 AI 成为搜索、推荐、广告等核心业务的主链路,系统稳定性面临的挑战已发生本质变化:模型异常不再只是效果波动,而是直接导致业务不可用;GPU、推理框架和模型本身,正在成为生产系统的一部分。在这样的背景下,SRE 的角色也必须进化。
本次分享我将介绍一种新的理念——AI-in-SRE Loop:AI 不只是用于告警和运维辅助,而是深度参与 SRE 的全生命周期决策,从事前预防、事中感知与定位,到事后学习与策略演进。希望为正在或即将进入 AI 规模化阶段的团队,提供一套可落地的工程路径。
演讲提纲
一、AI 系统稳定性:为什么“完全不一样”
1. AI 不稳定性的来源变化
2. 故障的“裂变方式”发生改变
3. 最真实的约束:资源与成本
二、AI-in-SRE Loop:一种新的稳定性范式
三、26 年 AI 应用的核心工程建设
1. AI 核心链路稳定性工程
2. 大模型可观测体系(SRE 的眼睛)
3. GPU 与异构算力稳定性治理
4. 智能拦截变更
四、SRE Agent:SRE 的“代理人”
五、总结:SRE 没有被 AI 替代,但 SRE 正在升级为AI 系统的可靠性工程师
您认为,这样的技术在实践过程中有哪些痛点?
1. 指标定义难
2. 自动化执行的信任问题
3. 成本与稳定性的天然冲突
4. 组织层面的阻力
演讲亮点
听众收益
1. 对 SRE / 架构师
2. 对 AI 平台 / 模型团队
3. 对技术管理者



微信咨询

电话咨询
微信联系我们

