当前任职蚂蚁可观测技术架构师,参与或负责了产品/告警/计算/元数据等在内的可观测全技术栈建设,对于大型大规模软件系统有丰富的性能优化经验。最近两三年主要重心在大模型领域,包括面向可观测的 Agent 建设,以及推理引擎深度可观测体系构建。

当前任职蚂蚁可观测技术架构师,参与或负责了产品/告警/计算/元数据等在内的可观测全技术栈建设,对于大型大规模软件系统有丰富的性能优化经验。最近两三年主要重心在大模型领域,包括面向可观测的 Agent 建设,以及推理引擎深度可观测体系构建。
2025 年,Qwen/Deepseek 等为代表的开源模型能力接近闭源模型,vLLM/SGLang 等为主流推理引擎的飞速进化使得推理成本大幅下降,掀起了全年 Agent 应用的火爆。大模型驱动的推理链路,呈现出多语言,异构技术栈等复杂特性,原有的微服务可观测体系存在明显盲区,全链路全栈可观测性面临巨大挑战。对于链路中关键节点推理引擎,传统请求粒度的 Trace 无法下探 Token 粒度生成过程,让引擎相关的性能优化以及生产稳定性定位困难重重。在此背景下,蚂蚁可观测团队率先构建了业界首个覆盖全链路、全栈、Token 级的深度可观测体系,将可观测性从宏观请求下沉至微观 Token 维度,实现对推理全过程的白盒化透视。我们不仅实现了对每个 Token 生成过程及候选概率分布的精细化观测,还创新地引入多请求并发分析能力,分析多租户请求间的干扰。该体系已在生产大规模稳定运行,观测开销控制在千分点,问题定位效率提升 10 倍以上,填补了社区空白。本次演讲我将系统分享我们在大模型推理可观测性领域的前沿探索与工程实践,涵盖核心架构设计、关键技术突破、典型场景案例及未来演进方向,为行业构建下一代 AI 基础设施提供可复用的方法论与技术参考。
演讲提纲
1. 大模型时代 - 可观测性面临范式重构
2. 从业务到引擎 - 全栈全链路架构与核心技术
3. 引擎显微镜 - Token 级深度可观测
4. 引擎广角镜 - 多请求并发分析
5. 社区贡献:覆盖三大主流引擎,形成 Trace 统一可观测标准
6. 总结与展望
您认为,这样的技术在实践过程中有哪些痛点?
深入引擎内部埋点,覆盖多个主流引擎/异构硬件,维护成本较高。
演讲亮点
业界首个覆盖多引擎、Token 级的深度可观测 Trace,将可观测性从宏观请求下沉至微观 Token 维度,实现对引擎内部 Token 生产过程的白盒化透视。在生产环境大规模运行,实时采集,观测开销控制在千分点。
听众收益



微信咨询

电话咨询
微信联系我们

