专题演讲嘉宾:杨学锐

阶跃星辰语音模型负责人

杨学锐,历任阶跃星辰语音模型负责人,大疆创新音频负责人,云从科技语音算法负责人。在相关领域深耕多年,发表论文、专利、书籍若干。

by 杨学锐

阶跃星辰
语音模型负责人

在大语言模型(LLM)迅猛发展的时代,语音技术正迎来新一轮变革。本次演讲将系统梳理语音模型从传统架构走向端到端融合的演进路径,深入分析语音表征的不同形式与模型设计的关键思路,涵盖语义与声学 token 的权衡、多尺度解码结构、训练策略等重要议题。同时,我们也将直面实践中诸如数据差异、推理效率、模态对齐等核心挑战,并分享以 Step-Audio2 为代表的先进端到端语音模型在实际部署与落地中的实践经验。无论您是对语音技术前沿感兴趣的研究者,还是关注语音大模型落地应用的工程师,本次演讲都将为您提供有价值的技术洞察与实践参考。

演讲提纲

1. 语音技术在 LLM 时代的演进

  • 传统语音模型的发展与局限
  • LLM 时代为语音模型带来的新范式
  • 端到端语音模型的必要性与优势

2. 端到端语音模型关键技术

  • 语音表征
    • 连续表征 vs 离散表征
    • Semantic Token vs Acoustic Token
  • 模型架构
    • 级联 vs 半端到端 vs 端到端
    • Audio Decoder 结构剖析
    • 文本模态对齐机制
    • 全双工机制
    • 外部知识接入和模型规划执行
  • 训练策略:Pretrain → Midtrain → SFT → RL 的全流程优化

3. 如何评估端到端语音模型

  • 音频理解能力评估
  • 语音合成质量评价
  • 对话交互的自然性与一致性

您认为,这样的技术在实践过程中有哪些痛点?

  • 语音数据的采集、处理与合成相较于文本模态更为复杂,质量控制和标注成本高昂
  • 语音 token 率远高于文本,导致序列长度急剧增加,对模型架构设计与推理效率提出严峻挑战
  • 如何在跨模态对齐中兼顾语言理解与情感表达,确保模型兼具“智商”与“情商”,仍是一个开放问题

演讲亮点

  • 以 Step-Audio2 为例,分享 SOTA 端到端语音模型的使用、部署与落地最佳实践
  • 揭秘模型设计背后的一线 know-how

听众收益

  • 深入了解语音 LLM 的前沿技术发展趋势
  • 获得端到端语音模型从理论到实践的系统知识,助力相关研发与应用落地

交通指南

上海浦东滨江喜来登酒店

SHERATON SHANGHAI PUDONG RIVERSIDE
地址:上海浦东大道2288号
  • 微信咨询

  • 电话咨询

    联系电话:+86 18514549229

微信联系我们

如您在购票过程中遇到问题,请扫码咨询票务小助手