2012 年毕业后入职百度,2015 年跟随作业帮分拆出来至今,见证了作业帮初创至今十年的发展历程,经历了 OCR 和检索系统从 0 到 1 并持续迭代优化的全过程,主要参与工程架构方向的工作,重点对系统的性能和稳定性负责。

2012 年毕业后入职百度,2015 年跟随作业帮分拆出来至今,见证了作业帮初创至今十年的发展历程,经历了 OCR 和检索系统从 0 到 1 并持续迭代优化的全过程,主要参与工程架构方向的工作,重点对系统的性能和稳定性负责。
作业帮的 OCR 与检索系统自 2015 年上线以来,一直为作业帮各项业务提供高效算法能力支持。然而,随着流量、数据规模和业务形态的不断增长,原有召回引擎虽在时延和吞吐上有优势,但在容量及功能上的瓶颈逐渐显现。
从 2020 年开始,我们探索了多种优化方案,包括在原有系统上持续迭代、尝试自研替换,以及最终使用开源替换。新系统上线后,业务实现了 40% 以上的成本节省,系统能力天花板大幅提升。这一过程不仅推动了 Havenask 项目的开源,也为相关技术选型提供了新方案,通过大规模系统落地验证了其可用性和可靠性。
本次演讲我将分享作业帮 OCR 与检索系统在面对业务增长和技术瓶颈时的优化历程,包括选择和推动开源项目 Havenask 的落地,以及通过技术优化实现性能提升的实践经验,为 AI 时代下的检索系统选型提供参考。
演讲提纲
1. 结果很重要:十年系统能力重塑,拥抱 AI 时代
2. 面对的问题
3. 思路和决策
4. 实践过程
5. 总结
您认为,这样的技术在实践过程中有哪些痛点?
演讲亮点
听众收益



微信咨询

电话咨询
微信联系我们

