摩尔线程
AI应用推理引擎研发工程师(J10989)
RESPONSIBILITIES
岗位职责
欢迎加入摩尔线程!你将参与端侧推理框架性能加速、多类模型部署适配,协同算子与编译器团队定位性能瓶颈,输出系统级优化方案,保障推理框架在真实业务场景高效稳定交付。 岗位职责:
负责端侧大模型推理框架(如 vLLM、llama.cpp、MNN 等)的性能优化与加速,提升吞吐与降低延迟。
负责端侧语音、Embedding、OCR、AIGC、自动驾驶等模型在推理框架(如 ONNXRuntime、MNN 等)中的性能调优与部署适配。
与算子团队、编译器团队紧密协作,共同完成端侧高性能推理框架的集成、验证与交付。
深入分析推理链路性能瓶颈,设计并实现系统级优化方案,推动框架在真实场景中的高效稳定运行。
REQUIREMENTS
任职要求
计算机、电子信息等相关专业,本科及以上学历,欢迎基础扎实的在读同学投递。
了解 vLLM、llama.cpp、ONNXRuntime 至少一种推理框架的架构与工作机制,有阅读源码经历优先。
了解大模型推理主流加速技术(Flash Attention、Paged Attention、Speculative Decoding、Continuous Batching 等),有实践复现经历优先。
了解 GPU 并行编程,会使用 Triton/Cutlass 完成 Kernel 开发调优,理解 CUDA 内存管理与性能优化思路。
会使用 Nsight 等性能剖析工具,了解 CUDA Graph、Torch AOT 等优化技术。
【加分项】 深入掌握算子优化、编译器优化(MLIR、TVM)或 GPU 硬件架构知识 有端侧量化(W4A16、W4A8)调优、模型部署相关项目实践
信息来自企业官方招聘渠道
OfferSeek 对公开岗位信息进行聚合、去重和结构化整理,最终申请以企业官方页面为准。
