新浪&微博
大模型推理引擎工程师
RESPONSIBILITIES
岗位职责
负责大模型推理引擎的性能优化与能力建设,持续提升吞吐、降低推理时延和成本。
跟踪并借鉴 SGLang、vLLM、TensorRT-LLM 等业界推理框架的先进技术,结合业务场景完成方案设计、开发与落地。
参与大模型推理平台的架构设计与开发,建设高性能、高可用、可观测的推理服务能力,支撑模型与业务规模化落地。
面向实际业务中的性能、稳定性和资源效率问题,完成定位、分析、优化与持续迭代。
与业务团队协作,推动推理优化方案高效落地,并沉淀工程规范与技术文档
REQUIREMENTS
任职要求
计算机基础扎实,熟练掌握 Python/C++ 语言,具备良好的系统软件设计、开发和调试能力。
熟悉计算机体系结构、操作系统、并发与并行计算等基础知识,理解 GPU 计算与内存层次结构。
熟悉 GPU 软件栈,具备 GPU 性能分析和优化经验;熟悉 CUDA 编程,并有 Triton、CUTLASS 或 GPU 算子开发经验者优先。
熟悉至少一种主流大模型推理引擎或框架,如 SGLang、vLLM、TensorRT-LLM 等;理解 KV Cache、各种并行策略、量化或推测解码等推理关键技术者优先。
具备良好的问题分析和解决能力,有较强的责任心、协作意识及技术推动能力。
加分项
有高性能推理引擎、深度学习框架、编译器或 GPU 算子开发经验。
有大规模在线服务、分布式系统或云原生推理平台建设经验。
熟悉模型量化、MoE、长上下文、多模态或推测解码等推理优化方向。
有开源项目贡献、技术博客或相关论文成果
信息来自企业官方招聘渠道
OfferSeek 对公开岗位信息进行聚合、去重和结构化整理,最终申请以企业官方页面为准。
