宁德时代
推理服务研发工程师
岗位职责
负责大模型推理引擎的工程化与性能优化,核心技术方向包括:PD分离架构、多级KVCache缓存、投机解码、MTP加速 设计并实现分层KVCache管理系统,研发智能淘汰策略与预取机制,持续提升缓存命中率 开发高性能推理引擎,涵盖Continuous Batching、动态Batch Size调整、混合精度推理、多种并行策略 基于GPU/AI芯片,设计、开发和优化底层高性能算子库,针对大模型算法(Transformer、MoE等)进行算子级性能优化 针对不同硬件平台(NVIDIA GPU、华为昇腾NPU、国产加速卡)进行算子适配与性能调优,包括Attention算子、GEMM、通信原语等 建设推理服务的Benchmark体系,覆盖吞吐量、首Token延迟(TTFT)、生成延迟(TPOT)、MFU等核心指标 保障推理服务的高可用性,设计并实现秒级故障检测与自愈机制
任职要求
计算机科学、人工智能、电子工程等相关专业本科及以上学历,3年以上深度学习系统、推理引擎或高性能计算开发经验 精通C++和CUDA编程,深入理解GPU硬件架构(SM、Warp调度、内存层次、TensorCore) 深入理解Transformer架构的推理计算流程,熟悉vLLM、SGLang、TensorRT-LLM、TGI中至少一种框架的原理与实现 掌握KVCache优化(PagedAttention/RadixAttention)、FlashAttention、量化推理(GPTQ/AWQ/SmoothQuant)等关键技术 熟悉深度学习框架(PyTorch/TensorFlow)底层原理,有Kernel开发能力 具备性能分析与优化能力(Nsight Systems/Nsight Compute/PyTorch Profiler) 能够借助AI辅助工具加速开发,快速掌握新硬件平台与新技术栈 加分项 有PD分离、Disaggregated Serving架构的生产实战经验 向vLLM/SGLang/FlashAttention等开源项目贡献过代码 熟悉国产AI芯片(昇腾/摩尔线程)的推理适配与算子开发 有AI编译器开发经验 有Mooncake的使用经验 有RDMA/NVLink等高速互联场景下的分布式推理经验
信息来自企业官方招聘渠道
OfferSeek 对公开岗位信息进行聚合、去重和结构化整理,最终申请以企业官方页面为准。
