大疆集团
大模型推理部署算法工程师(北京)
RESPONSIBILITIES
岗位职责
负责大模型量化、剪枝、蒸馏、稀疏化等模型压缩算法在端-边-云多端的落地;
负责高性能算子开发、推理图优化与多硬件后端适配;
负责推理服务治理,包括动态批处理、多模型调度、显存/算力复用等关键能力;
牵引模型与自研芯片的垂直整合,参与下一代芯片的算法侧需求定义。
REQUIREMENTS
任职要求
基本要求
计算机、电子、自动化等相关专业,硕士及以上学历;
扎实的 C++/CUDA/Python 工程能力,熟悉至少一种主流推理框架(TensorRT/TensorRT-LLM/vLLM/TVM/MNN/NCNN/llama.cpp);
在模型量化(INT8/INT4/FP8)、剪枝、蒸馏、稀疏化任一方向有实战经验;
理解 Transformer、Diffusion、VLM 模型结构与典型推理瓶颈。 加分项
MLSys/OSDI/ASPLOS/SC/CVPR/NeurIPS 等顶会一作论文,或主流推理框架核心贡献者;
在手机、平板、端侧 NPU 或自研芯片上完成过大模型量产部署;
熟悉 PagedAttention/FlashAttention/Speculative Decoding/KV-Cache 优化等 LLM 推理前沿;
有自定义 GPU/NPU 算子开发或编译器(TVM/Triton/MLIR)二次开发经验。
信息来自企业官方招聘渠道
OfferSeek 对公开岗位信息进行聚合、去重和结构化整理,最终申请以企业官方页面为准。
