斑马智行
大模型推理部署实习生(端侧 GPU 方向)(J11582)
RESPONSIBILITIES
岗位职责
参与大语言模型(LLM)在端侧 GPU 平台上的推理加速研究与工程落地;
负责模型量化、蒸馏、算子优化、KV Cache 优化等加速技术的调研、复现与验证;
针对移动端 / 嵌入式 GPU(如 NVIDIA Jetson,Qualcomm、Intel等)进行性能 profiling 与瓶颈分析;
跟进大模型结构,MOE、Hybrid Attention、投机解码等前沿加速方案,完成 benchmark 与对比实验;
协助维护推理加速相关工具链与文档,沉淀实验结论。
REQUIREMENTS
任职要求
计算机科学、人工智能、电子工程等相关专业在读硕士/博士(优秀本科生亦可);
熟悉 Python,掌握 PyTorch,具备扎实的深度学习基础;
了解至少一种推理框架或加速工具(如 TensorRT、ONNX Runtime、llama.cpp、MLC-LLM、vLLM 等);
对模型量化(INT8/INT4/混合精度)、GPU 编程(CUDA / OpenCL / Metal)有一定了解者优先;
具备良好的英文文献阅读能力,能快速跟进 arXiv 最新论文;
加分项
有端侧部署、移动端推理优化实战经验;
熟悉 CUDA kernel 编写与性能调优;
在推理加速、模型压缩方向有论文发表或开源项目贡献;
熟悉 C/C++,有高性能计算背景。 每周可实习 ≥ 4 天,连续实习 ≥ 3 个月。
信息来自企业官方招聘渠道
OfferSeek 对公开岗位信息进行聚合、去重和结构化整理,最终申请以企业官方页面为准。
