斑马智行

大模型推理部署实习生(端侧 GPU 方向)(J11582)

四川省·成都市、重庆市实习
29 天前发布2026/07/30
RESPONSIBILITIES

岗位职责

  1. 参与大语言模型(LLM)在端侧 GPU 平台上的推理加速研究与工程落地;

  2. 负责模型量化、蒸馏、算子优化、KV Cache 优化等加速技术的调研、复现与验证;

  3. 针对移动端 / 嵌入式 GPU(如 NVIDIA Jetson,Qualcomm、Intel等)进行性能 profiling 与瓶颈分析;

  4. 跟进大模型结构,MOE、Hybrid Attention、投机解码等前沿加速方案,完成 benchmark 与对比实验;

  5. 协助维护推理加速相关工具链与文档,沉淀实验结论。

REQUIREMENTS

任职要求

  1. 计算机科学、人工智能、电子工程等相关专业在读硕士/博士(优秀本科生亦可);

  2. 熟悉 Python,掌握 PyTorch,具备扎实的深度学习基础;

  3. 了解至少一种推理框架或加速工具(如 TensorRT、ONNX Runtime、llama.cpp、MLC-LLM、vLLM 等);

  4. 对模型量化(INT8/INT4/混合精度)、GPU 编程(CUDA / OpenCL / Metal)有一定了解者优先;

  5. 具备良好的英文文献阅读能力,能快速跟进 arXiv 最新论文;

加分项

  1. 有端侧部署、移动端推理优化实战经验;

  2. 熟悉 CUDA kernel 编写与性能调优;

  3. 在推理加速、模型压缩方向有论文发表或开源项目贡献;

  4. 熟悉 C/C++,有高性能计算背景。 每周可实习 ≥ 4 天,连续实习 ≥ 3 个月。

信息来自企业官方招聘渠道

OfferSeek 对公开岗位信息进行聚合、去重和结构化整理,最终申请以企业官方页面为准。