懂车帝
大模型Infra实习生
岗位职责
团队定位:为公司模型迭代提供基建与保障,降本增效——降低算力成本,提高模型开发效率。 为什么投递:加入大模型 Infra 团队,参与千卡 GPU 集群上的真实工程问题;实习生将配备正式员工 mentor,在以下三个方向之一(或跨方向)承担有完整交付物的项目,而是作为正式项目的 owner 之一推进落地。 岗位方向:训推平台/后训练/推理等方向都在招聘中~! 方向一:训推平台开发
负责 AGI Hub 平台的架构与工程开发,以及平台全生命周期管理,高效支持大模型的数据、训练、评估、部署等算法业务,oncall 响应算法业务的定制开发需求,联动算法、产品、测试完成版本迭代交付;
参与自动化工具链(CLI、Skill 等)的开发,降低算法同学使用平台的门槛;
参与 GPU 算力的运营与治理:使用统计、利用率分析、成本核算相关的工具开发。 方向二:Post-Train Infra 开发
参与后训练框架的开发与优化:SFT / DPO / GRPO 任务的工程落地、通用组件沉淀;
参与训练稳定性保障:复现并定位算法同学遇到的 OOM、通信 hang、框架参数问题,沉淀排障手册;
参与训练效率优化:在 mentor 指导下做显存、吞吐、通信维度的 profiling 与优化实验。 方向三:推理 Infra 开发
参与大模型推理服务的部署、压测与性能基线建设,做到「上线即有数」;
参与推理加速技术的调研与验证:量化(FP8 / W8A8)、投机解码、KV cache 优化等前沿方案的复现与效果评估;
参与推理服务的监控告警、利用率治理等稳定性体系的建设。
任职要求
计算机、人工智能等相关专业在读(本科/硕士/博士均可),能保证每周出勤 4 天及以上,且能够连续 4 个月及以上;
扎实的编程基础:熟练掌握 Python,代码工程化习惯良好,了解 Linux 环境与 Git 协作流程;
扎实的机器学习 / 深度学习基础,熟悉 PyTorch,理解 Transformer 架构,对大模型训练或推理的基本流程有概念;
对大模型 Infra 方向有真实热情:跑过开源大模型的训练或推理、读过 SGLang / vLLM / Megatron / DeepSpeed 等框架的文档或源码者优先;
自驱、能啃问题:面对一个没有现成答案的报错或性能问题,愿意沉下去查日志、读源码、做实验。
加分项
有 GPU / CUDA 编程经验,或在训练 / 推理框架开源社区有过 issue、PR 等实质性参与;
有 Kubernetes、容器、分布式系统的课程项目或实战经验;
跑通过 RL 后训练(PPO / GRPO / Agentic RL)实验,或做过推理引擎的性能调优实验;
有 AIGC(图像 / 视频生成模型)相关的部署或开发经验;
参加过 ACM / 超算竞赛(ASC / ISC)等工程类竞赛并获奖。
信息来自企业官方招聘渠道
OfferSeek 对公开岗位信息进行聚合、去重和结构化整理,最终申请以企业官方页面为准。