零跑汽车
校招- AI Infra工程师(J18092)
岗位职责
职位描述 本岗位为 AI Infra 算法岗位,下设三个方向,入职后根据专长与团队需求选择其中一个方向深入负责:
训练优化方向: - 负责分布式训练框架(如 PyTorch / FSDP / DeepSpeed / Megatron-LM)的使用与优化,提供易用的分布式训练启动、断点续训、容错恢复机制; - 深入应用分布式训练并行策略(数据并行 DP、张量并行 TP、流水线并行 PP、ZeRO 等),优化大模型训练中的显存管理与通信机制(NCCL); - 开展 GPU 高性能计算优化、并行计算优化、访存优化、低比特训练等前沿技术的探索与研究; - 使用 Profiling 手段分析定位并解决千卡分布式训练中的性能瓶颈,包括通信瓶颈、算子耗时与显存占用。
云端推理优化方向: - 负责云端推理框架的构建与优化,包括计算优化、通信优化、存储优化,构建高性能推理框架; - 应用并优化高性能推理框架(如 vLLM、TensorRT-LLM 等),持续优化推理性能; - 建立端到端的 Profiling 体系,提供吞吐量、首字延迟(TTFT)、显存峰值等核心指标的量化分析与优化建议。
算法工具链方向: - 设计并实现统一的 Python/CLI SDK,串联数据预处理、模型训练、评测、转换、部署的全生命周期; - 与 AI Infra 工程师协作,将底层复杂的调度、存储、网络能力,抽象为算法工程师"开箱即用"的 API; - 开发并维护训练性能诊断工具,协助算法团队分析千卡训练中的通信瓶颈、算子耗时与显存占用; - 沉淀预训练、SFT、RLHF 等场景的标准最佳实践与代码模板; - 建设模型版本管理、实验追踪、指标可视化、训练监控(训练进度、资源占用等)等周边配套工具。
任职要求
硕士及以上学历,计算机、人工智能、自动化、应用数学、电子、软件等相关专业;
扎实的计算机基础,熟练掌握 Python,熟悉异步/并发编程,具备良好的代码规范与工程化思维;熟悉 C++ 者优先(用于算子或引擎层面的调试与优化);
熟悉 Linux 开发环境与 Docker 容器化技术,熟练掌握 Shell/Makefile/CMake 等构建工具;
熟悉常见分布式训练并行策略(数据并行 DP、张量并行 TP、流水线并行 PP、ZeRO 等),了解大模型训练中的显存管理与通信机制(NCCL),熟悉 PyTorch、FSDP、DeepSpeed、Megatron 等主流分布式框架的使用和原理者优先;
熟悉高性能推理框架(如 vLLM、TensorRT-LLM 等),具备 GPU 高性能计算优化、并行计算优化、访存优化、低比特训练等相关经验者优先;
能深刻理解算法工程师在训练和部署中的痛点,具备将复杂工程问题抽象为简洁工具 API 的设计能力,以及出色的跨团队协作沟通能力;
有 ML/AI Infra 经验或模型开发与训练经验者优先;沟通协作好,主动性强,愿跨团队合作落地 AI 能力。
信息来自企业官方招聘渠道
OfferSeek 对公开岗位信息进行聚合、去重和结构化整理,最终申请以企业官方页面为准。