文远知行
AI Infra训练平台工程师【2027届校招】
岗位职责
分布式训练框架开发:参与大规模分布式训练任务的调度、编排与执行框架开发,支持数据并行、模型并行、流水线并行及混合并行策略。 训练性能极致优化:基于 PyTorch 2.x / Torch Compile / Triton 进行训练性能分析与优化,探索 FP8 混合精度、自定义 CUDA 算子、通信计算重叠等前沿加速方案。 训练稳定性保障:构建训练故障自动检测与恢复机制(慢节点定位、RDMA 异常检测、Checkpoint 智能管理),保障千卡任务长期稳定运行。 数据与存储优化:优化海量训练数据(视频、点云、图像)的预处理 Pipeline 与存储读取性能,降低数据加载对GPU利用率的影响。 GPU 集群资源调度:参与基于 Kubernetes 的 GPU 虚拟化与调度平台建设,提升集群资源利用率与任务并发度
任职要求
2027届本科及以上学历,计算机科学、软件工程、人工智能等相关专业。 扎实的编程功底,熟练掌握 Python / C++,具备良好的代码风格与工程素养。 熟悉深度学习框架(PyTorch 优先),了解分布式训练基础概念(DDP / FSDP / Megatron)。 对计算机体系结构有基本理解(CPU / GPU 架构、内存层次、缓存机制)。 具备良好的问题分析能力、自驱力和团队协作意识。 加分项 有 CUDA / NCCL 编程或性能优化经验,熟悉 GPU 内存带宽与计算吞吐量分析。 了解 Kubernetes 及容器化技术,有 GPU 集群使用或运维经验。 熟悉 PyTorch 编译器(TorchDynamo / Inductor / Triton)或参与过相关开源贡献。 有 ACM/ICPC、NOI 等竞赛经历,或发表过系统方向(OS、分布式、体系结构)论文
信息来自企业官方招聘渠道
OfferSeek 对公开岗位信息进行聚合、去重和结构化整理,最终申请以企业官方页面为准。
