知乎
AI Infra 工程师(27届)
岗位职责
根据个人经验和团队方向,参与以下一个或多个方向: - 建设大模型预训练、微调及强化学习基础设施,支持多机多卡任务编排、资源调度、断点恢复和故障容错。 - 优化分布式训练性能,分析计算、通信、显存、数据读取和负载不均衡等瓶颈,提升 GPU 利用率与训练吞吐。 - 参与大模型推理服务和推理引擎研发,优化批处理、KV Cache、并行策略、模型加载、请求调度及显存管理。 - 建设 GPU 集群的任务调度、监控告警和可观测性能力,定位训练或推理过程中跨框架、网络、存储及硬件的复杂问题。 - 将重复的排障和交付过程沉淀为工具、自动化流程与工程规范,提升算法团队的实验和迭代效率。 - 跟进分布式训练、推理系统、AI 编译器和高性能计算方向的前沿工作,完成工程验证并推动落地
任职要求
计算机、软件工程、人工智能、电子工程或相关专业,本科及以上学历。 - 具备扎实的计算机基础,理解操作系统、计算机网络、数据结构、并发编程中的基本概念。 - 熟悉 Linux 开发环境,熟练使用 Python,并掌握 C++、Go、Rust 中至少一种语言。 - 使用过 PyTorch、JAX、PaddlePaddle 等至少一种深度学习框架,对大模型训练或推理流程有基本理解。 - 具备良好的工程能力,能够编写可维护的代码,并通过日志、监控、Profiler 和最小化实验定位问题。 - 对性能数据敏感,能够使用吞吐、延迟、显存、资源利用率、任务成功率等指标验证优化效果。 - 具备良好的学习能力、责任心和协作意识,愿意处理跨模型、框架与基础设施边界的复杂问题。 实践经验(满足以下任意一个方向即可,不要求全部具备): - 实现或优化过分布式训练、模型并行、数据并行或强化学习训练流程。 - 使用过 Megatron-LM、DeepSpeed、FSDP、Ray、verl 等训练或调度框架。 - 使用过 vLLM、SGLang、TensorRT-LLM 等推理框架,并做过吞吐、延迟或显存分析。 - 有 CUDA、Triton、算子融合、量化或其他 GPU 性能优化经验。 - 排查过 NCCL、RDMA、网络、存储或多机多卡训练问题。 - 使用 Kubernetes、Slurm 等系统管理过 GPU 任务,或建设过监控、容错与自动恢复能力。 - 有相关开源贡献、技术项目、竞赛成果或系统/机器学习方向的科研经历。 加分项 - 理解张量并行、流水线并行、数据并行、序列并行或专家并行等技术。 - 熟悉连续批处理、Paged Attention、KV Cache、量化、投机解码或计算通信重叠。 - 使用过 Nsight Systems、PyTorch Profiler、Prometheus、Grafana 等性能分析或可观测性工具。 - 对 GPU 架构、NCCL Collective、RDMA、GPUDirect 或高性能存储有实践经验。 - 在 PyTorch、vLLM、SGLang、Megatron-LM、DeepSpeed、verl 等项目中有贡献。 - 有 MLSys、OSDI、SOSP、NSDI、EuroSys、NeurIPS、ICML 等相关论文或高质量技术成果
信息来自企业官方招聘渠道
OfferSeek 对公开岗位信息进行聚合、去重和结构化整理,最终申请以企业官方页面为准。
