普渡机器人
AI Infra工程师(基础架构)(J12892)
RESPONSIBILITIES
岗位职责
GPU算力集群建设与管理:GPU集群(A100/H100等)选型、采购、部署与运维;建设集群资源调度系统(弹性调度、优先级管理、资源隔离);优化集群利用率
训练基础设施搭建:分布式训练环境(NCCL网络优化、RDMA配置、存储对接);训练任务自动化运维(故障自愈、Checkpoint自动保存与恢复、日志聚合);大规模训练网络拓扑与通信优化
阿里云资源维护与成本优化:阿里云资源日常维护与监控;设计混合云架构(本地+云弹性伸缩);持续优化云资源成本(Spot实例、自动扩缩容)
监控告警与稳定性建设:集群级监控体系;告警策略与故障响应机制;容量规划支撑3-5年算力增长
REQUIREMENTS
任职要求
计算机科学、软件工程等相关专业,本科及以上学历,3年以上基础设施/SRE/DevOps经验
熟悉Linux系统、网络(TCP/IP/RDMA)、存储(NFS/Lustre/Ceph)原理与调优
熟悉Kubernetes,有GPU集群调度(Volcano/Yunikorn)或自研调度器经验
熟悉阿里云/AWS/GCP等公有云资源管理,有云成本优化经验
熟悉监控告警体系(Prometheus/Grafana/ELK),有大规模集群运维经验
具备从0到1搭建算力基础设施经验
良好的问题排查能力
信息来自企业官方招聘渠道
OfferSeek 对公开岗位信息进行聚合、去重和结构化整理,最终申请以企业官方页面为准。
