普渡机器人
【AI Infra】基础架构工程师(SRE)(J12900)
RESPONSIBILITIES
岗位职责
做什么: 负责 GPU 算力集群的调度、运维与优化,以及阿里云资源的维护与管理,为模型训练和数据处理提供稳定、高效、弹性的算力基础设施。
核心职责: - GPU 集群(H20 等)部署、运维与资源调度系统建设 - 分布式训练环境搭建(NCCL 网络优化、RDMA 配置、Checkpoint 自动保存与恢复) - 阿里云资源维护与混合云架构设计(弹性伸缩、成本优化) - 集群级监控体系与告警策略,容量规划支撑算力增长
REQUIREMENTS
任职要求
任职要求: - 计算机/软件工程 等相关专业,本科及以上 - 熟悉 Linux 系统、网络(TCP/IP/RDMA)、存储原理 - 熟悉 Kubernetes,有 GPU 集群调度基础 - 了解阿里云/AWS 等公有云资源管理 - 熟悉监控告警体系(Prometheus/Grafana/ELK)
加分项: - 大规模 AI 训练集群(千卡级)运维经验 - NCCL/MPI 分布式通信库与网络拓扑优化经验 - 基础设施即代码(Terraform/Pulumi)实践
信息来自企业官方招聘渠道
OfferSeek 对公开岗位信息进行聚合、去重和结构化整理,最终申请以企业官方页面为准。
