宁德时代
算力运营工程师
RESPONSIBILITIES
岗位职责
负责GPU集群的日常运维:硬件巡检、故障排查、固件升级
建设自动化运维体系:Ansible/Terraform部署、自动化健康检查
管理RHEL9/Ubuntu OS环境,维护CUDA/Driver/NCCL版本矩阵
设计并实施集群网络架构(InfiniBand/RoCE)的运维方案
制定并执行灾备与数据恢复预案
REQUIREMENTS
任职要求
3年以上大规模Linux集群运维经验
熟悉GPU服务器硬件(NVLink/NVSwitch/HBM故障诊断)
精通Ansible/Terraform等自动化工具
熟悉InfiniBand/RoCE高性能网络
有RHEL9 + CUDA环境维护经验,了解DCGM/NVSM
信息来自企业官方招聘渠道
OfferSeek 对公开岗位信息进行聚合、去重和结构化整理,最终申请以企业官方页面为准。
