卓识基金
机器学习平台运维工程师(SRE+K8S)
岗位职责
负责 Kubernetes/Slurm 计算集群及关键依赖的稳定性建设,建立覆盖控制面、节点、GPU、容器运行时、网络和存储的监控、告警与故障闭环。 建设节点与设备健康体系,采集主机、进程、驱动、GPU、网络和存储信号,维护健康状态,推动异常节点 Cordon/Taint、任务保护、隔离、维修和恢复流程自动化。 建设训练、回测和交互式任务的运行链路可观测能力,完善日志、指标、事件、追踪、心跳与进度信号,区分用户代码、平台、调度和基础设施故障。 制定并落地 SLI/SLO、容量与水位管理、变更治理、灰度发布、应急预案、故障复盘及重复问题治理机制。 使用 Go/Python 开发巡检、诊断、修复和运营工具,必要时开发 DaemonSet、Node Agent、Controller 或系统级 Agent,形成可审计的自动处置闭环。 参与 GPU 节点生命周期与软件栈治理,包括驱动、Container Toolkit、Device Plugin、GPU Operator、DCGM 及相关版本兼容和升级。 与 MLP-Infra、MLE-Infra、网络、存储和安全团队协作,推动跨模块问题定位及平台演进
任职要求
双一流本科及以上学历,计算机科学、软件工程、数学等相关专业;具备 Kubernetes 集群、云基础设施、SRE 或相关实习经验。 深入理解 Linux、进程/线程、内存、文件系统、网络、cgroup/namespace 和容器运行机制,具备生产故障排查经验。 熟悉 Kubernetes 核心组件与 Pod/Node 生命周期,能够定位不可调度、驱逐、镜像、运行时、DNS/CNI、CSI 等常见问题。 熟练使用 Go 或 Python 中至少一门语言,能够独立开发可靠的自动化工具、Agent 或平台模块,而非只编写临时脚本。 熟悉 Prometheus、Grafana、日志平台或 OpenTelemetry 等可观测体系,能够基于指标、日志、事件和现场证据进行归因。 熟悉容量、变更、告警、应急和故障复盘方法,具备将人工操作平台化、幂等化和可审计化的意识。 具备良好的问题拆解和跨团队沟通能力,能够在信息不完整的线上环境中建立证据链并推动问题闭环。 加分项 有大规模 GPU/异构计算集群生产运维经验,熟悉 NVIDIA Driver、Xid、NVLink、MIG、DCGM、GPU Operator 等。 熟悉 RDMA/InfiniBand/RoCE、NCCL、CNI/CSI、共享文件系统、对象存储,并处理过相关故障。 有 eBPF、systemd Agent、DaemonSet/特权容器或主机级观测工具开发经验,理解宿主机采集的权限和安全边界。 熟悉 Slurm、Kueue、Volcano 或批处理/训练任务调度,理解长任务、Gang Scheduling 和 Checkpoint 对故障恢复的影响。 有节点自动隔离/恢复、故障诊断平台、混沌工程或大规模容量治理经验
信息来自企业官方招聘渠道
OfferSeek 对公开岗位信息进行聚合、去重和结构化整理,最终申请以企业官方页面为准。