卓识基金
机器学习平台开发工程师(Go+K8S)
岗位职责
参与投研计算平台及集群基础设施的架构设计与研发,建设资源模型、配额、队列、优先级、准入和多集群接入等核心能力。 基于 Go 和 Kubernetes 开发或维护 CRD、Controller、Operator、Webhook、调度扩展及相关平台服务,保证状态流转、幂等、失败恢复和可观测性。 建设 GPU/CPU 资源管理能力,包括资源建模、队列、优先级、抢占、空闲资源借用、拓扑约束、碎片治理和容量规划。 建设调度与资源治理能力,包括 ResourceFlavor/拓扑、Gang Scheduling、资源碎片、GPU 共享或切分、异构资源和容量建模。 建设声明式状态管理与可观测能力,保证 Controller 在重复事件、进程重启、API 超时和部分失败下能够最终收敛。 为交互式开发、Python/回测、单机/分布式训练和 GPU 作业提供一致的资源与运行抽象,并与任务控制面和用户入口贯通。 建设训练/回测任务控制面、交互式开发环境、权限、镜像、日志指标和产物等平台能力,把底层资源组织成稳定的用户运行体验。 与 MLP-SRE、MLE-Infra、存储、网络和安全团队协作,明确组件边界并推动平台持续演进
任职要求
双一流本科及以上学历,计算机科学、软件工程、数学等相关专业;具备 Kubernetes 平台、云原生基础设施、调度/资源平台或相关实习经验。 精通 Go,具备扎实的数据结构、算法、并发编程和工程设计能力,能够独立负责生产级模块的设计、开发、测试和交付。 深入理解 Linux、容器及 Kubernetes 核心机制,熟悉 Docker/containerd、Pod 生命周期、调度、资源隔离、网络和存储等基础能力。 在 CRD/Controller/Operator、Kubernetes 调度、资源管理、多集群、云平台控制面或真实训练任务平台中至少一个方向具备生产级开发深度。 熟悉分布式系统基本原理,能够处理状态一致性、幂等、并发、重试、超时和故障恢复等工程问题。 熟悉 MySQL、Redis 或同类存储组件,能够根据平台元数据、状态和一致性要求完成合理的数据模型与存储设计;不要求特定使用 MongoDB。 理解训练/回测任务的基本运行链路,能够区分平台任务、Kubernetes/Slurm 作业、容器状态和用户进程状态。 具备优秀的问题定位、逻辑拆解和跨团队沟通能力,能够基于日志、指标和现场证据推动问题闭环。 加分项 有大规模 GPU/异构计算集群平台建设经验,熟悉 NVIDIA Device Plugin、GPU Operator、MIG、DCGM 或其他设备资源接入机制。 熟悉 Kueue、Volcano、Kubernetes Scheduler Framework、Slurm 等队列或调度系统,并有二次开发经验。 有多集群、多租户、资源配额、抢占、拓扑感知调度或 GPU 共享/切分实践。 熟悉 CNI/CSI、共享文件系统、对象存储、RDMA/InfiniBand/RoCE,或处理过相关生产故障。 有 Prometheus、OpenTelemetry、Kubernetes Events 或 Controller 指标体系建设经验。 熟悉机器学习训练或量化计算工作负载,能够理解 PyTorch 分布式训练、NCCL、Checkpoint 和数据访问对集群的要求。 有 Notebook/远程开发环境、镜像治理、任务状态机、日志指标、共享存储、对象存储、Checkpoint 或产物管理经验
信息来自企业官方招聘渠道
OfferSeek 对公开岗位信息进行聚合、去重和结构化整理,最终申请以企业官方页面为准。