宁德时代
算力调度研发工程师
RESPONSIBILITIES
岗位职责
设计并开发大规模GPU集群调度系统核心模块,包括但不限于:任务队列管理、资源分配引擎、训推混部调度、弹性伸缩控制面 研发拓扑感知调度策略,基于GPU互联拓扑进行亲和性调度与通信优化,最大化集群吞吐 构建多集群联邦调度能力,实现跨集群潮汐弹性、资源迁移与独享/共享池的动态划分 设计算力超卖与分时复用机制,结合动态Buffer控制与SLA保障体系,实现用户无感的秒级扩缩容 参与异构芯片(NVIDIA、华为昇腾、国产GPU/NPU/ASIC)的统一资源抽象与调度适配 构建调度系统的可观测性,包括调度延迟、队列深度、资源碎片率等核心指标的采集与分析 构建自动化异常检测系统,参与大规模训练/推理系统的故障诊断与根因分析
REQUIREMENTS
任职要求
计算机科学、软件工程等相关专业本科及以上学历,3年以上分布式系统或云原生平台开发经验 精通Go/C++/Python中至少一门语言,具备高并发、低延迟系统的设计与实现能力 深入理解Kubernetes调度体系,有大规模K8s集群(千节点以上)的开发或运维经验 熟悉GPU资源管理技术(MIG/MPS/vGPU/显存隔离/拓扑感知),理解GPU集群的网络拓扑与通信模式 了解主流AI调度框架(Volcano、KubeFlow)的设计思想与实现原理 良好的工程素养,重视代码质量、系统可测试性与可观测性 善于利用AI辅助工具提升开发与调试效率 加分项 有万卡以上规模GPU集群调度系统的设计或开发经验 深入理解训推混部、Gang Scheduling、Spot/抢占式实例、算力超卖等场景 有智算中心或头部云厂商AI Infra团队工作经历 有CUDA/NCCL/UCX通信库开发经验
信息来自企业官方招聘渠道
OfferSeek 对公开岗位信息进行聚合、去重和结构化整理,最终申请以企业官方页面为准。
