华为
AI算力调度专家
岗位职责
调度系统架构设计:设计并实现大规模分布式调度系统,支持多代际、异构算力(NPU/CPU)的统一管理与拓扑感知调度。
多目标调度策略设计:设计并实现多目标协同优化调度算法,综合考虑任务排队时长、资源利用率、算力成本等指标,实现动态平衡与自适应调度。
智能调度策略实现:开发负载感知的自定义调度器插件,优化资源利用率与作业性能。
多场景调度优化: 4.1 训练场景:实现拓扑感知调度(HCCS/UB总线)、RDMA网络带宽保障、数据局部性调度,优化Checkpoint读写路径。 4.2 推理场景:开发镜像预热与分布式缓存策略,支持弹性扩缩容与资源超卖,保障SLO的同时提升资源复用率。 4.3 RL沙箱场景:设计任务协同调度机制,动态调整模拟环境与推理实例的资源配比,优化网络通信延迟,高效管理缓冲区存储。
多租户资源管理:实现配额管理、公平调度、抢占策略,保障多团队业务SLO。
调度性能优化:持续优化调度吞吐、调度延迟和资源碎片,支持万卡级集群规模。
任职要求
专业方向与研究背景
计算机科学、分布式系统或相关专业硕士及以上学历(博士优先)。
研究方向为分布式系统、高性能计算、操作系统、计算机体系结构,在资源调度、异构计算、多目标优化、运筹优化、存储/网络/镜像调度等领域有深入积累。
在OSDI、SOSP、EuroSys、ASPLOS、SC、HPDC、INFOCOM、ICAPS等顶会发表过论文者优先。 知识要求
深入理解Kubernetes调度框架(Scheduling Framework)或Slurm调度原理,有自定义调度器开发经验。
熟悉主流AI芯片架构(NVIDIA/AMD/昇腾)及其性能特征,理解GPU拓扑对通信的影响。
了解分布式一致性协议(Raft/Paxos)、资源分配算法(DRF/优先级抢占)。
熟悉多目标优化算法(如加权和、帕累托优化、强化学习调度),了解排队论、约束满足问题等理论基础。
熟悉成本模型,了解Spot实例、预留实例、按需实例的定价机制与成本优化策略。
熟悉容器镜像原理(Layer、Snapshotter)、镜像分发加速技术(P2P、预热、缓存)。
了解RDMA、RoCE、拥塞控制等网络基础知识,有高性能网络调优经验者优先。 能力与经验 1、5年以上分布式系统或后台系统开发经验,有大规模Kubernetes/Slurm集群管理经验。
调度系统经验:有自定义Kubernetes调度器或Slurm插件开发经验,熟悉调度算法(如Binpacking、碎片整理、优先级调度)。
多目标优化经验:参与过多目标调度算法设计或实现,有排队时间优化、利用率提升、成本优化的实际项目经验。
异构计算经验:有GPU/NPU集群调度经验,参与过异构资源池化或统一抽象项目。
多场景调度经验:至少对以下场景中的两个有深入实践:大规模训练调度(万卡级)、在线推理服务调度、RL沙箱环境调度。
存储调度经验:有数据局部性调度、Checkpoint优化、分布式缓存项目经验。
网络调度经验:有RDMA带宽保障、拥塞控制、网络拓扑感知调度经验。
镜像调度经验:有镜像预热系统、P2P分发系统(如Dragonfly)开发经验。
复杂工作流经验:有Airflow、Argo Workflows或Ray编排经验,理解DAG调度。
开源影响力:Kubernetes、YuniKorn、Volcano、KubeBatch等社区贡献者优先。 技能要求
精通Go/C++/Java中至少一种语言,具备高并发系统开发能力。
熟练使用Kubernetes Operator/Controller开发框架,熟悉client-go、controller-runtime等。
具备性能分析和调优能力,能使用pprof、火焰图等工具定位调度瓶颈。
熟悉Prometheus、Grafana等监控工具,能设计调度可观测性指标。
具备数据分析能力,能使用Python/R进行调度策略仿真与效果评估。 论文/专利
以第一作者发表过调度系统、异构计算、多目标优化调度、多场景资源调度相关论文者优先。
有相关技术专利者优先。
信息来自企业官方招聘渠道
OfferSeek 对公开岗位信息进行聚合、去重和结构化整理,最终申请以企业官方页面为准。