offerseek.ai让每个人都能找到适合自己的机会
首页岗位聚合博客岗位雷达简历中心岗位工作台↗价格岗位详情
登录状态读取中
offerseek.ai · 聚合全网官方招聘渠道所有岗位均跳转至企业官方投递页面
岗位聚合/GPU调度研发工程师/专家

小红书

GPU调度研发工程师/专家

⌖北京市,上海市,杭州市社招
12 天前发布2026/08/16
JOB#42837
RESPONSIBILITIES

岗位职责

  1. 01

    万卡级 GPU 调度系统建设: 参与大规模 GPU 集群调度系统建设,围绕 Quota、优先级、抢占、弹性伸缩、碎片整理、拓扑感知调度等能力提升资源效率。

  2. 02

    训推统一调度: 面向大模型训练、后训练、推理服务等不同负载,设计训推统一调度、潮汐混部、在线离线协同和资源弹性策略。

  3. 03

    资源利用率治理: 建设 GPU 资源利用率分析体系,基于真实负载数据识别低效资源、资源碎片、潮汐空闲和调度瓶颈。

  4. 04

    LLMOps 平台融合: 参与构建面向大模型训练、微调、推理、部署全流程的 LLMOps 能力,与云原生平台深度融合,支撑大模型生产链路稳定高效落地。

  5. 05

    集群稳定性建设: 与云原生、IDC、网络、存储和业务团队协作,提升大规模 AI 集群的故障恢复能力、资源周转效率和任务稳定性。

  6. 06

    前沿技术探索: 持续关注 Kubernetes、Volcano、Kueue、Ray、GPU 虚拟化、弹性调度等相关技术,探索下一代 AI 资源调度系统。

REQUIREMENTS

任职要求

  1. 01

    熟悉云原生生态及工具,如 Kubernetes、Kubeflow、Volcano、Kueue 等,有调度系统开发经验优先。

  2. 02

    熟悉 GPU 集群调度、GPU 虚拟化、Quota 管理、故障容错、资源弹性伸缩、高速网络 / 存储等方向中的至少一类。

  3. 03

    了解大模型训练、后训练、推理、部署等生命周期,理解不同负载对 GPU 资源、网络、存储和调度策略的差异化诉求。

  4. 04

    熟练掌握 Python、Golang、C++ 或其他编程语言中的一门或多门,具备良好的工程实现能力。

  5. 05

    具备优秀的逻辑分析能力和系统抽象能力,能够基于真实业务负载进行问题拆解、策略设计和工程落地。

  6. 06

    有良好的沟通协作能力,能与平台、云原生、算法、业务、IDC、网络和存储团队协同推进复杂项目。 加分项 :

  7. 01

    有大模型场景下负载特征分析、GPU 集群调度、资源利用率优化、高性能网络 / 存储等实践经验。

  8. 02

    有 GPU 虚拟化、在线 / 离线混部、潮汐调度、抢占式调度、碎片整理等落地经验。

  9. 03

    有大规模训练或推理集群端到端优化经验,理解训练和推理负载在调度侧的差异。

  10. 04

    熟悉 RDMA、IB、RoCE、NCCL 等通信机制,能结合网络拓扑优化调度策略。

  11. 05

    有 Kubernetes Scheduler、Volcano、Kueue、Ray、YARN、Airflow 等调度系统开发经验。

✓

信息来自企业官方招聘渠道

OfferSeek 对公开岗位信息进行聚合、去重和结构化整理,最终申请以企业官方页面为准。

对这个机会感兴趣?

登录后前往企业官方投递

这个岗位已超出 7 天时效窗口(12 天前发布),可能已经停止招聘,建议先确认官方页面是否仍在招。

跳转前请再次确认岗位状态与申请要求
岗位档案POSITION FILE
企业小红书
地点北京市,上海市,杭州市
类型社招
发布日期2026/08/16
更新日期2026/08/16
官方来源job.xiaohongshu.com