曙光信息产业股份有限公司
【2027】AI Infra 研发工程师-成都(J14242)
岗位职责
岗位职责
参与 Kubernetes 上的 AI 训练 / 推理调度引擎研发(Volcano、Kueue、KubeRay、KServe 等生态);
设计并实现 GPU / NPU 等异构算力的拓扑感知调度、Gang Scheduling、抢占与配额策略;
优化大规模 GPU 集群的资源利用率、任务排队策略与故障容错能力;
参与容器运行时(containerd / Kata Containers)、CRI / CDI、GPU 设备插件相关的优化与开发;
构建面向 Agent 和推理服务的轻量级沙箱运行环境,实现代码 / 工具调用的安全隔离执行
任职要求
任职资格: 1.2026 届或 2027 届本科及以上学历,计算机科学、软件工程、自动化、人工智能、数学等相关专业
扎实的计算机基础:操作系统、计算机网络、数据结构与算法
熟练掌握至少一门系统级语言(C++ / Go / Rust 任一),并具备 Python 编程能力
熟悉 Linux 系统,能独立完成开发、调试与性能问题定位
良好的英文文档阅读能力、开源社区跟踪能力,以及跨团队协作意识 加分项
有大厂 AI Infra、云原生或 HPC 团队实习经历
主导过完整的 AI 平台模块建设(从设计到上线),并有可量化的性能收益或成本优化
具备将底层系统能力与上层算法诉求对齐的能力,能与算法团队高效协作,共同推动优化落地
熟悉 Kubernetes 源码或核心组件(kube-scheduler / kubelet / device plugin),有二次开发经验
了解容器 / 虚拟化底层原理:cgroup、namespace、KVM、Firecracker、gVisor 等
有 GPU 编程经验(CUDA / Triton),或熟悉 NCCL / RDMA / IB 网络
有主流分布式训练或推理框架(Megatron / DeepSpeed / FSDP / vLLM / SGLang)的源码阅读或调优经验
熟悉 Ray、Volcano、Kueue、KubeRay、KServe 等 AI 云原生项目
信息来自企业官方招聘渠道
OfferSeek 对公开岗位信息进行聚合、去重和结构化整理,最终申请以企业官方页面为准。