零跑汽车
校招-训推平台开发工程师(J18093)
岗位职责
职位描述 参与公司AI计算平台后端研发与演进,按方向覆盖以下系统线:
推理服务平台:负责在线推理服务的发布/灰度/扩缩容、健康检查、故障自愈与版本回滚;参与推理引擎(vLLM/SGLang/TensorRT-LLM等)集成适配与模型量化部署(FP8/INT8/W8A8),支撑多机器分布式在线推理;基于Kubernetes设计服务编排与弹性调度,提升GPU/NPU利用率与服务SLA。
资源与任务调度:负责多租户队列、配额与优先级、拓扑/亲和、弹性策略与成本治理;设计训推混部调度策略,统筹训练与推理任务资源分配;基于Kubernetes开发调度控制器(CRD/Operator),落地批调度(Kueue/Volcano),支持千卡级训练排队与gang调度。
平台基础能力:负责统一API网关、权限控制(RBAC)、配额管理与审计日志等底座;建设集群可观测与告警体系(Prometheus/Grafana/Loki/OpenTelemetry);参与训练数据存储与分发系统(数据集版本、冷热分层与缓存、分片并行读取、对象存储/NAS/PFS接入);参与故障自愈、SLO保障与应急响应。
设计并实现平台统一API、权限与审计,沉淀"训练/推理/数据"稳定契约,降低算法团队接入成本,提升算法交付与迭代效率;与算法/框架团队协作,支撑千卡级稳定训练与多机器分布式在线推理。
任职要求
本科及以上,计算机/软件/电子/自动化/人工智能等相关专业;
熟练掌握Go或Python至少一门语言(同时具备两者经验最佳),具备扎实的编程基础与项目落地经验;
熟悉Linux与Docker,了解Kubernetes服务编排、调度器/控制器机制与基本运维;
了解大模型训练/推理流程,对推理服务化、模型量化、分布式训练通信有基本认知;
具备并行计算、网络与存储的基本工程认知,了解测试/CI/CD/回滚等工程化实践;
加分项(任选其一即可):
推理引擎(vLLM/SGLang/TensorRT-LLM等)使用或适配;
k8s control plane/controller开发(CRD/Operator二开)或批调度(Kueue/Volcano/gang调度);
训推混部/弹性调度/GPU拓扑感知与成本治理;
可观测体系(Prometheus/Grafana/Loki/OpenTelemetry等)或对象存储/NAS/PFS与缓存预热;
API网关/RBAC/审计;
GPU作业排障(NCCL/FSDP/网络拓扑);
对AI Infra与云原生有热情,沟通协作能力好,自驱力强。
信息来自企业官方招聘渠道
OfferSeek 对公开岗位信息进行聚合、去重和结构化整理,最终申请以企业官方页面为准。