新华三集团
智算云MaaS平台架构师(J18842)
岗位职责
负责 MaaS 平台产品与技术架构及演进路线设计,构建覆盖模型开发、训练、微调、强化学习、评测、部署、推理及模型服务的全生命周期平台。
负责大模型后训练服务规划,主导大模型分布式训练故障感知恢复,持续跟踪强化学习及 Agentic AI 等方向的技术发展,并推动形成平台产品能力。
负责大模型推理Token工厂服务设计,持续优化推理服务性能,降低Token生产成本。
负责大规模异构算力调度架构设计,实现训练、微调、推理等工作负载的统一算力管理,结合训练与推理业务特点设计算力调度策略,提高 GPU 利用率、集群吞吐和整体算力投入产出比。
支持重大客户、重点项目的技术交流、方案设计及架构咨询,能够完成从客户需求到平台产品能力的抽象和沉淀,推动产品从规划、研发到规模化商业落地。
任职要求
计算机、人工智能等相关专业,具备8年以上云计算、AI平台相关工作经验;具备云原生架构能力,深入理解 Kubernetes、Volcano、Service Mesh等技术体系,具有3年以上AI Infra相关经验。
熟悉大模型训练技术体系,对DeepSpeed、Megatron-LM 等技术框架有实际经验或深入理解,熟悉大模型微调技术、强化学习及 Post-training 技术体系,熟悉 RLHF、RLAIF、Reward Model、PPO、DPO、GRPO 等相关方法,理解其训练流程、算力特点及平台工程需求。
深入理解大模型推理服务架构,理解KVCache、Continuous Batching、Paged Attention、量化、Speculative Decoding 等关键优化技术,能够从计算、显存、网络和存储等维度分析大模型推理性能瓶颈,并提出性能优化思路。
具备较强算力平台及调度框架架构能力,理解大模型算力集群、GPU 资源池化、vGPU 调度、分布式训练调度及推理服务调度,熟悉 Ray、Kubeflow、Volcano、Kueue、Slurm 等 AI 计算与调度框架。 具备以下一项或多项经验者优先:
有大型智算云或企业级 AI 平台产品/架构经验优先;
有万卡级算力集群、智算中心或大规模异构算力平台相关经验优先;
有大模型预训练、SFT、RLHF/DPO/GRPO 、Agentic-RL等真实项目经验优先;
有大规模在线 LLM 推理平台建设及性能优化经验优先;
信息来自企业官方招聘渠道
OfferSeek 对公开岗位信息进行聚合、去重和结构化整理,最终申请以企业官方页面为准。