TCL中环
云计算工程师
岗位职责
混合云与AI算力基础设施运维 负责企业公有云、私有云及数据中心的日常巡检、故障排查与性能监控,保障通用算力资源稳定运行;承担GPU/NPU等AI异构算力集群的基础运维工作,支撑大模型训练、推理等AI业务的资源供给;
AI算力资源交付与调度 负责AI算力资源的申请开通、环境部署、任务配置及资源配额管理;根据业务需求制定合理的资源使用策略,保障AI项目高效运行;
AI平台稳定性保障 负责AI训练/推理平台的稳定性建设,搭建监控告警与日志分析链路;及时发现并响应AI业务异常(如训练中断、显存溢出、通信超时等),制定并执行故障恢复方案,保障AI业务连续性;
技术文档沉淀 编写并维护技术文档,包括云资源操作手册、AI算力使用指南、故障处理SOP、运维规范等。推动AI基础设施运维流程的标准化与自动化建设;
新技术研究与应用 主动跟踪云计算与AI基础设施前沿技术(如GPU虚拟化、容器化调度、推理优化等),将新技术转化为可落地的运维工具或流程改进,并在团队内进行技术分享;
跨团队技术对接 作为基础设施侧的技术接口人,对接算法、AI工程、网络等团队,完成需求分析、方案制定与技术交付,解决AI业务在基础设施层面的各类问题。
任职要求
学历专业:本科及以上学历,计算机科学、软件工程、信息技术等相关专业;
计算机基础:熟悉操作系统、网络协议(TCP/IP)、数据库等基本原理;了解虚拟化、云计算、容器化(Docker/Kubernetes)等现代IT技术;
编程能力:熟练运用至少一门主流编程语言(Python/Go/C++),具备良好的代码规范和脚本开发能力;
AI技术基础:了解GPU/NPU等异构算力的基本概念,对CUDA编程、NCCL通信库有初步认知;了解或使用过至少一种AI框架(PyTorch/TensorFlow/MindSpore);
调度与编排:了解Kubernetes在AI场景下的调度方案(如Volcano)。有容器编排、资源调度相关实践经验者优先;
解决问题能力:具备强烈的责任心和owner意识,能够独立排查和定位技术问题;具备良好的逻辑思维和分析能力,推动问题闭环;
学习与成长:对云计算和AI基础设施有浓厚兴趣,具备快速学习新技术的能力。对AI负载特性(如训练任务对算力、网络、存储的要求)有基本认知或强烈学习意愿;
沟通协作:具备良好的沟通能力和团队合作精神,主动承担责任,与多角色高效协作。
信息来自企业官方招聘渠道
OfferSeek 对公开岗位信息进行聚合、去重和结构化整理,最终申请以企业官方页面为准。