云尖信息
集群调优工程师 002
岗位职责
负责智算集群网络体系建设与优化,完成服务器、交换机等网络硬件设备的参数配置、链路调试及拓扑架构迭代,专项解决集群网络延迟、随机丢包、带宽瓶颈、资源冲突等各类通信问题,持续提升集群网络吞吐能力、传输效率与整体运行稳定性;
负责大模型训练与推理业务的集群环境部署、联调验收及全链路性能优化,针对训练迭代卡顿、推理服务时延偏高、GPU 算力利用率偏低等核心痛点开展专项攻坚调优,有效提升集群算力资源使用率、模型迭代效率与线上推理服务吞吐及稳定性指标;
持续跟踪前沿技术发展,围绕新型高性能网络架构、高端网络特性及大模型训练推理核心技术开展技术调研与方案预研,结合实际业务场景完成可行性验证、方案设计与试点落地,驱动集群架构、网络通信能力与模型部署方案的持续迭代升级;
负责团队技术体系沉淀与标准化建设,梳理智算集群搭建、网络性能调优、模型环境部署的标准化流程,汇总各类故障排查方案与最优实践案例,搭建并迭代团队技术知识库,组织内部技术分享与经验复盘,持续提升团队整体工程化与调优能力;
承接集群架构升级、性能提效等各类专项优化任务,负责攻坚集群部署、分布式网络通信、大模型运行过程中的复杂疑难技术问题,保障算力集群高效、稳定支撑业务规模化落地。
任职要求
本科及以上学历,计算机、网络工程、电子信息、人工智能等相关专业,1-3 年集群运维、网络调优、AI 算力环境部署相关工作经验;
精通服务器集群组网架构,熟悉主流交换机、服务器硬件原理,熟练掌握 VLAN、堆叠、链路聚合、路由协议、RDMA、RoCE 等核心网络技术,具备丰富的网络配置、故障排查、性能调优经验;
熟悉 Linux 操作系统,精通 Shell、Python 等脚本编写,熟练掌握集群资源调度、进程管理、性能监控工具,能够快速定位系统、网络、算力层面的性能瓶颈;
具备 AI 模型训练、推理环境部署实操经验,熟悉 GPU 集群、算力集群部署流程,了解大模型训练、推理的底层运行特性,有模型性能调优、算力优化实战经验者优先;
了解主流新型网络架构、云原生网络特性,关注 AI 算力网络、高性能网络前沿技术,具备独立技术调研、方案设计和落地能力;
熟悉集群运维标准化流程,具备技术文档撰写、知识沉淀、经验复盘能力,能够独立输出技术方案、操作手册、故障复盘报告;
具备良好的团队协作能力、沟通能力,乐于技术分享,积极参与团队技术建设与知识积累。
信息来自企业官方招聘渠道
OfferSeek 对公开岗位信息进行聚合、去重和结构化整理,最终申请以企业官方页面为准。
