云尖信息
智算网络工程师 002
RESPONSIBILITIES
岗位职责
负责AI 智算中心 GPU 集群高性能网络的方案设计、设备选型、拓扑输出、现场实施、联调测试与项目交付,支撑大模型训练、推理集群建设,输出组网方案、配置规范、验收文档。
对接服务器、存储、AI 算法团队,完成计算网、管理网、存储网三网规划隔离;定位集群训练慢、通信报错、网卡链路异常等跨层故障,保障集群稳定运行。
参与客户侧技术交流、方案输出、问题排查与售后技术支持;沉淀部署手册、故障预案、运维规范;使用 Python/Ansible 做网络批量配置、自动化运维脚本开发,提升交付效率。
跟踪智算网络国产化硬件、高速网络新技术,完成技术预研、兼容性测试,输出技术评估报告。
REQUIREMENTS
任职要求
本科及以上,计算机、通信、网络工程相关专业,3‑5 年数据中心网络实施交付经验,有智算 / AI/GPU 集群项目实战经验优先。
精通 TCP/IP,熟练 BGP、EVPN‑VXLAN、ECMP 等数据中心网络技术;熟练主流厂商交换机配置;熟悉 Linux 系统,可独立做网络排障。
熟悉 InfiniBand 或者 RoCE‑v2,了解 GPUDirect‑RDMA、NCCL 集合通信原理;接触过 Mellanox/NVIDIA 网卡、IB 交换机者优先。
了解 GPU 服务器硬件基础,熟悉智算集群基本架构,能够看懂集群拓扑、网卡光模块参数;能独立定位网络‑GPU 协同类故障。
会输出方案文档、拓扑图、测试报告;具备良好问题分析、沟通协调能力,可接受短期出差现场实施。
信息来自企业官方招聘渠道
OfferSeek 对公开岗位信息进行聚合、去重和结构化整理,最终申请以企业官方页面为准。
