云尖信息
GPU硬件维修经理 016
岗位职责
岗位要求
主要负责AI算力服务器产品相关GPU模组的硬件故障检测、分析定位与维修。产品涉及H100/A100/B300/5090/PRO6000D/国产GPU卡等。
协助AI算力服务器在客方现场上架验收过程中的功能验证、压力测试、PXE装备测试保障工作,负责现场GPU模组问题排查定位、验收日志报告整理核对的工作。
负责客户现场技术支持, BMC、IPMI、BIOS、操作系统及NVIDIA相关日志,结合硬件告警和测试结果,快速定位故障点并判断故障根因。
配合研发、测试、供应链及项目团队处理重大故障,支撑算力集群建设、交付和维保工作。
任职要求
本科及以上学历,具有2年以上服务器硬件维修、测试或技术支持经验,具备独立处理GPU服务器硬件故障的能力。
熟练使用万用表、示波器、烙铁、热风枪、DC电压源、信号源仪表等通用维修仪器仪表;熟悉原理图主流专业工具(AD、Candence OrCAD+Allegro),独立查看原理图和PCB测试维修点位。
熟悉服务器基本架构,了解CPU、内存、GPU、PCIe、NVMe、网卡、电源和散热系统的工作原理。
熟悉NVIDIA GPU服务器架构,了解NVLink、NVSwitch、PCIe拓扑及GPU互联机制。
熟悉市场主流服务器测试与诊断工具,例如:NVIDIA DCGM、nvidia smi、Field Diagnostic、NVQual、NVBandwidth、CUDA Samples、stress ng、memtester、fio、iperf、MFT。
熟悉Linux操作系统,能够使用常用命令完成日志查看、硬件信息采集和故障诊断。
能够使用BMC、IPMI、Redfish等服务器管理方式进行硬件监控、配置与故障定位。
具备良好的故障分析、沟通、团队协调和文档输出能力,能够接受短期现场出差。
加分项
具有2年以上服务器硬件检测维修经验。
具有GPU服务器、AI算力服务器或大规模算力中心或实验室维修经验。
熟悉NVIDIA HGX或主流OEM GPU服务器产品。
具备服务器原厂认证、NVIDIA相关认证者优先。
任职要求
岗位要求
主要负责AI算力服务器产品相关GPU模组的硬件故障检测、分析定位与维修。产品涉及H100/A100/B300/5090/PRO6000D/国产GPU卡等。
协助AI算力服务器在客方现场上架验收过程中的功能验证、压力测试、PXE装备测试保障工作,负责现场GPU模组问题排查定位、验收日志报告整理核对的工作。
负责客户现场技术支持, BMC、IPMI、BIOS、操作系统及NVIDIA相关日志,结合硬件告警和测试结果,快速定位故障点并判断故障根因。
配合研发、测试、供应链及项目团队处理重大故障,支撑算力集群建设、交付和维保工作。
任职要求
本科及以上学历,具有2年以上服务器硬件维修、测试或技术支持经验,具备独立处理GPU服务器硬件故障的能力。
熟练使用万用表、示波器、烙铁、热风枪、DC电压源、信号源仪表等通用维修仪器仪表;熟悉原理图主流专业工具(AD、Candence OrCAD+Allegro),独立查看原理图和PCB测试维修点位。
熟悉服务器基本架构,了解CPU、内存、GPU、PCIe、NVMe、网卡、电源和散热系统的工作原理。
熟悉NVIDIA GPU服务器架构,了解NVLink、NVSwitch、PCIe拓扑及GPU互联机制。
熟悉市场主流服务器测试与诊断工具,例如:NVIDIA DCGM、nvidia smi、Field Diagnostic、NVQual、NVBandwidth、CUDA Samples、stress ng、memtester、fio、iperf、MFT。
熟悉Linux操作系统,能够使用常用命令完成日志查看、硬件信息采集和故障诊断。
能够使用BMC、IPMI、Redfish等服务器管理方式进行硬件监控、配置与故障定位。
具备良好的故障分析、沟通、团队协调和文档输出能力,能够接受短期现场出差。
加分项
具有2年以上服务器硬件检测维修经验。
具有GPU服务器、AI算力服务器或大规模算力中心或实验室维修经验。
熟悉NVIDIA HGX或主流OEM GPU服务器产品。
具备服务器原厂认证、NVIDIA相关认证者优先。
信息来自企业官方招聘渠道
OfferSeek 对公开岗位信息进行聚合、去重和结构化整理,最终申请以企业官方页面为准。
