哔哩哔哩集团
资深算力服务器稳定性专家
RESPONSIBILITIES
岗位职责
负责AI算力集群运维体系建设,保障算力集群持续稳定运行。
负责AI算力集群可观测性建设,建立各类故障知识库,提高故障发现覆盖率与准确率
参与AI算力集群建设交付,制定并优化算力交付基线、交付压测与检查,保障交付资源稳定性与性能一致性。
构建自动化运维工具链,提升集群故障自愈率与运维效率,有效降低故障影响
REQUIREMENTS
任职要求
计算机、电子工程或相关专业本科及以上学历,熟悉PCIe、NVLink、CXL等高速互联协议,了解GPU服务器架,具备6年以上服务器硬件研发经验;
熟悉主流AI服务器的硬件及系统、RDMA网络等相关基础设施,有千卡及以上规模AI算力集群建设、运维经验优先;有互联网大厂或服务器ODM/OEM厂商工作经验者优先;
对AI集群运维有较好的认知和全局意识,具备有较强的分析、解决问题的能力;
具备优秀的故障定位与根因分析能力,能独立驱动跨团队协作解决复杂硬件问题;
良好的沟通协作能力,有良好的团队合作精神;对工作充满热情,责任心强、有一定的抗压能力;
能够熟练运用脚本语言(Python/Shell等)完成日常任务或自动化工具开发
信息来自企业官方招聘渠道
OfferSeek 对公开岗位信息进行聚合、去重和结构化整理,最终申请以企业官方页面为准。
