长鑫存储
容器云平台运营运维工程师-Container Cloud Platform Operations Engineer(J20602)
岗位职责
平台稳定保障:主导基于Kubernetes的企业级容器云平台建设与日常运维,制定高可用策略,确保平台可用性不低于99.99%,支撑业务7×24小时稳定运行;
集群全生命周期管理:实施K8s集群的部署、扩容、高可用架构优化、性能调优与安全加固,建设故障自愈体系,降低人为干预频次;
故障应急与根因分析:主导容器编排、资源调度、网络通信、存储挂载等核心故障的快速排查与闭环处理,缩短故障恢复时长并输出根因分析报告;
版本迭代与插件管理:规划K8s版本升级、组件补丁更新及CRI/CNI/CSI插件迭代,通过灰度验证与回滚方案确保升级过程业务无中断;
资源规划与成本治理:基于业务负载趋势进行计算、存储、网络资源的容量评估与动态调配,持续优化资源利用率并降低运营成本;
运维体系标准化:梳理运维流程,设计并落地监控、告警、日志分析的全链路自动化工具链,持续沉淀运维手册与故障案例库。
任职要求
教育背景与专业知识:本科及以上学历,计算机、软件工程、通信工程等相关专业;
专业技能与资格:具备Shell、Python或Go语言脚本开发能力,能独立编写集群巡检、资源管理及故障处理自动化脚本,并能熟练使用kubectl、Helm、Kustomize等工具;
行业与专业经验:具有5年以上云平台运维经验,其中至少3年大规模Kubernetes集群(50+节点)运维经验,熟悉Docker/containerd运行时原理,并掌握Istio、Prometheus、Grafana、EFK等云原生组件配置;
项目/任务成果:主导过至少一个大型K8s集群的高可用架构设计或性能优化项目,能提供量化改进结果(如故障恢复时间缩短比例、资源利用率提升幅度);
其他要求:具备云平台网络架构知识,能配置VPC、负载均衡、Service、Ingress及Flannel/Calico等CNI插件,并能独立排查Linux内核、网络、I/O等底层问题。
信息来自企业官方招聘渠道
OfferSeek 对公开岗位信息进行聚合、去重和结构化整理,最终申请以企业官方页面为准。
