大疆集团
中/高级SRE可靠性工程师
岗位职责
通过容量规划、多机房容灾、集群管理与弹性伸缩,持续提升系统架构健壮性与高可用能力,支撑规模化增长下的稳定运行。
通过风险梳理、告警完整度盘点、核心功能链路(Topo)梳理与重点保障,构建""责任到人、跟踪至关闭""的风险闭环,确保风险及时发现、量化评估、前置治理。
建设事前(SLI 达标性治理)、事中(Critical 告警应急机制)、事后(外网问题与事故应急响应及升级机制)全周期措施,降低事故数和 MTTR,保障系统稳定运营、提升质量口碑、降低客诉、保障 SLA 市场竞争力。
建设覆盖 Metrics / Logging / Tracing 的一体化可观测体系,消除监控盲区,实现故障快速发现、精准定位与根因下钻,为容量决策与稳定性治理提供数据支撑。
负责中间件、数据库、存储、K8s、云函数等组件的运维保障,通过定期巡检、监控预警、容量评估与自动化运维,保障底层高可用、高性能与安全合规。
负责系统/项目成本预算编制与管理,洞察成本劣化趋势,通过建设成本管理与优化 SOP,在保障稳定性前提下持续降本、提升资源利用率与投入产出比。
通过故障注入、定期故障演练(混沌工程)及与云厂商运维联动,全面提升容灾容错能力,验证并迭代应急预案,实现故障的快速转移与恢复。
任职要求
计算机、软件工程相关专业,本科及以上;5 年以上系统运维 / SRE / 稳定性保障经验,主导或深度参与过大规模在线服务(SaaS/PaaS/云平台)稳定性体系建设。
深入理解 SRE 方法论(SLI/SLO/Error Budget、MTTR 拆解、故障分级与复盘),有从 0 到 1 搭建监控告警、应急响应、故障复盘闭环的实战经验。
精通 Linux 系统运维与性能调优,深入理解操作系统与网络协议栈(TCP/IP、HTTP/HTTPS、DNS、负载均衡);熟悉数据中心/机房架构、多机房容灾、异地多活、专线/VPC/网络分区等设计,具备容量规划与网络故障排查能力。
精通 K8s / Docker 容器化与集群运维,熟悉云原生生态(Service Mesh、Helm、Operator);熟悉 CI/CD 流水线与 DevOps 工具链,有灰度发布、自动化部署与 IaC 实践。
精通 Java/Go/Python 至少一门语言,熟练编写运维脚本,熟悉分布式与高并发高可用设计;熟练掌握可观测性技术栈(Metrics/Logging/Tracing)与工具。
具备服务依赖拓扑治理经验;能用数据度量稳定性(达标率、认领率、关单率、MTTR)驱动跨团队治理,抗压能力强,能在故障中主导组织级协同。
加分项:混合云/私有化/边缘计算部署运维,或 AI 基础设施/大模型应用稳定性保障;有成本优化、混沌工程/故障演练、云厂商运维联动经验者优先。
信息来自企业官方招聘渠道
OfferSeek 对公开岗位信息进行聚合、去重和结构化整理,最终申请以企业官方页面为准。
