文远知行
云计算DevOps工程师
岗位职责
我们正为下一代大规模仿真平台寻找一位云计算 DevOps 工程师。你将负责设计、交付并持续优化基于 Kubernetes 的多云/混合云基础设施,保障平台在全球范围内的性能、稳定性与成本最优。你将与开发、架构及 SRE 团队紧密合作,推动自动化、可观测性和安全最佳实践落地。 核心职责
Kubernetes 全生命周期管理 设计并维护生产级 K8s 集群(EKS / GKE / ACK / 自管集群),包含升级、备份、容量规划。 编写与维护 Helm Charts、Kustomize、Argo CD/Flux 流水线,推动 GitOps 实践。 落地多集群联邦、Service Mesh(Istio/Linkerd)及灰度发布策略。
云原生中间件运维 部署、调优和治理云原生中间件:Kafka、Redis、RabbitMQ/AMQ、PostgreSQL、MongoDB、Elasticsearch、Prometheus、Thanos、Jaeger 等。 建立统一监控、告警、日志链路(Prometheus + Grafana + Loki/ELK + Alertmanager)。 制定并演练灾难恢复、备份策略(Velero、etcd backup-operator 等)。
公有云平台深度使用 熟悉 AWS、Azure、阿里云、腾讯云、GCP 中的至少两家,能够利用托管服务(RDS、MSK、S3、OSS、CloudWatch、CloudTrail、IAM、KMS)加速交付。 通过 Terraform / Pulumi / CloudFormation 实现基础设施即代码(IaC)。 持续优化云资源成本(Spot/Reserved 实例、Auto Scaling、FinOps 实践)。
CI/CD & DevSecOps 构建端到端流水线:GitLab CI、GitHub Actions、Jenkins、Tekton。 集成安全扫描(Trivy、Falco、OPA Gatekeeper、Kyverno)和镜像供应链安全(Cosign)。 实现零停机发布、蓝绿/金丝雀发布及回滚策略。
SLA/SLO 与可观测性 定义并跟踪核心服务 SLA/SLO/SLI,建立 P0/P1/P2 分级告警体系。 利用 eBPF、HPA/VPA、KEDA 实现性能洞察与弹性伸缩。 定期进行故障演练(Chaos Engineering)和容量压测
任职要求
1、3 年以上 DevOps 或 SRE 经验,其中 2 年以上 Kubernetes 生产运维经验。
熟练使用 Docker、K8s CRD、Operator;熟悉 CNI、CSI、CRI 原理及故障排查。
至少精通一种脚本语言(Python/Go/Bash)和一种 IaC 工具(Terraform/Pulumi)。
深入理解 TCP/IP、Linux 内核、DNS、负载均衡(Nginx/Envoy/Contour)。
熟悉 GitOps、CI/CD、监控、日志、告警的最佳实践。
有云原生证书、身份与访问管理(IAM、OIDC、Vault)经验者优先。
有大规模仿真、游戏、流媒体、AI 训练平台背景者优先。
良好的跨团队沟通与文档习惯,英语读写流利
信息来自企业官方招聘渠道
OfferSeek 对公开岗位信息进行聚合、去重和结构化整理,最终申请以企业官方页面为准。
