深南电路
AI服务器运维工程师
岗位职责
MLOps平台设计与开发
设计、构建和维护公司核心的机器学习平台,涵盖实验管理、模型训练、版本控制、评估、部署、监控与持续迭代的全链路。
实现模型训练管道(Training Pipeline)和模型服务(Model Serving)的自动化与编排(使用如Kubeflow、MLflow、TFX或自研框架)
构建高效的特征平台,管理离线与在线特征的一致性,支持实时特征计算。
云原生机器学习基础设施
在Kubernetes上构建和管理弹性、可扩展的ML工作负载(如分布式训练任务、模型推理服务)。
优化GPU/NPU等异构计算资源的调度、共享与隔离策略,提升资源利用率。
设计和实现模型的自动化伸缩(Auto-scaling)、金丝雀发布、流量管理和A/B测试框架。
自动化、可观测性与治理
建立端到端的CI/CD管道,实现代码、数据、模型和配置的自动化测试与部署。
构建全面的监控、日志和告警系统,覆盖模型性能(延迟、吞吐量)、数据质量、特征漂移和预测偏差。
实施模型治理与安全最佳实践,包括模型版本化、审计追踪和数据安全。
协作与赋能
与数据科学、算法和产品团队紧密合作,深入理解其工作流痛点,并提供平台化解决方案。
编写高质量的技术文档和工具指南,赋能内部用户高效使用平台。
研究和引入前沿的MLOps工具与实践,推动团队技术演进。
负责大规模Kubernetes/Docker容器化集群的日常运维、容量规划及故障排查,确保高可用性。
通过监控数据分析系统瓶颈,实施资源调度优化策略,提升云资源使用效率,支撑业务绿色节能目标。
设计并落地CI/CD流程,利用Ansible/Terraform等工具实现运维自动化,减少人工干预。
制定并执行系统安全策略(防火墙、入侵检测、数据加密),管理数据备份与灾难恢复演练。
负责Nginx、MySQL、Redis、ClickHouse、Kafka、ELK等核心中间件的部署、调优及版本升级。
任职要求
学历与经验: - 计算机科学、软件工程或相关专业本科及以上学历。 - 5年以上DevOps/SRE或云基础设施相关经验,其中至少2年专注于MLOps或大规模机器学习系统构建,3年以上专注于K8s/Docker云原生集群管理。 - 有成功搭建和维护面向生产环境的MLOps平台的实际项目经验。
核心技术栈: - 精通容器化:Docker, Kubernetes, 包括其上的ML负载管理经验,深入理解Kubernetes架构体系,具备微服务治理及大规模集群实战经验。 - 精通Nginx、MySQL、Redis、ClickHouse、Kafka、ActiveMQ、MinIO、ELK、Prometheus、Grafana等组件的原理、部署及调优。 - 精通CI/CD工具链:Jenkins, GitLab CI, GitHub Actions, Argo CI/CD等。 - 精通至少一门编程/脚本语言:Python (必需), Go, Bash。 - 熟悉TCP/IP、DNS、HTTP等网络协议,具备交换机、路由器、防火墙等网络设备的配置与管理能力。 - 熟练使用Zabbix/Nagios进行监控,精通Ansible/Puppet/Chef/Terraform中至少一种自动化运维工具。 - 深刻理解网络安全策略,有防火墙配置、入侵检测、数据加密及灾难恢复计划(DRP)实施经验。
MLOps专项能力: - 深入理解ML生命周期及痛点,熟悉ML工作流工具(如 MLflow, Kubeflow, Airflow, Feast)。 - 有构建和管理高可用、低延迟的在线模型服务(如使用Triton, TorchServe, KServe, TFServing) 的实际经验。 - 熟悉分布式训练框架(如PyTorch DDP, Horovod)在K8s上的部署与调优。
语言与沟通能力: - 出色的系统性解决问题能力和架构设计能力。 - 优秀的跨文化团队协作能力。
信息来自企业官方招聘渠道
OfferSeek 对公开岗位信息进行聚合、去重和结构化整理,最终申请以企业官方页面为准。