虎鲸文娱集团
AI SRE
岗位职责
根据 AI-Native 研发运维模式演进对运维决策、系统可靠性与基础设施可调用性的要求,完成 AI Ops 体系与关键能力建设,统筹可观测性、故障治理、可靠性优化和知识沉淀等工作,支撑运维智能化升级,实现系统稳定、高效与可规模化运行。 具体职责包括以下相关方向的一项或多项: ● 推动 AI-Native 研发运维模式演进:探索 AI 与工程师协同的软件研发与运维方式,让 AI 参与系统架构分析、运维决策与故障诊断。
构建 AI-Native Reliability System:设计具备推理能力的 SRE Agent,并结合系统可观测数据与知识体系,构建智能化系统分析与决策能力。
建设 AI-Ready 运维基础设施:升级运维基础设施,使系统数据、工具能力与执行接口能够被 AI 调用与理解。
设计可规模化的系统可靠性工程机制:通过系统架构与工程机制设计提升系统可靠性,例如故障隔离、风险控制与安全发布策略。
任职要求
基础条件 ● 计算机、软件工程等相关专业优先。
具备扎实的软件工程基础与良好的编程能力(Python / Go / Java 等)。
专业能力 ● 系统工程能力 ○ 理解分布式系统和云原生架构,具备构建复杂工程系统的潜力。熟悉现代云原生基础设施,例如 Kubernetes。
AI-Native 工程能力 ○ 熟悉大语言模型(LLM)与 Agent 技术,并有将其应用于软件开发、系统分析或自动化运维的实践经验。 ○ 理解 Agent 的基本机制(推理、规划、工具调用),能够将复杂系统问题抽象为可执行的任务链路。 ○ 能够利用 AI 工具与智能体提升工程效率,并探索 AI 参与研发与运维流程的实践。
系统可靠性与工程思维 ○ 理解系统可靠性工程理念,能够从系统设计与工程机制角度思考稳定性问题。 ○ 能够分析复杂系统行为并识别潜在风险与异常模式。 加分项 ● 有 Agent 开发经验(LangChain / AutoGen 等)。
有 AIOps / 智能运维研究或实践经验。
信息来自企业官方招聘渠道
OfferSeek 对公开岗位信息进行聚合、去重和结构化整理,最终申请以企业官方页面为准。