宁德时代
AI基础设施工程师
岗位职责
我们正在招聘 AI 基础设施工程师,负责建设现代 AI 工程及研发团队所需的数据基础设施、AI 开发平台、MLOps/LLMOps 工具链、模型基础设施和智能体基础设施。 该岗位的工程师将与AI应用工程师、科学家、领域专家紧密合作,理解具体科研瓶颈,并将其转化为可靠、可复用、可扩展的AI工程解决方案。 该岗位涵盖三个相互协同的方向。每位工程师将根据自身经验、优势和团队需求,主要负责其中一到两个方向。 方向一:数据工程
设计并建设可扩展的数据 Pipeline,支持 AI 模型开发、训练、评估和生产应用;
建设结构化与非结构化数据的采集、转换、验证、版本管理和数据血缘能力;
开发可靠的数据处理工作流,支持文本、图像、文档、科学数据、时序数据及其他领域特定数据;
建设面向大模型和 RAG 应用的数据基础设施,包括向量存储、知识库、文本切分与向量化 Pipeline,以及检索质量评估;
提升 AI 开发全流程中的数据质量、可观测性、可复现性与可访问性;
与算法团队及业务团队协作,将模型开发需求转化为可复用的数据基础设施。 方向二:AI 平台、MLOps/LLMOps 与模型基础设施
设计并建设支持模型端到端生命周期的 AI 开发平台,涵盖数据准备、实验、训练、评估、部署、推理、监控与迭代;
建设标准化的 MLOps 和 LLMOps Pipeline、工具及工作流,以支持模型开发、全生命周期管理和生产交付;
提供可复用的平台能力,支持实验追踪、数据集与模型版本管理、模型评估、模型注册、发布管理和结果复现;
建设可扩展的训练、微调、评估和推理工作流,支持本地、云端、Kubernetes、GPU 集群及混合环境;
开发标准化的模型部署与服务能力,包括模型封装、发布、请求路由、负载均衡、自动扩缩容、监控和故障恢复;
集成并运行主流模型训练与服务框架,例如 PyTorch、DeepSpeed、FSDP、vLLM、SGLang、TensorRT-LLM、Triton Inference Server 或同类技术;
针对性能、可扩展性、GPU 利用率、内存效率、可靠性和成本,优化模型训练与推理系统;
通过提供标准化的开发环境、SDK、API、模板、CI/CD Pipeline 和自助服务平台能力,提升 AI 开发者体验;
建设 AI 工作负载的可观测性、资源调度、容量管理、成本监控、安全与治理能力;
与研发、数据和业务应用团队协作,将模型开发需求转化为可复用的平台与基础设施能力。 方向三:智能体基础设施
设计并建设用于开发、部署、运行和评估 AI 智能体的基础设施;
建设可复用的智能体运行时能力,包括模型接入、工具调用、工作流编排、状态管理、记忆和执行控制;
开发用于智能体身份、权限、沙箱、密钥管理、可观测性、链路追踪和审计的基础设施;
建设智能体评估与测试系统,覆盖任务完成度、工具使用正确性、可靠性、安全性、延迟和成本;
为智能体开发团队提供可复用的 SDK、API、模板、技能、连接器和部署工作流;
支持长时间运行、事件驱动、定时调度、异步执行以及包含人工介入的智能体工作流;
将智能体与企业系统、数据平台、模型服务、内部工具及外部 API 集成,包括 MCP 等标准化协议
任职要求
硕士及以上学历,计算机科学、软件工程、云计算、大数据、系统工程、数学、人工智能等相关专业;
具备扎实的编程和软件工程能力,熟悉Python、Java、Go、Rust、C++等相关编程语言;
熟悉至少一个专业方向的相关技术,例如数据工程、工作流编排系统、云平台、Docker、Kubernetes、GPU集群、分布式训练框架、模型服务系统或智能体基础设施;
能够将科研、算法、数据或业务需求,转化为可复用的工程平台、基础设施、工具和工作流;
具备较强的系统设计、问题解决、故障排查和性能分析能力;
具备良好的沟通和跨团队协作能力,能够与研究、算法、数据、产品和应用团队高效合作。
优先条件
具备设计、建设、部署或运行高可用生产系统的经验;
具备 AI Agent 框架、工作流引擎、工具调用系统、记忆系统、沙箱环境或智能体评估经验;
具备在云端、混合云、本地或多集群环境中支持 AI 工作负载的经验;
具备数据系统的性能、可扩展性与成本优化经验;
具备为科学计算、材料科学、能源、制造或其他领域应用建设 AI 基础设施的经验;
具备将大模型适配到专业领域(科学计算、材料、能源、工业应用)的经验;
具备开源贡献、学术发表记录,已授权专利或行业标准参与经历
信息来自企业官方招聘渠道
OfferSeek 对公开岗位信息进行聚合、去重和结构化整理,最终申请以企业官方页面为准。
