特斯拉
全栈开发工程师,AI,上海
岗位职责
设计、构建并维护可扩展的 MLOps 平台,实现 AI 模型从训练、版本控制、部署到监控的全生命周期管理。 基于 vLLM、TensorRT-LLM、TGI 等框架,在大规模 GPU 集群上开发并优化大语言模型(LLM)推理流水线。 构建融合本地 GPU 模型与云上 LLM API 的混合推理网关平台,实现智能路由、负载均衡与性能成本优化。 搭建自动化 LLM 微调(Fine-Tuning)流水线,支持 LoRA、QLoRA 等参数高效训练方法,涵盖数据预处理、分布式训练与检查点管理。 推动 RAG(检索增强生成)能力服务化(RAG-as-a-Service),集成并运维主流向量数据库(如 Pinecone、Milvus、Weaviate)。 通过 Prometheus、Grafana、OpenTelemetry 及自研监控方案,保障 AI 系统的可观测性与稳定性。 与 AI 科学家和应用工程师协作,进行模型优化(如量化、剪枝、蒸馏),提升推理效率与资源利用率。 支持 GenAI CN 平台的高性能模型服务需求,确保低延迟、高并发的服务能力。 制定 AI 模型服务的关键性能指标(KPI)与服务等级协议(SLA),量化业务价值与系统表现。 使用 GitLab CI、Jenkins、ArgoCD 等工具实现 AI 工作流的 CI/CD 自动化,确保可复现性与可审计性
任职要求
教育背景 计算机科学、人工智能、软件工程或相关专业本科及以上学历。 工作经验 至少 2 年软件开发经验,具备 MLOps、AI 基础设施或大规模模型推理服务 相关经验者优先。 有在生产环境中成功部署和运维 大语言模型(LLM)或深度学习模型 的实际项目经验者优先。 技术能力 精通 Python 或 Go ,熟悉至少一种后端开发框架,如 Flask、FastAPI。 有 React / Next.js 前端开发经验者优先。 深入掌握 Kubernetes 和 Docker ,具备通过 KubeFlow、NVIDIA GPU Operator 或自定义控制器管理 GPU 加速工作负载的实践经验。 熟悉主流 MLOps 平台与工具链(如 MLflow、Kubeflow)者优先。 有使用 vLLM、TGI、Triton Inference Server 等构建高并发、低延迟模型推理系统的真实案例者优先。 熟悉向量数据库(如 Pinecone、Milvus、FAISS、Weaviate)及其在 RAG 系统中的工程化集成者优先。 软技能 具备极强的自我驱动力,能够在快节奏环境中独立推动复杂项目落地。 出色的沟通与跨团队协作能力,能高效对接 AI 科学家、后端工程师及业务方。 具备系统性思维,关注系统的可扩展性、可靠性与性能优化。 主动发现问题并持续改进,追求运维卓越与平台稳定性
信息来自企业官方招聘渠道
OfferSeek 对公开岗位信息进行聚合、去重和结构化整理,最终申请以企业官方页面为准。
