小红书
大模型推理服务(MaaS)研发工程师/专家
岗位职责
我们是小红书中台大模型 Infra 团队,专注打造领先易用的「AI 大模型全链路基础设施」!团队深耕大模型「数-训-压-推-评」技术闭环,在大模型训练加速、模型压缩、推理优化、部署提效等方向积累了深厚的技术优势,基于 RedAccel 训练引擎、RedSlim 压缩工具、RedServing 推理部署引擎、DirectLLM 大模型 API 服务、QuickSilver 大模型生产部署平台等核心产品,持续赋能社区、商业、交易、安全、数平、研效等多个核心业务,实现 AI 技术高效落地! DirectLLM是小红书内部面向各业务场景建设的大模型API服务产品,通过标准化API接口提供LLM/MLLM等大模型推理服务,致力于为AI应用开发者提供品类丰富、数量众多的模型选择,并通过API接口为其提供开箱即用、能力卓越、成本经济的模型服务,各领域模型的能力均可通过统一的API和SDK来实现被不同业务系统集成。 核心职责
MaaS 平台架构与研发: 参与 MaaS 系统架构设计与研发,建设公司统一的大模型 API 服务入口。
模型服务治理能力建设: 负责模型接入、请求路由、鉴权、限流、配额、TPM / RPM、灰度发布、SLO、成本统计等核心能力。
请求调度与稳定性建设: 建设多模型、多租户、高并发场景下的请求调度与服务治理能力,提升模型服务稳定性和资源效率。
推理引擎与业务打通: 打通底层推理引擎与上层业务应用,为社区、搜索、审核、企效、AI 应用等场景提供开箱即用的大模型服务能力。
开发者体验优化: 持续优化统一 API、SDK、文档、监控、问题诊断和接入流程,提升内部 AI 应用开发效率。
成本与效率优化: 与推理、压缩、调度团队协同,持续优化模型调用成本、服务延迟和资源利用率。
任职要求
熟悉 Go / Java / Python / C++ 中至少一门语言,具备扎实的服务端研发能力。
有大规模分布式系统、高并发 API 网关、服务治理、流控限流、鉴权、多租户系统等相关经验。
能对复杂业务问题进行系统建模和抽象,具备良好的稳定性、可观测性和工程质量意识。
了解大模型推理服务基本链路,对模型部署、请求调度、服务高可用、SLO 保障等有基本认知。
具备良好的沟通协作能力,能与推理框架、平台、算法和业务团队协同推进项目落地。 加分项
有 LLM / MLLM 模型服务平台、MaaS 平台、API 网关、云服务平台开发经验。
熟悉 vLLM、SGLang、TensorRT-LLM 等大模型推理框架,有模型推理部署或优化经验。
熟悉 Kubernetes、服务发现、负载均衡、弹性扩缩容、限流熔断、灰度发布等服务治理能力。
有面向开发者的平台产品建设经验,理解 API、SDK、文档、接入体验对平台效率的影响。
有成本治理、资源调度、请求路由、模型路由相关经验优先。
信息来自企业官方招聘渠道
OfferSeek 对公开岗位信息进行聚合、去重和结构化整理,最终申请以企业官方页面为准。
