小红书
【REDstar】大模型训练工程师
岗位职责
大模型训练方向
参与设计实现支持RLHF/DPO等对齐技术的高效训练框架,优化强化学习阶段的Rollout、Reward Model集成、多阶段训练Pipeline;
研发支持多机多卡RL的分布式训练框架,开发TP/PP/ZeRO-3与RL流程的动态协同机制,解决RL算法在超长时序下的显存/通信瓶颈;
基于自建的训推引擎,落地公司统一的大模型生产部署平台,为公司所有大模型算法同学提供端到端的一站式服务。 大模型推理方向:
参与/负责研发面向LLM/MLLM等模型的稳定、易用、性能领先的AI推理框架;
通过并行计算优化、分布式架构优化、异构调度等多种框架技术,支撑各业务方向持续降本增效;
深度参与周边深度学习系统多个子方向的工作,包括但不限于模型管理、推理部署、日志/监控、工作流编排等。 大模型压缩方向:
探索研发针对大语言模型、多模态大模型等场景的压缩技术,包括但不限于量化、蒸馏、剪枝、稀疏化等;
参与/负责多个业务场景中的模型压缩技术实现,对模型进行轻量化压缩,提高训练/推理效率,支持业务降本增效;
参与/负责针对英伟达GPU、华为昇腾NPU等不同的计算硬件,制定不同的模型压缩方案并在业务落地。
任职要求
本科及以上学历,计算机等相关专业;
有扎实的工程算法基础,精通数据结构和常用算法,熟练掌握各种编译、调试、性能分析工具;
精通C/C++/CUDA/TopsCC/AscendC,具备扎实的系统底层能力(内存、并发、网络);
有大规模分布式系统开发和优化经验;有大模型分布式训练经验者优先;
精通MLIR/TVM/Triton/Torch Inductor/TileLang/Verbs/NCCL/NVSHMEM等分布式异构计算框架和相关工具链;
精通Megatron/DeepSpeed/veRL/OpenRLHF/LLaMA-Factory等业界开源训练框架;
精通vLLM/SGLang/LMDeploy/TensorRT-LLM/TensorRT/Onnx Runtime等业界开源推理框架;
熟悉常见深度学习模型结构。
【加分项】
在Megatron-LM、DeepSpeed、veRL、TVM、LLVM等社区有持续代码贡献;
有高质量技术博客、GitHub Repo、业界知名作品;
有AI Infrastructures相关顶会论文(OSDI、SOSP、MLSys、KDD、RecSys 等)。
信息来自企业官方招聘渠道
OfferSeek 对公开岗位信息进行聚合、去重和结构化整理,最终申请以企业官方页面为准。
