哔哩哔哩集团
【B-UP】强化学习训练框架工程师(校招)
RESPONSIBILITIES
岗位职责
参与强化学习训练框架的研发与性能优化,根据业务需求持续演进训练策略与系统能力,提升大规模模型训练效率;
深度分析与定位训练系统中的性能瓶颈(包括计算、通信、存储等),实施针对性优化,提升训练吞吐、稳定性与可扩展性;
持续跟踪并集成业界前沿的训练优化技术(如 MoE、异步RL、LoRA RL、Agentic RL 等)
REQUIREMENTS
任职要求
本科及以上学历,计算机相关专业;
熟悉 Python/C++ 中至少一种编程语言,具备扎实的工程基础;
深入理解自然语言处理、计算机视觉或多模态算法,熟悉主流的 DiT(Diffusion Transformer) 与 VLM(Vision-Language Model) 模型架构;
熟悉常见强化学习训练算法(如 GRPO、DAPO 等)及训练框架(如 verl),熟悉异步强化学习范式;
有相关领域开源项目贡献经验者优先;
具备大规模训练实操经验者优先
信息来自企业官方招聘渠道
OfferSeek 对公开岗位信息进行聚合、去重和结构化整理,最终申请以企业官方页面为准。
