哔哩哔哩集团
【B-UP】强化学习训练算法工程师(校招)
RESPONSIBILITIES
岗位职责
参与强化学习核心算法的设计、实现与优化,探索 RL 在扩散模型去噪过程中的应用,包括但不限于 PPO、DPO、GRPO、DAPO、ReFL等内容;
参与强化学习训练框架建设,搭建并且持续优化 Agentic RL 链路;
参与奖励模型和偏好数据集的构建与迭代,设计针对多模态生成质量(美学、一致性、指令遵循)的细粒度评价信号;
跟踪 ICML/NeurIPS/ICLR/CVPR 等顶会中 RL+生成模型的前沿动态,将论文成果快速转化为内部技术原型并验证
REQUIREMENTS
任职要求
本科及以上学历,计算机、人工智能、数学、自动化等相关专业(硕士/博士优先);
了解自然语言处理、计算机视觉或多模态算法,了解主流的 DiT(Diffusion Transformer) 与 VLM(Vision-Language Model) 模型架构;
熟悉至少 2 种主流强化学习算法原理,熟悉至少一种强化学习训练框架;
熟练使用 PyTorch 框架,有从零复现顶会 RL 论文代码的能力;
有 Diffusion Model(DDPM/DDIM/Flow Matching)或 LLM/VLM 的后训练(SFT/RLHF/DPO)项目经验者优先;
在 NeurIPS/ICML/ICLR/CVPR/ACL 等会议有投稿或发表经历者优先
信息来自企业官方招聘渠道
OfferSeek 对公开岗位信息进行聚合、去重和结构化整理,最终申请以企业官方页面为准。
