宁德时代

强化学习与贝叶斯优化算法工程师(LLM 方向)

蕉城区校招
51 天前更新2026/07/08
RESPONSIBILITIES

岗位职责

  1. 负责强化学习算法的研发与落地,包括但不限于策略优化、离线强化学习、多智能体协作等方向,支撑决策与控制类业务场景。

  2. 基于贝叶斯优化框架,开展超参数调优、黑盒函数优化、实验设计与自动调参系统的设计与实现。

  3. 结合大语言模型能力,探索 RLHF、RLAIF、在线对齐等方向的算法创新,参与语言模型后训练中的强化学习环节研发。

  4. 跟踪前沿学术进展,复现并改进经典与 SOTA 算法,完成算法原型验证、性能评测与工程化落地。

  5. 与产品、工程团队协作,将算法能力封装为标准化组件,支撑业务迭代

REQUIREMENTS

任职要求

学历专业:硕士及以上学历,计算机、数学、统计、自动化等相关专业 知识技能:

  1. 扎实的强化学习理论基础,熟悉值函数方法(DQN 系列)、策略梯度方法(PPO、A2C、SAC 等)、离线 RL 等主流算法,具备至少一个方向的完整实现经验。

  2. 精通贝叶斯优化原理,深入理解高斯过程、采集函数(EI、PI、UCB 等)、多保真优化等核心技术,有实际调优系统开发经验优先。

  3. 具备大语言模型相关实践经验,了解 Transformer 架构、预训练与对齐基本流程,有 RLHF/DPO 相关项目经验者优先。

  4. 熟练使用 Python 及 PyTorch/TensorFlow 等深度学习框架,具备良好的代码规范与工程实现能力。

  5. 具备优秀的数学功底与逻辑分析能力,能独立阅读顶会论文并完成算法复现。 工作经验:1-2 年算法研发相关工作经验 语言:中文、英文4级 其他: • 在 ICML、NeurIPS、ICLR 等顶会发表过强化学习、贝叶斯优化或大模型相关论文。

  • 有开源强化学习框架(如 Stable Baselines、RLlib)或贝叶斯优化库(如 BoTorch、Optuna)的二次开发或贡献经验。

  • 具备推荐系统、自动驾驶、机器人、AIGC 等任一领域的强化学习落地经验

信息来自企业官方招聘渠道

OfferSeek 对公开岗位信息进行聚合、去重和结构化整理,最终申请以企业官方页面为准。