offerseek.ai让每个人都能找到适合自己的机会
首页岗位聚合岗位雷达简历中心投递工作台价格岗位详情
登录状态读取中
offerseek.ai · 聚合全网官方招聘渠道所有岗位均跳转至企业官方投递页面
岗位聚合/具身后训练/强化学习算法工程师

均胜集团

具身后训练/强化学习算法工程师

⌖上海市社招
49 天前更新2026/07/10
JOB#4028
RESPONSIBILITIES

岗位职责

  1. 01

    负责具身策略模型的后训练方法研究与工程实现,覆盖 SFT、模仿学习、行为克隆、DAgger、离线强化学习、在线强化学习、RLFT、偏好优化和奖励建模等方向。

  2. 02

    面向机器人操作任务设计策略优化方案,包括抓取、放置、推拉、插拔、开关门/抽屉、上下料、多步骤操作和长程任务等场景。

  3. 03

    研究基础策略模型到具体任务技能的适配路径,探索如何通过任务数据、失败样本、奖励信号、评测反馈和在线交互提升模型表现。

  4. 04

    负责机器人策略学习中的数据使用策略,包括轨迹筛选、成功/失败样本分析、正负样本构造、hard case mining、数据重加权、数据混合和课程学习。

  5. 05

    设计奖励函数与奖励建模机制,包括任务完成奖励、过程奖励、安全约束、接触质量、动作平滑性、轨迹效率、碰撞惩罚和人为偏好反馈等。

  6. 06

    研究离线到在线的策略迭代方法,探索如何在离线数据预训练基础上,通过仿真交互、真机小规模试验或评测反馈进行安全有效的策略提升。

  7. 07

    负责策略评测体系设计,定义任务成功率、稳定性、泛化能力、动作质量、安全性、恢复能力、长程任务完成率等指标,并建立回归评测流程。

  8. 08

    分析机器人任务失败原因,区分数据问题、模型问题、动作空间问题、感知问题、控制问题、场景分布问题和评测定义问题,并提出改进方案。

  9. 09

    与数据、仿真、机器人软件、部署和评测团队协作,打通策略训练、仿真验证、真机测试、失败样本回流和模型迭代流程。

  10. 10

    跟踪具身智能后训练、机器人强化学习、offline-to-online RL、VLA/RDT/策略模型微调、World Model/Action Model、偏好优化和自动评测等前沿方法,并评估其落地可行性。

  11. 11

    输出实验设计、训练配置、模型对比、失败分析、消融实验和方法总结,沉淀可复用的策略迭代方法和实验规范。

  12. 12

    推动有效算法方法工程化,包括训练脚本、数据接口、奖励接口、评测接口、实验追踪、模型版本管理和复现实验环境建设

REQUIREMENTS

任职要求

  1. 01

    硕士及以上学历,强化学习、机器学习、机器人、人工智能、自动化、计算机等相关方向;优秀本科候选人如具备扎实项目经验也可考虑。

  2. 02

    2 年以上强化学习、模仿学习、机器人学习、策略优化、多模态模型后训练或相关方向研发经验;有真实机器人或仿真机器人任务经验者优先。

  3. 03

    熟悉机器人策略学习基本范式,包括行为克隆、SFT、DAgger、离线 RL、在线 RL、RLFT、奖励建模、偏好优化、轨迹优化等方法。

  4. 04

    熟悉 PPO、SAC、TD3、IQL、CQL、DPO、GRPO、RLOO、RECAP、RLT、DAgger 等方法中的至少部分,能够根据任务特点判断方法适用边界,而不是只会套用算法。

  5. 05

    熟悉 PyTorch 及深度学习训练工程,具备独立实现训练流程、调试模型、分析 loss/metric、管理实验和复现实验结果的能力。

  6. 06

    理解机器人数据特点,包括多模态观测、动作序列、时序对齐、状态反馈、末端位姿、关节控制、夹爪状态、接触信息、任务结果和 episode 级数据组织。

  7. 07

    理解机器人动作空间和控制约束,能够分析连续动作、离散动作、末端控制、关节控制、轨迹生成、动作平滑、安全边界和控制频率对策略学习的影响。

  8. 08

    具备系统实验能力,能够围绕一个任务设计训练方案、评测指标、对照实验、消融实验和失败归因,而不是只关注单次训练结果。

  9. 09

    具备较强问题诊断能力,能够判断任务失败来自数据分布不足、奖励设计不合理、模型容量不足、观测缺失、动作空间不匹配、sim-to-real gap 或部署链路问题。

  10. 10

    有具身基础模型、VLA、RDT、Diffusion Policy、ACT、World Model、Action Model、多模态策略模型或机器人大模型相关经验者优先。

  11. 11

    有 Isaac Lab、MuJoCo、ManiSkill、LIBERO、RLBench、Gymnasium、Robosuite、LeRobot、RLlib、verl、OpenRLHF、RLinf 等工具或框架经验者优先。

  12. 12

    有仿真到真机迁移、真实机器人在线学习、安全探索、失败样本回流、自动评测或策略部署经验者优先。

  13. 13

    具备良好的论文跟踪和方法复现能力,能够判断前沿方法是否适合当前任务,并将研究方法转化为可验证的工程实验。

  14. 14

    具备良好的沟通协作能力,能够与数据、仿真、机器人软件、推理部署和评测团队共同推进策略迭代闭环

✓

信息来自企业官方招聘渠道

OfferSeek 对公开岗位信息进行聚合、去重和结构化整理,最终申请以企业官方页面为准。

对这个机会感兴趣?

登录后前往企业官方投递

这个岗位已超出 7 天时效窗口(49 天前更新),可能已经停止招聘,建议先确认官方页面是否仍在招。

跳转前请再次确认岗位状态与申请要求
岗位档案POSITION FILE
企业均胜集团
地点上海市
类型社招
发布日期2026/04/09
更新日期2026/07/10
官方来源app.mokahr.com