上海人工智能实验室
【高阶岗位】长程推理青年/资深科学家
岗位职责
面向代码研发、科学研究等真实复杂任务,研究大模型智能体的长程推理与强化学习,并建设支撑规模化训练的 RL Infra 和环境 Infra
长程推理与智能体学习 - 研究长程规划、工具使用、记忆管理、结果验证和失败恢复等关键算法 - 研究面向长轨迹的强化学习方法,解决稀疏奖励、信用分配、探索效率和训练稳定性问题 - 建设真实复杂任务的训练与评测方法,以实验结果持续推动模型能力提升
RL Infra - 建设支持长轨迹、多轮交互、异步 Rollout 和分布式训练的强化学习系统 - 优化采样、推理、奖励计算与训练之间的数据流和资源调度 - 提升大规模智能体训练的吞吐、稳定性和资源利用率
环境 Infra - 建设面向代码、终端和科学计算等任务的可交互环境 - 建设可靠的验证器,为训练和评测提供准确、可规模化的反馈信号 - 推动环境与任务的自动生成、质量控制和规模化运行
科研与技术领导 - 提出具有原创性和实际价值的研究课题,主导技术路线与规模化实验 - 产出高水平论文、开源系统或具有显著能力增益的模型成果 - 协同算法、系统、数据和产品团队,推动研究成果落地
任职要求
基本条件 - 计算机科学、人工智能、数学、统计学或相关专业的博士学历且有3年以上相关研究经验 - 在大语言模型、智能体、强化学习或机器学习系统方向有系统积累 - 具备优秀的编程能力,熟练掌握Python、PyTorch等深度学习框架 - 发表过高水平论文,或取得过具有同等影响力的模型、系统及开源成果 专业能力 候选人应在以下至少一个方向具备突出成果,并对其他方向有较强理解: A. 长程推理与智能体强化学习 - 深入掌握强化学习、序列决策、规划搜索和信用分配等核心方法 - 对工具使用、智能体记忆、过程验证和失败恢复具有系统研究 - 具有大模型后训练或智能体强化学习的实际经验 - 能够解决长轨迹训练中的奖励稀疏、策略投机和泛化问题 B. RL Infra 与大规模学习系统 - 深入理解大模型训练、推理及强化学习系统架构 - 具有分布式训练、异步采样或大规模 Rollout 系统研发经验 - 能够系统优化吞吐、延迟、显存、通信和资源利用率 - 能够主导大型训练系统的架构设计与工程落地 C. 环境 Infra 与可验证智能体 - 深入理解智能体环境、工具协议、执行隔离和自动验证机制 - 具有容器、虚拟机、沙箱或分布式任务平台建设经验 - 能够设计真实、稳定、可复现、可验证的训练任务 - 能够识别并治理奖励投机、测试泄漏和环境污染等问题 素质要求 - 对解决具有挑战性的AI问题充满热情,具备独立科研能力和创新思维 - 优秀的沟通表达能力,能够清晰阐述技术方案并与跨职能团队高效协作 - 良好的学术诚信意识与团队合作精神 优先考虑 - 在长程推理、智能体强化学习或机器学习系统方向取得过有影响力的成果 - 主导过 Coding Agent、Research Agent 或其他长程智能体项目 - 负责过大模型 RL Infra、Rollout 系统或环境平台建设 - 具有大规模模型训练、并发环境运行或开源项目核心研发经验
信息来自企业官方招聘渠道
OfferSeek 对公开岗位信息进行聚合、去重和结构化整理,最终申请以企业官方页面为准。
