Shopee
(ASP Intern)LLM-大模型强化学习算法工程师
岗位职责
我们正在探索面向复杂真实任务的 Agentic AI 训练方法,目标是让大模型智能体在长程、多步骤、工具调用、多轮反馈的环境中具备更强的任务拆解、规划执行、错误恢复和持续优化能力。 你将参与长程 Agentic 任务的训练环境、奖励建模、轨迹数据、RL 算法和评测体系建设,推动模型在代码、浏览器使用、深度研究、工具调用、多智能体协作等任务上的可靠性提升。 岗位职责 参与长程 Agentic 任务训练与评测环境建设,包括 coding agent、browser use、tool use、research agent、多智能体协作等场景。 研究并实现面向长程任务的 RL/Post-training 方法,包括 PPO、GRPO、DPO/RLHF/RLAIF、trajectory-level reward、process reward、verifiable reward 等。 设计长程任务的奖励信号、自动评测器、任务成功率指标和轨迹质量分析方法。 分析 Agent 在长链路任务中的失败模式,例如上下文遗忘、错误累积、无效探索、工具误用、目标漂移、低效重试等,并提出训练或系统改进方案。 参与高质量 Agent 轨迹数据构建,包括任务生成、轨迹过滤、失败样本挖掘、偏好数据、合成数据和蒸馏数据。 进行算法实验和 ablation,分析数据、模型、奖励、环境、上下文管理策略对长程任务表现的影响。 跟踪 Agentic RL、long-horizon agents、computer use agents、agent evaluation 等方向的前沿论文和开源框架,并快速复现或落地
任职要求
计算机、人工智能、机器学习、数学等相关专业本科高年级、硕士或博士在读。 熟悉机器学习和深度学习基础,了解大模型训练、微调或 post-training 基本流程。 对强化学习有基础理解,熟悉 PPO、GRPO、reward modeling、policy optimization、credit assignment 等概念者优先。 熟练使用 Python,熟悉 PyTorch;具备良好的工程实现和实验分析能力。 对 AI Agent、工具调用、RAG、多轮推理、任务规划、代码智能体或浏览器智能体有兴趣或实践经验。 能独立阅读英文论文,具备较强的问题拆解、实验设计和结果分析能力。 每周可实习 4 天及以上,实习期 3 个月以上优先。 加分项 有 LLM post-training、RLHF、RLAIF、DPO、PPO、GRPO、verl、TRL、Ray、vLLM 等经验。 熟悉 SWE-bench、WebArena、OSWorld、GAIA、ALFWorld、WebShop、BrowseComp 等 Agent/长程任务 benchmark。 有 coding agent、browser agent、workflow agent、multi-agent system、tool-use agent 项目经验。 有自动评测、reward design、trajectory analysis、sandbox execution、Docker/容器环境经验。 在 NeurIPS、ICLR、ICML、ACL、EMNLP、AAAI 等会议发表过相关论文,或有高质量开源项目。 有算法竞赛、Kaggle、ACM/ICPC、系统工程或复杂工程项目经验。 你将获得 深入参与前沿 Agentic RL/Post-training 方向的研究与落地。 接触真实长程任务环境、Agent 训练数据、评测体系和大规模实验流程。 与算法、工程、产品团队合作,将研究结果转化为可用的 Agent 能力。 有机会产出论文、技术报告、开源项目或核心业务成果
信息来自企业官方招聘渠道
OfferSeek 对公开岗位信息进行聚合、去重和结构化整理,最终申请以企业官方页面为准。
