阿里巴巴
代码场景的Agentic RL与数据合成-阿里星
RESPONSIBILITIES
岗位职责
负责 Agentic Model 的训练方法、能力提升与数据合成体系研究,探索大模型在自主决策、规划与工具调用等方面的强化路径,包括但不限于:
针对Agentic模型的训练特点,探索Agentic数据的合成策略与后训练数据配比策略,探索稳定高效的Agentic RL 方案,持续迭代模型在Agent场景的应用性能;
应用并改进Agentic RL算法,提升模型在代码场景中的成功率和鲁棒性;
将业务突破转化为学术成果,支持在 NeurIPS、ICLR、ICML 等顶会发表高质量论文,或推动相关算法在社区的开源,建立行业影响力。
REQUIREMENTS
任职要求
计算机、信息科学、数学或相关专业博士学历,深入理解LLM/MLLM/RL/Agent领域,熟悉DPO/PPO/GRPO等RL前沿算法;
有大规模数据合成、Coding Agent训练、大规模RL训练等项目经验者优先;
有较强的自驱力、学习力、创新力、沟通能力和抗压能力,能够跟上正在快速变化的AI时代;
加分项:在ICLR、ICML、CVPR、ICCV、ACL、NeurIPS等顶会上发表过高质量论文,有高质量github开源项目者优先;
加分项:具有业界AI/Agent团队的相关实习和工作经验。
信息来自企业官方招聘渠道
OfferSeek 对公开岗位信息进行聚合、去重和结构化整理,最终申请以企业官方页面为准。