阿里国际
研究型实习生-大模型后训练-Accio Work
RESPONSIBILITIES
岗位职责
【项目介绍】 本项目旨在通过 RL 与其它后训练方法,提高Agent模型能力,解决包括但不限于 tool use,长程任务等问题。
【岗位职责】
大规模后训练实践: 参与构建大模型后训练/Agent模型训练数据及benchmark,利用分布式训练框架(如 Megatron-LM, verl)进行大规模模型调优;
算法研究与优化: 探索大模型、Agent相关的前沿算法,产出 Novelty 和实用性兼具的工作;
前沿追踪:Follow 最新的学术工作,逐步养成比较好的 taste。
REQUIREMENTS
任职要求
背景: 计算机、数学或相关专业在读(硕士/博士优先),熟悉大模型训练流程;
技术栈: 熟悉 PyTorch,对 Megatron,Deepspeed 等分布式框架和分布式并行策略(TP/PP/DP/CP)有实操经验;
良好的论文阅读与工程实现能力,希望在顶会(NeurIPS, ICLR, CVPR)发表高影响力工作。
信息来自企业官方招聘渠道
OfferSeek 对公开岗位信息进行聚合、去重和结构化整理,最终申请以企业官方页面为准。