阿里巴巴
研究型实习生 — Agentic 大模型数据合成与训练算法
岗位职责
当前 Agent 能力的瓶颈在“可训练的任务与环境”的供给:真实世界中值得学习的任务往往长程、多工具、结果难以自动判定,既难以规模化获取,合成成本也极为高昂。团队围绕这一瓶颈聚焦 Agentic 数据的合成与验证,已在 coding、通用办公、垂域办公、科学研究、AI2AI 等场景形成稳定的业务支撑,并针对成本问题开展精细化轨迹合成研究;推动领域专家模型的训练,让合成数据真正转化为模型能力,产出高水平论文与技术报告。 本岗位参与其中最核心的环节:从模型自身弱点出发,自动生产可强化学习训练的任务环境与高质量轨迹,并回灌训练形成自迭代的数据飞轮。 职位描述:
研究模型能力诊断与弱点驱动的数据生成方法。从模型真实失败行为中刻画能力边界与错误模式,反向决定合成任务的难度分布与领域配比;并通过多智能体协作的「错误定位—归因诊断—修正续写」闭环,把大规模低质量轨迹提纯为高信息密度的训练信号,让失败案例成为最有效的监督来源。
研究复杂可执行环境、长程任务与可验证奖励的自动化合成方法。在保证可扩展性的前提下,让合成任务的复杂度与保真度逼近真实工作流(数十至上百的输入文件与执行步骤、跨文件跨工具的深层依赖、多轮交互中的需求变更与目标漂移),并配套设计客观可信的验收体系(Rubric 设计与迭代、真实环境执行校验、评分器区分度与稳定性评估)
完成从数据到能力的端到端闭环并推动算法创新。将合成数据用于Agentic 训练,量化不同数据策略与配比对模型能力的实际增益,持续迭代模型在 Agent 场景的表现,并沉淀发表高水平论文或技术报告。
目标场景验证通用性与可迁移性。将上述能力应用到具体场景,解决具体的数据合成和Agentic训练问题,包括但不限于:办公领域的超复杂文档处理任务;基于真实用户多轮对话反馈的长程软件工程任务;金融、法律、医疗、CS 等垂直领域的典型办公与研究流程;以及面向生物、化学、材料、物理等理工科研的自动化科研智能体。
任职要求
博士在读优先(优秀硕士在读亦可),计算机科学与技术、数学、自动化及相关专业;
熟悉常见深度学习框架(PyTorch 等),有 LLM 后训练(SFT / RLHF / RLVR)或 Agent 相关实践经验者优先,有一作顶会论文或高质量开源项目经验者优先;;
具备较强的问题定义与拆解能力和扎实的工程实现能力,能独立搭建并调试数据合成管线与沙箱化任务执行环境;
有金融、法律、医疗、生物、化学、材料、物理等垂直领域背景,将是显著加分项;
能保证每周 4 天以上、连续 6 个月以上实习时间者优先。
信息来自企业官方招聘渠道
OfferSeek 对公开岗位信息进行聚合、去重和结构化整理,最终申请以企业官方页面为准。