阿里国际
Agentic Post-Training算法实习生
岗位职责
【关于我们】 团队负责Accio Agentic模型整体后训练,核心关注coding和computer use能力,通过持续探索Agent、Agent Harness、Post-training、RL、Memory等前沿技术,自研Agent模型、Agent系统,实现B2B AI Agent跨越式发展。我们拥有充足的计算资源(H100/B200 集群)、真实的大规模商业场景(覆盖海量活跃供应商与全球买家)、开放包容的研究氛围、高人才密度的团队指导。在这里,研究成果不仅能产出学术论文,还能直接作用于海量的真实B2B贸易场景。
【职责描述】
核心模型演进: 深度参与大规模 Agentic LLM 的全链路研发,涵盖 Mid-train/CPT、SFT 及 RL 阶段,探索领域知识增强与多任务学习的前沿技术,表现突出者可在核心tech report中署名;
工程化与基准建设: 参与构建代码库级别的 Benchmark,优化模型在多语言、多框架环境下的跨模块调用与依赖分析性能;
Black-box Agent RL & Online Learning a. 策略建模与优化: 深入研究 Black-box Reward/Value Function 的建模,解决 Agent 在不可导环境反馈下的策略梯度估计问题; b. 持续探索架构: 设计并实现高性能的 Online RL 框架,支持 Agent 在真实操作系统与开发环境中进行大规模并发探索与在线策略迭代; c. 长程推理研究: 针对 Long-horizon RL 场景,攻克 Credit Assignment(信用分配)难题,提升 Agent 在多步推理(Multi-step Reasoning)下的决策稳定性;
Computer-Use Agent 系统建设 a. 全链路数据 Scaling: 参与构建海量真实用户交互数据的自动化生产流水线,覆盖办公场景与自动化流程,实现数据的高效回流与训练闭环; b. 数字任务执行核: 开发基于 Bash、Skills、MCP(Model Context Protocol)的执行引擎,构建能够熟练使用各种 CLI 工具与数字插件的 Agent 核心模型; c. 多场景交互闭环: 探索 Agent 与真实操作系统、浏览器及专业开发环境的交互,在 Terminal、MLE-bench 等复杂基准测试中验证模型的端到端任务完成率。
任职要求
深厚的技术背景:计算机、信息科学、数学或相关专业硕士/博士学位,业界AI/Agent团队的相关实习和工作经验;
有较好工程能力,有Coding/Search Agent构建、Agent记忆系统构建、Multi-agent协作设计者优先;
有较强的自驱力、学习力、创新力和抗压能力,能够跟上正在快速变化的AI时代;
加分项:在ICLR、CVPR、ICCV、ACL、NeurIPS等顶会上发表过高质量论文,有高质量github开源项目者优先。
信息来自企业官方招聘渠道
OfferSeek 对公开岗位信息进行聚合、去重和结构化整理,最终申请以企业官方页面为准。