阿里巴巴
日常实习生-数据智多星-Agentic & Coding 大模型方向
岗位职责
团队介绍: 我们专注于大模型在 Agentic & Coding 领域的评测范式探索与高质量数据构建,不仅核心支撑 Qwen 系列等大模型业务的交付迭代,更致力于在前沿方向探索下一代评测与数据体系,坚持产业落地与前沿探索并重。团队在业界已建立起显著的技术影响力,主导及参与了包括 SWE-CI、QwenClawBench、Terminal-Bench-Pro、Let It Flow (ROME Model)、HLE-Verified、V-GameGym 等多项前沿研究与基准构建工作。 岗位职责方向(参与其中任一方向) Agent
复杂 Agentic 环境合成和 Infra 研究:负责复杂 Agentic 环境合成及评测集交付;设计并搭建统一的数字 Agent 评测基础设施,构建更加复杂的 Agent 环境基建。
持续学习与记忆评测、长程任务评估:研究大模型持续学习机制,构建针对长周期记忆检索、经验复用及动态知识更新的评估框架,沉淀 Agent 自主学习与长效记忆评测集。
世界模型评测与数据:搭建世界模型环境,评估模型对数字世界状态转移的理解和决策推演能力;交付世界模型评测集,以及状态推演与决策轨迹的高质量数据集。
Agent 失败模式与可解释性研究:深入 Agent 和模型架构层进行可解释性工作;研究 Agent 运行中间轨迹的自动化分析方法,定位模型失败根本原因,提供专业下探与诊断能力,指导模型定向优化。 Coding
参与内部Coding自建评测集构建,制定大模型评测在Coding方向的评测标准以及评测体系构建;
调研Coding公开评测方法,并将Coding公开评测集集成至内部平台;
探索智能高效的大模型Coding评测方案,主导开发评测工具。
任职要求
学历要求: 博士在读(优秀的硕士生可放宽限制),计算机、人工智能、软件工程、认知科学、脑科学、大数据技术、数据科学或其他AI相关专业。
技术背景: 熟悉LLM as judge/Agent as judge/ReAct等技术,有大模型训练/评测经验,熟悉大模型评测方法,对大语言模型(LLM)、智能体(Agent)、强化学习或相关底层架构有深入理解,具备扎实的编程能力与工程实现能力。
研究能力: 具备独立提出问题、设计实验并解决复杂问题的能力。有顶级会议(如ACL, ICLR, NeurIPS, ICML, COLM等)论文发表经验者优先。获得过ACM、NOI金牌或同等水平竞赛奖项优先。
团队协作:具备优秀的沟通协调能力和团队协作意识,擅长沟通与表达优先。
实习时间:为了保证研究的完整性与成果落地,实习期要求不少于3个月(建议3-6个月),能够沉下心推进完整的闭环研究。
信息来自企业官方招聘渠道
OfferSeek 对公开岗位信息进行聚合、去重和结构化整理,最终申请以企业官方页面为准。