阿里巴巴
算法工程师-RL数据
岗位职责
你将深度参与强化学习后训练数据产线的构建,通过迭代数据来优化基模的各种能力。
结合训练需求和模型能力分析,确定 RL 数据的覆盖范围与优先级;从多种渠道的海量数据里筛选挖掘样本并构建出清晰、可执行的问题描述。
针对 Coding 及 Work 等场景,以人机协作的方式设计并构建Agent的运行环境,以及可量化的 Verifier 或多维度打分 Rubric。需要保证环境和Judge的正确性、完整性、鲁棒性,且持续迭代以应对 Reward Hacking等各类挑战,确保评估信号与训练目标对齐。
端到端搭建批量化的数据生产与验证 Pipeline,涵盖任务生成、轨迹采样、自动校验和质量过滤,保障进入训练的数据可信、可追溯。
与领域专家和算法/训练等团队紧密配合,将模型效果反馈转化为数据策略调整(任务难度、Reward 信号、标注规范等)。
任职要求
计算机、数学、统计学等相关专业硕士/博士优先,优秀本科生不受限制。有顶会论文(ACL/EMNLP/ICLR/NeurIPS/ICML等)/高影响项目/开源贡献者加分。
具备Data-centric AI意识,精通后训练所需高质量数据挖掘与构造,具备合成数据(Synthetic Data)与动作轨迹(Trajectory)构建实践经验者优先。
能理解 Reward Modeling 基本原理及 Reward 信号设计对 RL 训练(PPO/GRPO/DAPO 等)的影响,有 RL/Post-Training 研究或机器学习Applied Scientist 相关经历者优先,
熟练使用 Python,熟悉主流的harness/agent框架,能独立完成数据处理脚本、自动化 Pipeline 和 QA 校验工具的开发
沟通与文档能力:优秀的书面表达能力,能产出清晰的 Rubric 规范、技术方案和问题定义文档;善于跨团队协作,能将算法侧的模型反馈准确翻译为数据策略调整。
有大规模机器学习任务调优经验者优先,有某个领域任务深度经验者优先(数学物理,ACM,kernel研发,高并发/HFT,软件工程,research,science等) 对LLM,AGI/ASI感兴趣,践行AI Native工作范式者优先
信息来自企业官方招聘渠道
OfferSeek 对公开岗位信息进行聚合、去重和结构化整理,最终申请以企业官方页面为准。