Token Foundry
日常实习生-大模型数据标注-Qwen基础模型
岗位职责
千问(Qwen)是由阿里巴巴自主研发的超大规模语言模型,具备跨语言、跨任务的理解与生成能力。我们通过 RL、SFT、RFT 等技术,探索大模型潜能,并致力于提升其 Agent 能力,让大模型能够服务于真实世界。而大模型的能力,正越来越取多地受到"数据"影响——最前沿的模型背后,是一套精心设计的人类数据体系。在这里,你将亲手打磨那些真正让模型变强的数据,让自己的每一个设计决策都写进下一代 AI 的行为里。 这意味着要审慎思考任务设计、评估方法论与数据管线架构——并始终关注上游的设计选择如何影响下游的模型行为。该岗位处于 后训练与人类数据采集方法论的交叉点。你需要理解什么才是好的 SFT 样本、一条 RLHF 管线需要产出怎样的训练信号、如何构建能真正区分模型能力的评估数据集。然后,配合模型训练需求,构建能可靠、批量化产出数据的工作流。 具体来说,你将围绕"数据的生产—质量—交付"全链路开展工作:
构建端到端的数据工作流——从任务设计到质量保证再到交付——确保每个环节产出的数据能够适配后训练需求,产生预期收益(如 SFT、RL、模型评估);
构建并不断完善数据质量框架,能够在生产、标注、校验过程中提前发现问题,并构建反馈机制;
与算法、标注团队合作改进数据管线。在不牺牲质量的前提下,通过结构性、方法性改动提升数据生产效率;
洞察数据生产、数据质量中的规律(通用/专项),转化为可沉淀的标准或可复用的方法。
任职要求
计算机科学、人工智能、电子工程、数学、统计学等相关专业硕士及以上学历优先;
具备出色的编程与工程实现能力,精通至少一门主流开发语言(如 Python、Java 等);
具备系统性的数据分析、任务设计能力,理解任务设计选择对目标数据的影响,能兼顾整条数据管线工作,而不只是分析末端结果;
在自然语言处理、计算机视觉、Agent等方向具有良好知识基础,熟悉深度学习主流框架(如 PyTorch、TensorFlow);
熟悉 LLM 后训练范式(如 SFT、RL),并对"数据质量决策如何映射到模型结果"有可用的直觉;
具备良好的科研能力,在相关领域国际顶级会议(ACL、EMNLP、CVPR、ICCV、NeurIPS、ICLR、AAAI 等)有论文发表者优先;
拥有数据建模、kaggle竞赛等获奖经历或拥有知名开源项目贡献经历,在开源社区具有较好的影响力。
信息来自企业官方招聘渠道
OfferSeek 对公开岗位信息进行聚合、去重和结构化整理,最终申请以企业官方页面为准。