Token Foundry
日常实习生-大模型数据评测-Qwen基础模型
岗位职责
千问(Qwen)是由阿里巴巴自主研发的超大规模语言模型,具备跨语言、跨任务的理解与生成能力。我们通过 RL、SFT、RFT 等技术探索大模型潜能,并致力于提升其 Agent 能力,让大模型真正服务于真实世界。而模型能力提升的每一步,都依赖一套能精准刻画"模型现在会什么、还差什么"的评测数据体系。在这里,你将亲手构建那些真正定义模型能力边界的评测集,让自己的每一个设计决策都写进下一代 AI 的验证标准里。 这意味着要审慎思考评测任务设计、评估方法论与数据管线架构,并始终关注评测设计如何影响下游训练决策。该岗位处于后训练与模型评估方法论的交叉点:你需要理解一条 RLHF 管线需要怎样的能力信号、什么才是一道能真正区分模型强弱的评测题、如何避免评测数据中的偏置与泄漏,以及如何让评测结果可复现、可解释、可迭代。然后,配合模型训练需求,构建能可靠、批量化产出评测数据的工作流。 具体来说,你将围绕"评测数据的设计—生产—质量—分析"全链路开展工作:
构建端到端的评测数据工作流,从评测任务设计、样本构造、质量校验到交付上线,确保每个环节产出的数据能有效支撑 SFT、RL、模型选型与能力迭代;
设计并维护覆盖通用能力、指令跟随、推理、代码、Agent 工具调用、多语言等方向的评测数据集与 benchmark,持续补充模型当前暴露出的薄弱场景;
搭建自动化评估与人工评测相结合的数据质量框架,在数据生产、校验、评审过程中提前发现偏置、噪音、重复与泄漏问题,并建立可落地的反馈闭环;
参与评测结果分析与错误案例归类,提炼模型能力短板与失败模式,输出可沉淀的评测方法论、评测标准或复用工具;
与算法、标注团队协作改进评测数据管线,在不牺牲质量的前提下,通过结构性、方法性改动提升数据生产效率与评测可信度。
任职要求
计算机科学、人工智能、电子工程、数学、统计学等相关专业本科及以上学历,硕士优先;
具备良好的编程与工程实现能力,熟悉 Python,掌握常用数据处理与脚本工具,能独立完成数据处理、统计分析和小型评测工具开发;
具备系统性的数据分析与任务设计能力,理解评测任务设计对模型能力判定的影响,能兼顾整条评测数据管线,而不只是分析末端结果;
在自然语言处理、大语言模型、Agent、计算机视觉等方向具有良好知识基础,熟悉主流评测指标、评测方法与开源 benchmark,理解准确率、F1、胜率、指令遵循率等指标背后的适用边界;
熟悉 LLM 后训练范式(如 SFT、RL),并对"评测数据如何反映模型真实能力、如何影响训练决策"有可用的直觉;
对标注规范、数据质量、评测可复现性有较强的敏感度和责任心,能够写出清晰、可执行的评测任务说明与质量校验规则;
具备良好的科研能力,在相关领域国际顶级会议(ACL、EMNLP、CVPR、ICCV、NeurIPS、ICLR、AAAI 等)有论文发表者优先;
拥有数据建模、Kaggle 等竞赛获奖经历,或拥有知名开源项目贡献经历,在开源社区具有一定影响力者优先。
信息来自企业官方招聘渠道
OfferSeek 对公开岗位信息进行聚合、去重和结构化整理,最终申请以企业官方页面为准。