Token Foundry
日常实习生-预训练数据算法-Qwen基础模型
RESPONSIBILITIES
岗位职责
参与Qwen大模型预训练数据的算法设计与体系建设,面向海量文本、代码、多模态等数据,开展数据采集扩充、质量评估、筛选配比和合成优化,建设高质量、可持续迭代的预训练数据管线。
参与建设面向mid-train阶段的模型驱动的合成与质检链路,围绕知识、推理、代码、长文、Agent、多模态等核心能力方向,形成数据生产、质量控制与训练反馈的闭环优化机制,不断提升数据密度、能力针对性与最终训练收益。
持续完善数据实验与验证链路,构建覆盖不同模型参数规模的数据scaling研究策略,系统分析数据策略在不同参数规模下的收益迁移与效果一致性,同时丰富预训练评测体系,跟进大模型前沿技术研究,推动预训练数据闭环迭代,打造业内领先的数据算法能力。
REQUIREMENTS
任职要求
计算机科学、人工智能、机器学习、软件工程或相关专业在读,具备扎实的学术基础与技术能力。
在大语言模型或多模态大模型相关方向具备深厚的理论基础和实践经验,在深度学习、优化算法、大规模数据处理、大规模模型训练等领域有一定经验的优先。
具备优秀的研究与工程能力,在顶级会议/期刊发表过高水平论文,或在开源、竞赛、产业项目中展现出有影响力成果的优先。
熟悉主流深度学习框架、分布式计算框架,能够完成复杂模型和数据算法实现与大规模训练优化。
对前沿AI技术充满热情,具备独立思考、系统研究、复杂问题解决以及良好的协作沟通能力,能够参与研究成果的高效落地。
信息来自企业官方招聘渠道
OfferSeek 对公开岗位信息进行聚合、去重和结构化整理,最终申请以企业官方页面为准。