Token Foundry
日常实习生-大模型后训练 (Post-training)-Qwen基础模型
岗位职责
高质量数据合成与构造:针对推理(数学/STEM)、通用(指令/知识/写作/安全)及垂直领域(医疗/法律/金融),构建与合成高质量数据,突破复杂推理与专业知识的数据瓶颈。
强化学习与偏好对齐:重点攻坚 Reasoning RL、Rubric RL、RLVR、RLHF,设计并优化多维度 Verifier 与 Reward Model,提升模型的思考深度与人类偏好对齐效果。
自适应链路优化:面向高频交互场景,训练模型的自适应决策与工具路由能力,使其精准理解意图并自动调用搜索、CI、生图等工具,提升真实业务体验与系统鲁棒性。
多 Harness 通用能力构建:针对 Reasoning、自适应搜索、Claude Code / Hermes / Claw 等不同Harness,定向优化模型的指令跟随、安全等底层通用对齐能力。
全链路训练与阶段联动:主导 Mid-training、SFT、RL 的全链路训练。深度优化数据配比与训练策略,解决多阶段数据冲突与能力遗忘,保障模型高质量合版。
日志挖掘与数据飞轮建设:深度挖掘海量真实用户交互日志,结合自动化与人工反馈链路,构建持续迭代的“数据飞轮”,让模型在真实反馈中不断自我进化。
任职要求
对大模型后训练有深入理解和数据直觉,熟悉常见的数据构造策略和 RL 算法,具备算法设计到代码落地的完整经验。
具有较强的代码工程能力,精通 Python 以及 Pytorch 等深度学习框架,熟悉 LLM 框架(如 vLLM、verl)的实现。
对基础模型的前沿问题有持续热情,具备独立思考能力和系统性研究思维,敢于挑战现有范式;能够独立应用技术解决复杂问题,主导或深度参与过有影响力项目的人选优先。
具备跨学科视野与协作意识,能够与工程、产品等多学科团队紧密合作,推动研究成果快速落地并产生实际影响力。
信息来自企业官方招聘渠道
OfferSeek 对公开岗位信息进行聚合、去重和结构化整理,最终申请以企业官方页面为准。