幻方&DeepSeek
后训练(数据/算法)研究员
RESPONSIBILITIES
岗位职责
持续迭代与优化强化学习算法,在预训练模型与数据既定的条件下,最大限度地释放模型潜力。
跨部门团队紧密协作,构建高质量、高多样性的后训练数据集;设计并落地自动化数据清洗、评测及合成管线,系统性提升模型在写作、问答、Agent 等核心场景的表现。
建立科学、敏捷、多维度的模型能力评测体系,覆盖通用能力与 Agent 场景,精准定位模型短板并驱动针对性优化。
【岗位要求(满足其一即可)】
REQUIREMENTS
任职要求
对大模型后训练有深入理解,熟悉 RLHF / RLVR / PPO / GRPO 等主流强化学习框架与范式,具备从算法设计到工程落地的完整经验。
具备扎实的数据直觉与工程能力,能够从复杂、多源的数据中提炼信号,并将数据清洗、筛选与合成流程系统化、自动化。
对模型评测有方法论层面的思考,不满足于"刷benchmark",而是能设计出真正反映模型能力边界与短板的评测方案
信息来自企业官方招聘渠道
OfferSeek 对公开岗位信息进行聚合、去重和结构化整理,最终申请以企业官方页面为准。