Shopee
(ASP Intern)LLM-大模型对齐算法工程师
岗位职责
我们正在系统性地推进大模型的能力对齐(Alignment),覆盖 Mid-training → SFT → RL 的全链路优化:用 mid-training 补齐基座能力上限,用 SFT 冷启,用全方位的强化学习算法(PPO、GRPO、DPO等)把模型潜力锐化为稳定可靠的输出。你将参与 Reasoning(数学 / 逻辑 / STEM)、Coding(代码生成 / SWE Agent)、General(指令遵循 / 多轮 / 长文本 / 多语言)中一个或多个方向的算法与数据建设,推动自训模型在关键 benchmark 上追平至超越目标模型。 重点研究方向 模型训练机理与可解释性。 Motivation:Scaling 收益正显现边际递减效应,低垂的果实已被快速收获,新的突破必须从底层原理出发——深入理解 mid-training / SFT / RL 过程中模型能力如何形成、迁移与遗忘,为训练决策提供机理级依据而非经验试错。 强化学习与模型能力边界提升。 Motivation:前瞻性的强化学习技术储备。实验计划:细粒度反馈(fine-grained / process-level feedback)、类 AlphaZero 的自我探索(self-play / self-exploration)提升基础模型的能力上限。 多领域能力合并(Multi-domain Merge)。 研究在合并多个能力域(数学 / 代码 / 逻辑 / 指令遵循 / 长文本等)时如何减少相互掉点,探索达到帕累托最优的合并算法。 数据构建。 面向数学、代码、逻辑、STEM 等推理能力的高质量数据构建,包括:长思维链(long CoT)轨迹的合成与蒸馏、教师选型与胜者筛选、可验证答案 / 用例的自动生成、按考点分布与失败机制的定向配比、难度分层与去污染,以及 generate → verify → filter → train → regenerate 的自迭代闭环。 岗位职责 参与 Mid-training / SFT / RL 全链路 post-training 方法的研究与落地,掌握并灵活运用全方位的强化学习算法,包括 PPO、GRPO、DPO 等,在真实训练环境中做能力对齐。 参与各阶段的联合优化:mid-training 的数据配比与基座能力抬升、SFT 的教师选型与配方、RL 的奖励设计与策略优化,理解并权衡三个阶段在能力天花板(pass@k)与稳定输出(pass@1)上的分工。 探究 post-training 的 scaling 规律与能力边界提升,例如如何做更久 / 更稳定的 RL(延长有效训练步数、缓解熵坍缩与奖励饱和)、细粒度 / 过程级反馈(fine-grained / process reward),以及类 AlphaZero 的自我探索(self-play / self-exploration),持续抬升基础模型的能力上限。 设计并实现奖励信号与自动评测器(如代码判题、数学答案校验、指令约束校验、Agent 任务成功率),保证 reward 正确性锚定在模型之外、不产生自我强化误差。 参与高质量训练数据构建:数据合成与蒸馏、去重去污染、质量打分、失败样本挖掘、偏好数据构建,以及按「有效监督 token / 考点分布 / 失败机制」的定向配比策略。 打通并优化 mid-training / SFT / RL 的训推链路(如 verl / SGLang / vLLM / Megatron),定位并修复训推不一致、熵坍缩、显存与吞吐瓶颈等工程问题。 跟踪 LLM post-training、RL for LLM、reasoning models、Agentic RL、agent evaluation 等方向的前沿论文与开源框架,并快速复现或落地
任职要求
计算机、人工智能、机器学习、数学等相关专业硕士或博士在读。 熟悉机器学习与深度学习基础,了解大模型训练、微调或 post-training 的基本流程。 对强化学习有基础理解,熟悉 PPO、GRPO、reward modeling、policy optimization、credit assignment 等概念者优先。 熟练使用 Python,熟悉 PyTorch;具备良好的工程实现和实验分析能力。 对 LLM 的推理能力、代码智能体、指令遵循、多轮对话、RAG、长文本或多语言中的一个或多个方向有兴趣或实践经验。 能独立阅读英文论文,具备较强的问题拆解、实验设计和结果分析能力。 每周可实习 4 天及以上,实习期 3 个月以上优先。 加分项 有 LLM post-training、SFT、RLHF、RLAIF、DPO、PPO、GRPO、RLVR 等实践经验。 熟悉 verl、TRL、Ray、vLLM、SGLang、Megatron、DeepSpeed 等训练 / 推理框架。 有数据合成与蒸馏、reward design、自动判题、trajectory analysis、sandbox execution、Docker / 容器环境经验。 在 NeurIPS、ICLR、ICML、ACL、EMNLP、AAAI 等会议发表过相关论文,或有高质量开源项目。 有算法竞赛、Kaggle、ACM/ICPC、系统工程或复杂工程项目经验。 你将获得 深入参与前沿 LLM Mid-training / SFT / RL 全链路 post-training 方向的研究与落地,直接对标业界最新开源模型。 接触真实的大规模训练与推理环境、可验证奖励体系、诊断驱动的数据引擎和完整的实验流程。 与算法、工程、产品团队协作,将研究结果转化为下一代基座模型的核心能力。 有机会产出论文、技术报告、开源项目或核心业务成果
信息来自企业官方招聘渠道
OfferSeek 对公开岗位信息进行聚合、去重和结构化整理,最终申请以企业官方页面为准。
