Shopee
(27届 ASP)AI-Agent后训练算法工程师
岗位职责
你将加入大模型后训练核心团队,负责下一代 AI 智能体系统基础大模型的后训练体系搭建。我们的目标是在大模型基座上开展对齐、偏好优化、工具增强、多智能体协同专项后训练工作,通过系统性后训练优化打通模型任务执行链路,让基座大模型驱动的智能体深度嵌入全场景工作流,实现跨设备、跨应用、跨团队复杂长链路任务自主规划与闭环执行。 具体职责包括: 参与大模型后训练数据体系建设,围绕 AI Agent、工具调用、多轮对话、用户画像、结构化输出等场景,构建高质量 SFT、偏好优化和评测数据。 参与 SFT / DPO / KTO / RLAIF 等后训练实验,包括数据清洗、样本构造、训练配置、实验跟踪、效果评估和 bad case 分析。 参与偏好数据构建,设计 response pair、ranking、rejection sample、hard negative、self-refinement 等数据生成与筛选流程。 参与自动化数据合成 pipeline 建设,使用强模型、规则校验、LLM-as-judge 和人工抽检提升训练数据质量。 参与后训练评测体系建设,覆盖指令遵循、多步推理、工具调用、JSON/schema 输出、长上下文、个性化记忆、安全拒答和幻觉抑制等能力。 分析线上 trace、用户反馈和模型失败案例,将 bad case 转化为可训练、可评测、可复现的数据样本。 协助进行小规模训练实验、消融实验和模型对比,分析不同数据配比、训练方法、prompt 策略对模型效果的影响。 跟进 LLM post-training、alignment、preference optimization、synthetic data、agent training 等方向论文,并参与复现或内部分享
任职要求
学历背景 :计算机、人工智能、机器学习等相关专业全日制在读硕士或博士,2027年毕业。 编程与工程能力 :扎实的 Python/C++ 基础,熟悉大模型数据构建、训练、评测、部署及原型开发全流程。 算法基础: 理解 Transformer、LLM、SFT、RLHF、DPO、reward model、instruction tuning 等基础概念。 数据敏感度 :具备较强的数据敏感度,能够从 bad case 中归纳问题类型,并设计对应训练样本。 综合素质 :优秀的分析问题能力与团队协作精神,对 AI 前沿技术保持强烈好奇心与自驱力。 加分项 有 SFT、LoRA、DPO、KTO、RLHF/RLAIF、reward model 相关项目经验。 熟悉 DeepSpeed、FSDP、vLLM、SGLang、LLaMA-Factory、ms-swift 等训练或推理框架。 有 instruction tuning、偏好数据构建、LLM-as-judge、数据合成、自动化评测经验。 做过 Agent、Function Calling、Tool Use、RAG、多轮对话、代码模型或数学推理相关训练数据。 在顶会(NeurIPS, ICML, ICLR, ACL, EMNLP 等)发表论文或有知名开源项目贡献者优先。 有相关竞赛获奖经历者优先
信息来自企业官方招聘渠道
OfferSeek 对公开岗位信息进行聚合、去重和结构化整理,最终申请以企业官方页面为准。
