Shopee
(ASP Intern)LLM-大模型预训练算法工程师
岗位职责
模型结构探索: 参与大语言模型基础架构(如 Transformer 及其变体,MoE 等)的研究与实验;协助评估高效的 Attention 机制及新型网络结构,探索突破长上下文(Long-context)瓶颈的方案。 预训练策略与实验: 参与超大规模模型预训练的日常实验与维护;协助团队进行 Scaling Laws 的相关数据跑测与验证;跟踪前沿 Paper,尝试落地新的训练策略(如 Curriculum Learning、优化器改进等)。 预训练数据处理与分析: 参与海量多模态/多语言预训练数据的数据清洗与特征分析;协助团队设计并验证数据混合(Data Mix)与采样策略,观察其对模型在逻辑推理、代码、数学等核心能力上的影响。 分布式框架学习与支持: 在资深工程师的指导下,学习主流分布式训练框架(如 DeepSpeed、Megatron-LM);协助监控大规模集群的训练状态,参与排查和分析训练过程中的 Loss Spike 等异常问题
任职要求
必须(Must-have) 学历专业: 计算机、人工智能、数据科学、数学等相关专业硕士及以上学历。 编程功底: 具备扎实的算法与数据结构功底,精通 Python,熟练掌握 C++,具备出色的工程实现能力。 AI与框架底座: 深入理解 NLP/LLM 基础理论,熟练使用 PyTorch,对大模型的核心算子有深入了解。 分布式计算: 熟悉至少一种主流大规模分布式训练框架(如 Megatron-LM, DeepSpeed, Colossal-AI),深刻理解数据并行、张量并行、流水线并行及 ZeRO 等内存优化技术。 问题解决: 具备极强的 Debug 能力和问题诊断能力,能够快速定位并解决模型训练中的算法缺陷与系统瓶颈。 加分项(Nice-to-have) 熟悉 MoE 训练框架(如 DeepSpeed-MoE、Tutel、Megablocks ),对大规模 Expert Routing、负载均衡与专家并行有深入理解。 熟悉长上下文技术(RoPE 插值、NTK Scaling、Mamba/Linear Attention、分块注意力等)。 有跨模态与文本联合预训练经验(视觉、语音、多模态 Embedding 等) 有 百亿级(100B+)以上参数规模模型 的训练、优化或落地经验者优先。 在国际顶级会议(如 NeurIPS、ICLR、ICML、ACL、EMNLP )发表论文者优先
信息来自企业官方招聘渠道
OfferSeek 对公开岗位信息进行聚合、去重和结构化整理,最终申请以企业官方页面为准。
