Shopee
(27届 ASP)LLM-大模型预训练算法工程师
岗位职责
模型结构设计与优化: 深入研究并优化大语言模型的基础架构(如 Transformer 及其变体,MoE 等),探索高效的 Attention 机制、位置编码及新型网络结构,突破模型长上下文(Long-context)和推理效率的瓶颈。 预训练策略与 Scaling 研究: 负责超大规模参数模型的预训练工作,研究 Scaling Laws 并指导算力与数据规模的最优分配;探索并落地前沿的训练策略(如 Curriculum Learning、优化器改进、学习率调度等),持续提升模型基础能力。 预训练数据策略: 深入分析海量多模态/多语言预训练数据分布特征,设计科学的数据混合(Data Mix)与采样算法;探索数据质量与模型能力之间的关联,针对性提升模型在逻辑推理、代码编写、数学计算等核心领域的表现。 分布式训练与稳定性保障: 基于大规模算力集群(千卡/万卡级别),联合系统工程团队优化分布式训练框架(如 DeepSpeed、Megatron-LM),解决训练过程中的 Loss Spike(梯度爆炸/不收敛)问题,保障大规模训练的高效性与极高稳定性
任职要求
学历专业: 计算机、人工智能、数据科学、数学等相关专业硕士及以上学历。 编程功底: 具备扎实的算法与数据结构功底,精通 Python,熟练掌握 C++,具备出色的工程实现能力。 分布式计算: 熟悉至少一种主流大规模分布式训练框架(如 Megatron-LM, DeepSpeed, Colossal-AI),深刻理解数据并行、张量并行、流水线并行及 ZeRO 等内存优化技术。 问题解决: 具备极强的 Debug 能力和问题诊断能力,能够快速定位并解决模型训练中的算法缺陷与系统瓶颈
信息来自企业官方招聘渠道
OfferSeek 对公开岗位信息进行聚合、去重和结构化整理,最终申请以企业官方页面为准。
