曙光信息产业股份有限公司
【2027】大模型训练工程师-天津(J14170)
岗位职责
岗位职责: • 负责大模型(LLM)全流程训练工作,包括数据预处理、训练策略设计、模型调优、训练过程监控与问题排查,主导模型从预训练、微调(SFT、DPO、RLHF)到部署前验证的全链路研发,确保训练效率与模型性能达标。
负责训练数据的筛选、清洗、标注与增强,设计数据质量评估体系,优化数据分布,构建高质量训练数据集,解决数据稀疏、噪声干扰、领域适配性等问题,提升模型泛化能力与输出可靠性。
搭建并优化大模型训练框架与环境,基于PyTorch/TensorFlow等框架,配置分布式训练集群(GPU/TPU),优化训练并行策略(数据并行、模型并行、流水线并行),解决训练过程中的显存不足、速度瓶颈等工程化问题。
负责模型训练参数调优,包括学习率、 batch size、正则化策略、优化器(Adam、Lion等)选型与调参,结合训练日志与验证指标,持续迭代优化模型性能,平衡模型精度、速度与显存占用。
参与大模型技术预研,跟踪预训练模型(Llama、Qwen、ChatGLM等)前沿进展,探索高效训练方法、低资源训练策略、模型压缩与量化等技术,将预研成果转化为实际训练方案,提升训练效率与模型效果。
协同算法架构师、推理工程师,完成训练模型的交付与迭代,提供模型训练相关技术文档、参数说明与部署建议,支撑模型规模化落地与产品化应用。
负责训练过程的监控与运维,搭建训练日志分析、性能监控体系,及时发现并解决训练过程中的异常问题(如训练崩溃、收敛缓慢等),保障训练任务稳定高效推进。
沉淀大模型训练经验与最佳实践,参与制定训练技术规范、数据标准与流程,推动团队训练效率与技术能力提升。
任职要求
任职资格
硕士及以上学历,具备良好的团队协作、沟通对接能力,品行端正、诚实守信;
具备良好的学习能力和技术钻研意识,逻辑思维清晰,具备良好的问题拆解、技术攻关和数据分析能力;
信息来自企业官方招聘渠道
OfferSeek 对公开岗位信息进行聚合、去重和结构化整理,最终申请以企业官方页面为准。