科大讯飞
词元星火-大模型训练Infra工程师-合肥(J13590)
RESPONSIBILITIES
岗位职责
负责大规模分布式训练框架的设计、开发与优化,覆盖预训练和后训练全流程,支撑千卡/万卡级别集群的高效训练
优化训练性能,包括并行策略(数据并行、张量并行、流水线并行、专家并行)、通信优化、显存管理与计算重叠,针对特定模型挖掘芯片的极致性能
排查并解决训练过程中的性能瓶颈和稳定性问题,联合训练平台保障超大集群任务训练稳定性
与算法团队紧密协作,针对新模型结构提供框架层面的支持与适配
跟进业界前沿技术,推动训练框架在效率、成本、稳定性上的持续演进
REQUIREMENTS
任职要求
计算机、软件工程或相关专业本科及以上学历
扎实的编程能力
熟悉流深度学习框架及其分布式训练机制
深入理解分布式训练原理,熟悉 Megatron-LM、DeepSpeed、FSDP等主流框架中至少一种的实现细节
熟悉 GPU 体系结构与 CUDA 编程或者其他国产加速芯片和配套软件栈(昇腾NPU、海光DCU等),了解算子优化、混合精度训练(FP16/BF16/FP8)
具备大规模训练任务的性能分析与调优经验(Nsight、profiler 等工具) 加分项
有千卡以上规模训练或万亿参数模型训练的实战经验
熟悉 Triton、CUTLASS 等高性能算子开发
在 MoE 训练、长序列训练、训练稳定性等方向有深入实践
有开源社区贡献或相关技术论文发表
信息来自企业官方招聘渠道
OfferSeek 对公开岗位信息进行聚合、去重和结构化整理,最终申请以企业官方页面为准。