科大讯飞
词元星火-大模型推理引擎研发工程师-北京(J13589)
岗位职责
负责大模型推理框架设计与研发,主导计算图编译、算子融合、动态批处理、推理调度等核心模块优化,持续提升框架通用性与推理性能。
深耕Transformer模型推理优化,落地Attention加速、模型量化、KV Cache优化、显存复用等技术,解决超大模型显存溢出、推理延迟高、吞吐低等工程痛点。
负责多机多卡分布式推理系统研发,优化张量并行、序列并行及跨设备通信调度,支撑万亿级参数模型分布式高效推理。
完成推理引擎及自定义高性能算子在昇腾、海光等国产AI加速卡的适配、迁移与性能调优,搭建国产化高性能推理体系。
跟进业界前沿推理技术与开源框架(vLLM/SGLang/TensorRTLLM),完成技术选型、方案落地与技术沉淀,赋能业务高效迭代。
任职要求
本科及以上学历,计算机、人工智能等相关专业,3年以上大模型推理系统、高性能计算研发经验,具备千亿级模型部署落地经验者优先。
精通主流大模型推理框架与优化方案,熟练掌握量化压缩、算子优化、计算图编译、显存精细化管理等核心技术。
深刻理解Transformer推理机制,熟练运用FlashAttention、PagedAttention等主流加速技术,具备超大模型推理性能调优实战经验。
熟悉GPU/NPU异构硬件架构,掌握CUDA开发,有昇腾CANN、海光DCU、国产NPU算子开发与平台适配经验者优先。
具备高性能代码开发能力,熟悉分布式推理通信与调度机制,能独立排查并解决线上推理性能与稳定性问题。 优先条件
有万亿级大模型推理引擎研发、框架重构及大规模线上落地经验;
长期深耕国产AI硬件平台,具备完整的国产化推理优化落地项目经验;
有推理框架、高性能算子开源贡献或相关技术成果沉淀者优先。 岗位优势 核心技术攻坚岗位,直面行业前沿大模型推理工程难题;团队技术氛围浓厚,硬件算力资源充足,完善的成长与薪酬激励体系,兼具技术深度与职业成长空间。
信息来自企业官方招聘渠道
OfferSeek 对公开岗位信息进行聚合、去重和结构化整理,最终申请以企业官方页面为准。