幻方&DeepSeek
高性能算子/通信/编译器工程师
岗位职责
针对 GPU/NPU 等架构,使用 CUDA、Ascend C 和 TileLang,设计、实现并长期维护 GEMM、Attention 以及其他算子。
针对不同通信场景和网络架构,设计、实现并长期维护通信算子(如 DeepEP 中的 EP、CP/DP、Engram、PP),同时持续对 NCCL/HCCL 等主流集合通信库进行调优和排障。
参与面向深度学习的 DSL 编译器(如 TileLang 等)的研发,负责设计面向新一代硬件的编译优化,并围绕内部实际的新模型、新算子和性能优化的需求扩展 DSL/IR/CodeGen 的能力,并在保持接口的简洁和可维护性的同时尽可能提升性能。
紧贴模型结构和算法演进,和框架同学、研究员共同为新思路设计硬件友好的模型结构和算法,并对真实训练/推理负载持续进行性能分析。
【核心要求】
任职要求
熟悉 C++ 等编程语言,熟练掌握 Git 等工具。
对细节有较高关注,对性能优化有较高热情,眼界广阔,同时对代码有品味的追求。
良好的中文沟通能力。
【加分项】 (不强制要求,也充分欢迎有热情的白纸同学加入)
有过 CUDA 或 Ascend C 算子编写经验,熟悉 CUTLASS、DeepGEMM 等算子库,熟练掌握 PTX ISA、Ascend C API 并深入理解 memory model 和硬件体系结构。
熟悉主流深度学习分布式通信库(如 NCCL、HCCL、NVSHMEM 和 DeepEP 等)的底层实现原理,具备丰富的性能调优与故障排查经验。
深入理解 RDMA 技术原理与 RoCE/InfiniBand 网络架构,具备丰富的 RDMA 开发经验,熟悉 IBGDA 等 RDMA 高阶特性。
具备编译器或 DSL 系统的开发经验,熟悉 MLIR/TileLang/Triton 等任一编译栈或高性能算子 DSL;理解常见编译优化技术,以及 GPU/NPU 等架构的并行执行模型、内存层级和矩阵计算单元等硬件架构特性。
在大型开源软件(如 LLVM、NCCL 和 PyTorch 等)中有深度贡献,或维护过其他个人开源软件。
在高性能计算相关赛事(如 SC/ASC/ISC 和 PAC 等)或算法竞赛(NOI/IOI 和 ICPC 等)中取得优异成绩
信息来自企业官方招聘渠道
OfferSeek 对公开岗位信息进行聚合、去重和结构化整理,最终申请以企业官方页面为准。