offerseek.ai让每个人都能找到适合自己的机会
首页岗位聚合岗位雷达简历中心投递工作台价格岗位详情
登录状态读取中
offerseek.ai · 聚合全网官方招聘渠道所有岗位均跳转至企业官方投递页面
岗位聚合/【B-UP】AI Infra模型研发工程师(实习)

哔哩哔哩集团

【B-UP】AI Infra模型研发工程师(实习)

⌖上海校招
30 天前发布2026/07/29
JOB#23728
RESPONSIBILITIES

岗位职责

  1. 01

    分布式训练底座 (Training Infra) 框架优化: 负责维护和优化基于 Megatron-LM, FSDP, VeRL的分布式训练框架,通过多维并行策略提高训练吞吐。 算子优化: 参与多模态大模型训练核心算子的设计与优化,包括 Attention、MoE、算子融合等方向,持续提升模型训练效率和硬件利用率。 通信优化: 深入优化 H/NCCL通信库,解决 RDMA/RoCE 网络下的通信瓶颈,提升多机多卡并行效率(DP/PP/TP/CP/EP)。 稳定性保障: 构建自动容错与快速恢复系统(Checkpoint 优化、故障自动检测与接续),确保千卡集群在数月跨度的训练中保持极高可用性。

  2. 02

    推理加速与工程化 (Inference Infra) 高性能引擎: 负责基于 vLLM、TensorRT-LLM、SGLang、Triton Inference Server 等推理框架的开发与优化,提升大模型在线服务的吞吐、时延和资源利用率。 算子优化: 参与 Transformer 核心算子的开发与性能优化,包括 Attention、KV Cache、量化推理、算子融合等方向,探索 CUDA/Triton 等高性能实现方案。 推理架构: 参与构建面向大规模生产环境的推理服务体系,支持高并发、低延迟和高可用的模型服务部署与运维。

  3. 03

    存储与算力管理 (Storage & Compute) I/O 优化: 优化超大规模数据集的加载速度,解决训练过程中的存储带宽瓶颈(如利用 GPFS, Lustre 或 JuiceFS)。 稳定性保障: 构建大规模集群故障检测、自动恢复与容灾体系,提升训练与推理服务的可靠性、高可用性及运维效率。 资源调度: 构建面向训练与推理场景的 GPU 资源调度体系,支持多租户资源共享、弹性扩缩容、任务优先级管理及异构算力调度,提高集群整体

REQUIREMENTS

任职要求

  1. 01

    技术底色: 计算机相关专业,具有较强的系统编程能力,精通 Python 和 C/C++。

  2. 02

    计算底层: 熟悉 NVIDIA GPU 架构 (Hopper/Ampere/Blackwall),理解显存层次结构、流处理器(SM)工作原理。

  3. 03

    框架经验: 熟悉 PyTorch 等深度学习框架,具有训练或推理性能优化经验者优先;阅读过 Megatron、DeepSpeed、vLLM、TensorRT-LLM 等开源项目源码者优先。

  4. 04

    并行与分布式计算: 理解并行计算与分布式系统基本原理,了解数据并行(DP)、张量并行(TP)、流水线并行(PP)等常见大模型训练技术,有相关项目经验者优先。

  5. 05

    网络与硬件:了解 InfiniBand、RoCE 等高速网络技术,以及 NVLink、NVSwitch 等 AI 集群互联架构

✓

信息来自企业官方招聘渠道

OfferSeek 对公开岗位信息进行聚合、去重和结构化整理,最终申请以企业官方页面为准。

对这个机会感兴趣?

登录后前往企业官方投递

这个岗位已超出 7 天时效窗口(30 天前发布),可能已经停止招聘,建议先确认官方页面是否仍在招。

跳转前请再次确认岗位状态与申请要求
岗位档案POSITION FILE
企业哔哩哔哩集团
地点上海
类型校招
发布日期2026/07/29
更新日期2026/07/29
官方来源jobs.bilibili.com