阶跃StepFun

大模型强化学习系统工程师

徐汇区、海淀区社招
昨天发布2026/09/01
RESPONSIBILITIES

岗位职责

覆盖分布式训练、推理链路、性能优化、稳定性治理,以及 Agent RL 相关能力建设。 岗位职责

  1. 负责 RL 训练与推理基础设施的设计、开发与优化。

  2. 负责分布式训练、任务调度、权重同步、热更新等核心链路建设。

  3. 持续优化系统性能,包括吞吐、时延、GPU 利用率、训练效率等指标。

  4. 建设稳定性与可观测能力,定位并解决 OOM、超时、通信瓶颈、一致性问题等。

  5. 参与 Agent RL 相关训练与系统支持工作,推动训练框架适配更复杂的 Agent 场景

REQUIREMENTS

任职要求

  1. 熟悉 PyTorch、CUDA、NCCL、Linux,理解分布式训练与推理系统基本原理。

  2. 了解 RLHF 或相关训练方法,对 PPO、DPO、GRPO、Agent RL 等方向有实际经验或较强理解。

  3. 有性能分析、问题排查和系统优化经验,能独立定位复杂问题。

  4. 熟悉 AI Coding,有使用或建设代码助手、自动化研发工具、Coding Agent 的经验。

  5. 有代码品味,对工程质量有要求,乐于学习新技术、新工具和新方法。 加分项

  6. 有大模型训练或推理系统相关经验。

  7. 有多机多卡、集群训练或在线服务稳定性治理经验。

  8. 对 Agent、推理优化、系统架构演进有持续兴趣

信息来自企业官方招聘渠道

OfferSeek 对公开岗位信息进行聚合、去重和结构化整理,最终申请以企业官方页面为准。