摩尔线程
GPU 架构工程师- AI Workload 分析(J11005)
岗位职责
AI workload 正在快速分化:LLM 的训练与推理范式仍在演进(long context、MoE、reasoning、speculative decoding),同时具身智能(VLA、diffusion policy)、自动驾驶(BEV、端到端、world model)、搜索广告推荐(大规模稀疏模型 + 生成式重排)各自形成了差异明显的计算特征。 本岗位的核心价值在于:把这些不断变化的 workload 翻译成可量化、可比较、可用于系统与架构决策的语言。你的分析结论会直接影响我们对硬件选型、系统设计与优化方向的判断。 我们不要求你已经是专家,但希望你有扎实的体系结构直觉、动手能力,以及在一个快速变化的领域里持续自我更新的意愿。 岗位职责
Workload 建模与特征刻画:对典型模型进行算子级与图级 profiling,量化 compute intensity、memory bandwidth / capacity 占用、KV cache footprint、通信量与通信模式,产出 roofline 分析与瓶颈定位。
Benchmark 体系建设:构建并维护覆盖 LLM、具身智能、自动驾驶、搜推等领域的代表性 workload 集合,保证其可复现、可版本化、能反映真实业务场景而非仅是 micro-benchmark。
趋势跟踪与快速评估:跟踪新模型、新算法、新推理技术,在其出现后短时间内给出对系统资源需求的影响评估。
工具与流程自动化:开发自动化的 profiling、数据采集与分析 pipeline,降低重复劳动,让分析结论可持续复现。
结论输出:撰写清晰的分析报告,把复杂的实验数据收敛为少数几个可执行的结论,并与算法、系统、硬件团队协作验证。
任职要求
计算机体系结构、计算机科学、电子工程、应用数学或相关专业硕士/博士,应届毕业。
理解现代计算系统的基本原理:memory hierarchy、并行与调度、interconnect、roofline model。
熟练使用 Python,熟悉 PyTorch,能读懂并修改主流模型的实现代码。
有使用 profiling 工具的经验(Nsight Systems/Compute、PyTorch Profiler、perf 等任一类均可)。
具备基本的数据分析与可视化能力,能从噪声数据中提取可靠结论。
能把分析过程讲清楚:数据怎么来的、结论怎么推的、哪里存在不确定性。
至少满足其中一项 a.对 LLM 训练或推理系统有实际动手经验(分布式训练、推理引擎、量化、并行策略等)。 b.在具身智能、自动驾驶或搜索推荐中任一领域有过模型开发或系统优化经历。 c.有性能建模、模拟器开发或体系结构研究背景。 加分项
CUDA / Triton 或其他 kernel 编程经验。
熟悉 vLLM、SGLang、TensorRT-LLM、Megatron-LM、DeepSpeed 等开源项目,有阅读源码或贡献记录。
有 MLPerf 或类似 benchmark 工作经验。
有系统或体系结构方向的论文发表(MLSys、ASPLOS、ISCA、OSDI、SOSP 等),或高质量的开源项目。 我们看重的特质
对数字的怀疑精神:看到一个反常的测量结果,第一反应是找原因,而不是直接接受它。
能收敛结论:面对一批彼此矛盾的实验数据,能判断哪几条真正重要、哪个是测量 artifact、哪些结论还不够支撑。
能在模糊问题中定义问题:很多任务开始时只有一个方向,没有明确指标。
跨层次思考:能同时理解算法在做什么、框架如何执行、硬件如何响应。 我们提供
接触多个前沿领域真实 workload 的机会,视野覆盖从算法到硬件的完整链路。
与算法、系统、硬件团队直接协作,分析结论有明确的下游影响。
明确的技术成长路径与导师带教。
信息来自企业官方招聘渠道
OfferSeek 对公开岗位信息进行聚合、去重和结构化整理,最终申请以企业官方页面为准。
