快手
大模型推理工程师(LLM Inference)
岗位职责
负责大模型推理引擎的研发与优化,提升吞吐、降低时延与推理成本;
负责推理核心模块建设,包括 KV Cache 管理、Batching/Scheduling、Prefill/Decode Pipeline、PD 分离等;
负责推理性能优化,面向 TTFT/TPOT/TPS/RPM 等指标进行系统级优化(算子、显存、通信、调度);
负责推理侧算子研发与优化,包括算子融合、Kernel 优化、图优化、推理编译优化,以及 INT8/FP8/FP4 等量化推理加速方案落地;
负责推理稳定性与高可用建设,包括故障恢复、限流降级、容量评估、自动化诊断与 SLA 保障;
推动推理平台化能力建设,包括模型发布流程、灰度、监控、日志、Tracing 与自动化运维工具链
任职要求
本科及以上学历,计算机/软件相关专业;
熟练掌握 C++/Python,具备高性能系统研发能力;
熟悉 Transformer 推理原理,理解 Attention、KV Cache、采样策略等机制;
熟悉主流推理框架或推理引擎(TensorRT/Sglang/vLLM 等);
熟悉 GPU/NPU 性能调优与 profiling,能定位性能瓶颈并推动优化落地;
熟悉推理侧算力优化技术,包括算子融合、图优化、Triton/CUDA Kernel、推理量化与推理编译加速等;
熟悉 Linux、网络与容器化(Docker/K8s),具备线上系统运维与稳定性经验优先。
加分项
有大规模在线推理落地经验,熟悉高并发、长上下文、多租户调度等场景;
熟悉 KV Cache 压缩/复用、请求迁移恢复、跨实例调度等关键能力;
有通信优化经验(NCCL/HCCL/RDMA);
有推理量化落地经验(如GPTQ/AWQ 等)或推理加速相关经验;
有国产卡适配经验(昇腾/寒武纪/沐曦等)。
信息来自企业官方招聘渠道
OfferSeek 对公开岗位信息进行聚合、去重和结构化整理,最终申请以企业官方页面为准。