美图集团
高性能计算工程师 - 图像视频生成推理优化
岗位职责
美图的AI影像正在用Diffusion、DiT、VLM等大模型重写图像与视频创作体验。我们正把模型推进到大规模的线上推理场景,而你,将是那个让每一帧都跑得又快又省的人。 你将具体负责: · 主导图像/视频生成大模型的全链路推理优化——覆盖Diffusion、ViT、DiT、VLM,从端到端延迟、GPU吞吐到算力成本,把每一条推论的性价比压榨到极致;
深入模型内部定位性能瓶颈,用图优化、算子融合、显存复用、动态shape适配、预处理流水线加速等手段,持续拉低延迟水位;
落地PTQ/QAT量化(INT4/INT8/FP8)、蒸馏、剪枝、LoRA加速等压缩方案,在画质与推理效率之间做出漂亮的权衡;
基于TensorRT、vLLM、SGLang、Diffusers等推理后端进行深度定制,开发面向视频生成的特化缓存机制,如中间特征Cache、时序KV Cache;
探索采样加速、LCM、连续批处理与请求调度策略,从零搭建性能评测基线体系,持续跟踪p99延迟、首帧耗时、单卡并发等关键指标;
和算法团队紧密协作,针对高清图、长视频、动态分辨率、多帧率等场景,设计端到端的推理优化方案并推动落地;
追踪前沿推理加速技术,复现SOTA方案,并将行之有效的实践融入生产环境
任职要求
具备: · 计算机、电子、AI或高性能计算相关专业背景,本科及以上学历,能用C++与Python自如地折腾系统;
扎实的深度学习基础,熟悉Diffusion、Transformer、DiT、VAE等图像/视频生成网络的结构与计算特点;
对PyTorch的推理链路不陌生,至少精通一种推理加速框架,如TensorRT、ONNX Runtime、vLLM、SGLang;
理解CUDA基础、GPU内存模型,会用Nsight等手段做性能profiling;
熟悉量化、算子融合、动态批处理、显存优化等常规加速手段,并能说出各自适用边界。 加分项: · 有分布式推理、模型并行(TP/PP)的实战经验;
在SD/SDXL、视频DiT、文生视频模型优化上摸爬滚打过,踩过真实业务的坑;
对HuggingFace Diffusers源码如数家珍,能动手改,不只看;
掌握OpenAI Triton、CUDA Kernel开发,能写出漂亮的自定义算子;
做过国产芯片上的模型迁移与性能调优;
熟悉视频编解码、多分辨率bucket策略、时序特征优化等视频管线特有的加速手段
信息来自企业官方招聘渠道
OfferSeek 对公开岗位信息进行聚合、去重和结构化整理,最终申请以企业官方页面为准。
