大疆
中/高级机器学习算法工程师(模型优化/ 量化方向)
岗位职责
负责端侧大模型及多模态模型的量化压缩与推理优化,覆盖 LLM /VLM / VLA / Diffusion / DiT / Vision Transformer / CNN 等模型,推动模型在自研芯片、NPU / DSA / ASIC 或端侧设备上的高效部署。
面向硬件架构研发高能效、硬件友好的量化与压缩算法,负责 INT8/ INT4 / FP4 / W4A8/ W4A4 等低比特量化方案设计与落地,在模型精度、推理性能、功耗和存储占用之间进行系统优化。
解决低比特量化中的关键技术问题,包括精度恢复、outlier 处理、KV Cache 量化、混合精度量化、稀疏量化、旋转量化、极低比特量化等;跟进并落地GPTQ/ AWQ / SmoothQuant / SpinQuant / SVDQuant / SageAttention 等前沿 PTQ / QAT 方法。
建设端到端模型量化规划平台,开展量化敏感度分析、混合精度比特分配、量化误差建模和精度-性能 Benchmark 建设;与算法、芯片架构、编译器、算子和工程团队协同,推动算法-硬件 co-design、编译器协同优化和芯片架构验证。
任职要求
硕士及以上学历,计算机、电子、自动化、数学等相关专业,具备3年及以上模型压缩、网络结构优化、量化算法或推理加速相关工作经验。
深入理解 PTQ / QAT 量化算法原理,具备 INT8 或更低比特量化的研发和落地经验,熟悉低比特量化、混合精度量化、量化敏感度分析、量化误差建模和精度调优方法。
熟悉 PyTorch 等主流深度学习框架,熟悉CNN / Transformer / ViT / Diffusion / 多模态大模型等典型模型结构;具备LLM / VLM / VLA / Diffusion 等模型量化、压缩或端侧部署经验者优先。
理解硬件计算特性和部署约束,包括定点计算、内存带宽、访存瓶颈、算子融合、GEMM /Attention / Conv 等核心算子;具备良好的工程落地、问题分析、跨团队协作能力,能够推动算法、芯片、编译器、算子链路的端到端优化闭环。
信息来自企业官方招聘渠道
OfferSeek 对公开岗位信息进行聚合、去重和结构化整理,最终申请以企业官方页面为准。
