酷哇科技有限公司
模型部署与量化加速工程师
岗位职责
模型车端部署 :负责自动驾驶端到端模型及多模态大模型(LLM/VLM)在车端平台上的高效迁移与部署。 量化与压缩 :研发并落地模型量化(PTQ/QAT)、剪枝、蒸馏等轻量化技术,深入探索 FP8、INT4 等低比特精度量化方案,在保证模型精度的前提下大幅提升推理性能。 算子与内核优化 :针对特定硬件架构,利用 CUDA、TensorRT、Triton 等工具进行高性能算子开发与优化,特别是针对 Attention 机制的加速。 软硬协同优化 :深入分析模型在硬件上的瓶颈,通过计算图优化、内存管理优化、多流并发等手段,实现全链路推理延迟的最小化。 性能评测与对齐 :建立完善的模型性能与精度评测体系,负责云端与车端模型输出的一致性校验,定位并解决部署过程中的精度损失问题
任职要求
计算机、电子工程、人工智能等相关专业本科及以上学历。 精通 C++ 和 Python,具备扎实的编程功底和良好的算法与数据结构基础。 深入理解模型量化原理,有实际的量化落地经验,熟悉常用的量化框架(如 TensorRT-LLM、AutoAWQ、BitsAndBytes 等)。 熟悉主流深度学习框架(PyTorch/TensorFlow)及模型转换工具(ONNX/TensorRT/TVM)。 具备 GPU 体系架构知识,能够熟练编写 CUDA 代码或进行高性能计算优化者优先。 熟悉 Transformer 架构及大模型推理加速技术。 加分项 参与过开源推理引擎(如 vLLM, DeepSpeed-MII, LMDeploy)的开发或贡献。 有在 NVIDIA DRIVE OS 或相关车端底层平台上部署大规模模型的实战经验。 具备端到端自动驾驶模型部署经验,熟悉多模态感知数据流的处理优化
信息来自企业官方招聘渠道
OfferSeek 对公开岗位信息进行聚合、去重和结构化整理,最终申请以企业官方页面为准。
