吉利集团
大模型端侧部署岗
岗位职责
核心业务:深度参与大模型在车机端的落地,直接触达亿万用户;
技术挑战:挑战端侧算力极限,探索量化、算子融合等前沿技术在异构硬件上的极致优化;
广阔空间:与高通、MTK、英伟达等芯片厂商深度合作,定义下一代端侧AI基础设施;
职位描述;
模型落地与性能攻坚:负责大模型在端侧设备上的部署与性能优化,解决算力以及显存受限等核心痛点,实现丝滑的用户体验;
前沿算法优化:深入研究并落地模型量化、算子优化、内核融合及图优化等关键技术,显著降低模型尺寸与推理延迟,提升端侧推理效率;
硬件算力挖掘:深度挖掘高通Hexagon DSP/NPU、英伟达GPU/DLA的算力潜力,进行底层算子适配与加速;
基建体系构建:构建高可用的端侧模型自动化优化与部署流水线,涵盖模型转换、量化校准、编译优化、自动化测试及性能瓶颈分析
任职要求
编程基础:扎实的C/C++或Python编程功底,具备良好的代码风格与工程化能力;
模型压缩专家:精通主流模型压缩技术,在量化、剪枝、蒸馏或NAS等领域有深入实践,熟悉GPTQ、AWQ、SmoothQuant、SpinQuant等量化方案;
推理框架精通:熟悉MLLM/VLM/LLM主流推理框架,如vLLM、TensorRT-LLM、GENIE/QNN、llama、cpp等,并掌握Speculative-Decoding、FlashAttention等加速技术;
实战经验:具备实际的大模型推理优化经验,能够独立完成从模型训练后处理到端侧高效推理的全链路落地;
极客精神:拥有深入的研究精神与创新能力,对AI系统底层原理充满好奇,具备持续学习前沿技术的意愿;
以上2-5满足任一项即可;
硬件架构理解:深入理解GPU/NPU/DSP等硬件架构及其存储层级,能够进行指令集级或微架构级的性能调优;
异构计算经验:具备丰富的异构计算加速经验,有芯片级性能调优或与芯片厂商联合优化的成功案例;
编译与引擎定制:有集成、定制和优化主流推理引擎的经验,包括但不限于TensorRT、ONNX Runtime、TVM、MLIR,或针对特定硬件修改过llama、cpp、TensorRT-LLM等框架源码;
前沿技术落地:成功落地过推测解码、PagedAttention、KV Cache优化等前沿技术,并在提升吞吐量或降低功耗方面有量化成果
信息来自企业官方招聘渠道
OfferSeek 对公开岗位信息进行聚合、去重和结构化整理,最终申请以企业官方页面为准。
