宁德时代
多模态大模型算法工程师
岗位职责
岗位概述 负责“多模态大模型 + 工业视觉质检”核心算法的研发与落地,利用视觉-语言大模型、跨模态融合技术,解决传统工业质检中样本少、缺陷泛化难、产线换型频繁等痛点。全权负责从多模态数据构建、模型微调到产线端侧部署的全流程,将前沿 AI 能力转化为高精度、高鲁棒、可快速适配的工业质检产品。 主要工作职责
多模态质检算法研发:①图文联合缺陷检测:利用视觉-语言模型(如 LLaVA、Qwen-VL)直接输出缺陷类别、位置及严重程度。②少样本 / 零样本缺陷适配:通过文本 prompt 定义新缺陷类型,无需大量标注样本即可快速部署新产线或新缺陷检测。③ 缺陷根因分析:基于多模态大模型的推理能力,结合图像和上下文文本(如工艺参数、操作记录),自动生成缺陷可能原因及改进建议。
模型微调与多模态融合优化:采用 LoRA、QLoRA、Adapter 等高效微调技术,适配小样本质检数据。设计多模态融合模块(如跨注意力、特征对齐),将视觉特征与文本 prompt 深度融合,提升缺陷细粒度识别能力。
前沿技术探索与落地:持续跟进CVPR、ICML、ECCV、ICCV等顶会前沿论文,探索视觉-语言模型在质检中的可解释性、增量学习、多模态检索增强(RAG)等前沿方向,并快速转化为工程能力。
跨团队协作与问题攻坚:与产线工艺团队配合,设计成像方案与数据采集策略。负责线上模型漂移监测、误检/漏检根因分析;通过多模态 prompt 调优或主动学习快速迭代模型。编写技术方案、质检模型评估报告及部署运维手册
任职要求
学历要求 计算机视觉、人工智能、自动化等相关专业硕士及以上学历;有高质量多模态质检项目经验的优秀本科生可放宽。 专业技能要求
基础理论:扎实的计算机视觉(目标检测、分割、异常检测)与多模态学习基础(CLIP、ALBEF、Flamingo 等架构原理)。
编程与工具:熟练使用 Python;掌握 C++/CUDA 优先;熟悉 OpenCV、PyTorch、HuggingFace Transformers等框架;熟悉 Linux、Docker、Git、MLflow 等工程化工具。
多模态大模型能力:熟悉至少一种主流多模态大模型(如 LLaVA、Qwen-VL、InternVL)的架构与微调方法。具备多模态数据构建经验。
能够高效阅读英文学术论文,可独立复现前沿SOTA算法;有Kaggle、COCO等视觉竞赛经历或顶会论文发表经验者优先。 综合素质要求 具备优秀的逻辑思维能力、问题攻坚能力与跨团队沟通协作能力,自驱力强,能够持续跟进计算机视觉前沿技术,主动完成技术迭代与能力提升
信息来自企业官方招聘渠道
OfferSeek 对公开岗位信息进行聚合、去重和结构化整理,最终申请以企业官方页面为准。
