九洲集团
多模态大模型算法工程师(校招)
岗位职责
参与垂直领域LLM定制与应用研发:基于主流开源基座模型开展领域语料处理(清洗 / 去噪 / 去重 / 切分)、指令数据构造与 SFT 微调,持续提升模型在典型任务上的效果、稳定性与可控性;
参与 VLM(视觉-语言模型)能力建设:围绕视觉理解、OCR / 版面理解、视觉 Grounding、图文对齐等方向,构建多模态指令理解与语义输出能力,支持智能体及工业/企业级应用场景;
参与多模态推理和Agent 能力构建:将视觉感知与语言指令转化为结构化语义表示与任务步骤,支持任务分解、工具调用与多步推理,提升模型在复杂指令下的执行可靠性与安全性;
参与 LLM / VLM 推理服务与轻量化部署:协助完成模型量化(INT8 / AWQ 等)、推理加速、Batch 与缓存策略优化,支持高并发、低延迟推理服务;探索云端与边缘侧的协同部署方案;
参与构建多模态RAG系统:基于文本与图像等多模态信息,构建跨模态 Embedding、检索与重排链路,结合图文知识库与业务规则,提升复杂与长尾问题覆盖能力,降低多模态场景下的模型幻觉风险,并参与评测与线上质量监控;
参与大模型工程化与评测体系建设:搭建从数据处理、训练、评测到服务监控的基础工具链,建设数据规范、自动化评估指标与回归测试集,支持模型能力的持续迭代;
跟踪 LLM / VLM 及多模态智能体方向的前沿研究进展,参与新技术验证与能力沉淀。
任职要求
硕士研究生及以上学历,计算机科学、人工智能、自动化等相关专业优先。具备扎实的机器学习、深度学习与 NLP 基础;
熟悉主流LLM技术栈:理解 Transformer、Tokenizer、指令微调(SFT)、偏好对齐的基本知识;有LLaMA、Qwen等开源模型实战经验者优先;
熟悉VLM/多模态大模型基础:理解图文对齐、视觉编码器与语言模型协同建模方式;参与过多模态大模型相关项目者优先;
具备多模态RAG能力:熟悉文本与图像等多模态 Embedding 及跨模态检索、重排方法,具备多模态知识库构建与评估经验,能够基于现有框架完成多模态 RAG 原型与迭代优化;
具有国产AI框架(如华为昇腾CANN/MindSpore)或国产算力平台(如华为昇腾Ascend)的开发与调试经验者优先;
熟练使用 Python 与 PyTorch,具备良好的工程习惯(可复现训练、实验管理、日志与脚本化);具备 C++ / CUDA / TensorRT / ONNX / VLLM 等推理相关经验者优先;
具备 VLA / 具身智能相关背景者优先,包括但不限于机器人控制、模仿学习、动作策略建模等方向;有“语言/视觉——行为决策”相关探索经验者优先;
在ACL、EMNLP、NeurIPS、ICRA、ICLR等顶会发表论文,具备知名开源项目贡献者优先;
应聘年龄:35周岁及以下。
信息来自企业官方招聘渠道
OfferSeek 对公开岗位信息进行聚合、去重和结构化整理,最终申请以企业官方页面为准。
