酷哇科技有限公司
多模态大模型算法工程师(VLM/VLM+RL/Agent)
岗位职责
多模态大模型(VLM)基座训练: 1-1负责 UrbanVLM 基座模型的架构设计、预训练(Pre-training)与指令微调(SFT)。 1-2深入优化视觉编码器(基于 ViT-Large 架构)与语言模型(LLM)的对齐模块,重点提升模型对复杂开放场景的深层语义理解、常识推理与长程规划能力。 1-3构建标准化的意图下发与调度接口,确保 UrbanVLM 的宏观决策能够与下游的 VLA(视觉-语言-动作)、VLN(视觉-语言-导航)以及 WAM(世界动作模型)实现低延迟、高可靠的认知协同。
具身 Agent 架构与前沿技术研究: 2-1负责 UrbanVLM 的 Agentic 架构研发,探索并落地前沿的具身智能体工作流。 2-2研究多模态工具调用(Function Calling / Tool-use)机制,将底层的技能基元(Skill Primitives)、WAM 的未来前向预测、以及各类外部数据源(如高精语义地图、市政 SOP 知识图谱)封装为大模型可调用的工具,实现复杂长程作业任务的自动化拆解与调度。
基于 RL 的多模态对齐与长程推理(VLM+RL): 3-1负责 VLM 的偏好对齐工作(RL),将人类专家或物理仿真环境的反馈注入模型,消除 VLM 在复杂业务决策中的逻辑幻觉。 3-2前沿探索: 将强化学习引入 VLM 的多模态思维链(CoT)训练中,通过过程奖励机制(PRM)或 Outcome 奖励,提升模型在长程任务编排和逻辑推理能力。
多模态数据引擎与高质量指令集建设: 4-1主导构建面向具身智能场景的高质量多模态训练数据集(包含复杂场景理解与逻辑推演、行业 SOP 规范、宏观技能调度)。 4-2利用大模型辅助、合成数据(Synthetic Data)生成及多模态数据清洗策略,打造支撑 VLM 认知能力持续跃迁的数据飞轮。
极致的模型量化与推理优化: 5-1与工程团队紧密配合,负责 VLM 的端侧或云端高效部署,解决 KV Cache 优化、低比特量化(AWQ/GPTQ)等工程瓶颈,确保模型在具身闭环控制中的高效推理
任职要求
基础背景: 1-1计算机、人工智能相关专业硕士及以上学历。 1-2VLM技术研究或落地相关经验: 在一线互联网公司(如多模态搜索/推荐/生成业务)、自动驾驶或具身智能领域,有明确的 VLM 模型训练落地经验与业务产出(非纯 API 调用或浅层应用)。 1-3深入理解且拆解过主流开源 VLM 架构(如 LLaVA 系列, Qwen-VL, InternVL 等),对其代码实现有源码级的掌控力,能快速复现或修改源码进行高并发实验。
VLM + RL 经验优先考虑: 2-1熟悉且实际跑通过 LLM / VLM 的 RLHF 或 DPO 全流程。 2-2有过基于强化学习优化大模型推理能力(如基于 RL 的 CoT 训练、多模态 Reward Model 训练),清楚其中训练过程中的坑点与解决策略。 2-3熟知 DeepSeek-R1、OpenAI o1 等在 Test-Time Compute 与 RL 结合方向的最新演进理念。
编程与 AI 工程: 3-1AI Coding : 习惯且熟练使用Codex、Claude Code 等 AI 辅助编程工具,具备极高的代码产出效率与“用 AI 构建 AI”的工作方式。 3-2精通 PyTorch,熟练使用大规模分布式训练框架(Megatron-LM, DeepSpeed, FSDP),对显存优化、算子融合、通信瓶颈有深度排查与调优经验。 3-3熟悉大模型推理加速框架(如 vLLM, TensorRT-LLM)
信息来自企业官方招聘渠道
OfferSeek 对公开岗位信息进行聚合、去重和结构化整理,最终申请以企业官方页面为准。
