酷哇科技有限公司
VLA与世界动作模型算法工程师
岗位职责
VLA/VLN 算法研发与落地: 1-1研发基于多模态大模型的 VLA(视觉-语言-动作)与 VLN(视觉-语言-导航)架构。 1-2负责高维语义指令(如行业 SOP、长程作业规划)到具身技能基元(Skill Primitives)的动态解码与编排,实现复杂开放场景下的长程任务执行。 1-3设计并优化多模态时空思维链(Spatial-Temporal CoT),赋予模型在真实物理场景下的空间具象观察与逻辑推理能力。
世界动作模型(World Action Model)的构建与探索: 2-1研发基于潜空间的世界动作交互模型,实现对城市动态环境(如行人博弈、车辆交互、抓取操作)的高质量前向模拟与未来状态生成。 2-2结合大模型认知中枢(Agent),落地基于世界动作模型算法,解决操作和移动类的问题(统一通用模型)。
具身对齐与闭环反思(Reflection)机制建设: 3-1探索并落地基于强化学习(RL)的连续控制与对齐技术,在传统离线行为克隆(BC)的基础上,进一步突破模型在复杂开放环境下的操作天花板与行为边界。 3-2构建基于底层物理反馈的 VLM 闭环反思引擎,实现技能的动态重规划与端侧自治
任职要求
基础与学术背景 1-1计算机、人工智能、机器人控制或相关专业硕士及以上学历。 1-2经历要求(满足其一即可): - 在具身智能和 AI 领域顶级会议/期刊(如 NeurIPS, ICLR, CVPR, ICRA 等)以第一作者发表过 VLM、VLA、RL、世界模型或端到端算法相关的高水平论文。 - 在行业头部具身智能企业或顶尖 AI 实验室拥有相关的核心算法研发与真机/仿真落地实习经验。
核心技术栈: 2-1深入理解具身智能VLA与世界模型的前沿权威工作,熟悉并阅读过相关代表性论文和代码仓库(如 PI (Physical Intelligence) 系列、Fast-WAM、OpenVLA等)。 2-2熟悉主流的多模态大模型架构(如 Qwen-VL, LLaVA,)及其高效微调技术(LoRA, DeepSpeed)。 2-3对条件扩散模型(Diffusion Models for Planning)或视频/状态生成模型有深刻理解。
具身 Task 闭环与评测 Sense: 3-1完整跑通具身智能 Task 评估全流程: 不仅会训练模型,更要对 Embodied Task 的仿真评测(Sim-to-Real)与真机、实车成功率指标体系有深刻的认知。 3-2具备极强的 Technical Sense,能够从 Task 失败的录像/Log 中敏锐定位是感知幻觉、策略崩塌还是物理执行越界,并提出有效的算法改进方案。
编程与 AI 工程能力: 4-1具备极强的 PyTorch 源码开发能力与大规模分布式训练经验。 4-2AI Coding 赋能: 习惯且熟练使用 Codex、Claude Coding 等 AI 辅助编程工具,具备“用 AI 构建 AI”的极客工作流,追求极致的代码产出效率与优雅的工程结构
信息来自企业官方招聘渠道
OfferSeek 对公开岗位信息进行聚合、去重和结构化整理,最终申请以企业官方页面为准。
