酷哇科技有限公司
世界模型方向实习研究员(World Model / World Action Model )
岗位职责
密切跟踪学术界(ICLR、NeurIPS、CVPR 等)在 Embodied AI、World Models、生成式序列预测等领域的最新工作。 对现有的研发成果进行总结和沉淀,鼓励并支持在国际顶级学术会议上撰写、发表高水平学术论文或申请核心发明专利,包括但不限于以下方向。
世界模型基座建设: 参与研发面向 L4 级自动驾驶与具身智能的 隐式世界模型(Latent World Model) 。探索以自监督学习为核心的技术范式(如 JEPA、Masked Modeling),将多模态传感器数据压缩至高维隐空间,实现对复杂物理世界(如城市辅道、异形障碍物)的短时/长时动态推演,摆脱对像素级渲染的过度依赖;
一段式 WAM 架构探索: 负责 World-Action Model (WAM) 核心算法的研发与迭代。探索如何将世界模型的隐式特征以极低延迟无缝接入动作生成网络(如 Diffusion Planner);解决物理安全与几何约束问题,实现端到端的“动作坍缩”,输出符合运动学且绝对安全的行驶/作业轨迹;
强化学习与对齐微调: 探索并落地面向物理世界的对齐策略,如 RLPF(物理反馈强化学习) 。利用海量真实路测数据和人工精标的物理约束边界(Constraint Masks),在隐空间内构建安全的评价函数(Reward/Cost Model),优化模型的微观物理直觉; 岗位需求:
任职要求
计算机科学、人工智能、机器人、自动化等相关专业硕士或博士在读;熟练掌握深度学习基本原理,具备扎实的数学功底和极强的算法工程实现能力;
具备较为完整的研发经验,经历过模型设计、训练调优到验证的完整流程。至少在以下一个方向有深入研究或实践经验: 2.1 生成式模型与世界模型: 熟悉 Diffusion Models、Autoregressive Models、Video Generation 或 Latent Predictive Models(如 V-JEPA、Dreamer 系列)。 2.2 端到端自动驾驶 / 具身规划: 熟悉感知决策一体化、模仿学习(Behavior Cloning)、基于视觉的端到端轨迹规划。 2.3 3D视觉与表征学习: 熟悉 BEV 架构、Occupancy Network、大型 Vision Transformer(如 ViT-Large)的训练与调优;
熟练掌握 PyTorch 深度学习框架,具备优秀的代码习惯(Python/C++);对百万级 Clips 级别的大规模数据处理、分布式并行训练(DDP/DeepSpeed/FSDP)有实践经验者优先。 加分项: 在国际顶会和期刊(如 ICLR, NeurIPS, CVPR, ICCV, ICML, ICRA 等)以第一作者发表过相关方向的学术论文;在 Kaggle、Waymo Open Dataset、nuScenes 等知名竞赛中获得过 Top 名次
信息来自企业官方招聘渠道
OfferSeek 对公开岗位信息进行聚合、去重和结构化整理,最终申请以企业官方页面为准。
