大疆
大模型预训练专家
岗位职责
负责面向飞行器、扫地机等设备场景的具身智能基础模型预训练;
参与 VLA、World Model、Video Model、多模态时序模型等模型架构设计;
负责视觉、语言、视频、动作、轨迹、传感器、地图等多模态数据的表征学习和统一建模;
设计预训练任务,包括图文/视频语言对齐、视频预测、状态预测、动作预测、轨迹建模、masked modeling、自监督学习等;
负责训练数据清洗、配比、采样、tokenization、质量评估和训练实验迭代;
参与大规模分布式训练,解决训练稳定性、收敛效率、模型泛化等问题;
与后训练和端侧部署团队协作,保证预训练模型可以支撑真实任务适配,并具备硬件友好性;
任职要求
必备能力
多模态预训练经验:熟悉 VLM、Video LLM、LLM、Diffusion、Transformer、SSM 等模型,有实际训练或深度研究经验。
大规模训练能力:熟悉 PyTorch/JAX,了解分布式训练、混合精度、数据并行/模型并行、训练稳定性调优。
数据构建能力:能处理大规模图像、视频、文本、时序数据,熟悉数据清洗、采样、配比、过滤、质量评估。
时序/视频建模能力:具备视频理解、视频生成、状态预测、长期时序建模相关经验,能够迁移到飞行器/扫地机任务。
多模态对齐能力:理解视觉、语言、视频、动作等模态如何对齐,能够设计合适的训练目标和模型接口。
硬件友好意识:了解模型尺寸、推理延迟、端侧算力、量化/蒸馏等约束,能在模型设计阶段避免纯云端大模型思路。 加分经验
有 VLM/Video LLM/多模态 Agent、World Model、视频预测、环境动态预测相关经验;
做过具身智能、机机器人学习、3D/空间智能相关研究;
有顶会论文、开源模型、大规模训练项目经验;
有模型压缩、蒸馏、端侧友好结构设计经验。
信息来自企业官方招聘渠道
OfferSeek 对公开岗位信息进行聚合、去重和结构化整理,最终申请以企业官方页面为准。
