哔哩哔哩集团
bilibili-音视频理解算法工程师
岗位职责
Omni VLM 基础模型研发 - 负责面向视频理解的 Omni VLM / 多模态理解基础模型研发。 - 参与模型架构、数据体系、训练方法和评测体系建设。 - 开展大规模图像、视频、音频和文本数据上的 VLM 预训练。 - 开展多模态 SFT、偏好对齐、强化学习、复杂推理等后训练工作。 - 提升模型在长视频理解、时序推理、细粒度感知和多模态交互等方面的能力。
Captioner - 建设高质量视频 Caption 和结构化语义理解能力。 - 提升模型对人物、场景、动作、事件、镜头、风格、音频和叙事等信息的理解。 - 为视频生成基模提供高质量训练数据和语义条件。
Prompt Enhance(PE) - 研发面向视频生成的 Prompt Enhance 模型与策略。 - 将用户简短或模糊的意图转化为准确、丰富且适合视频生成的提示词。 - 提升生成结果的语义一致性、视觉表现和可控性。
Reward Model 与评估 - 建设面向视频生成的 Reward Model 和自动化评测体系。 - 评估文本—视频对齐、画面质量、运动质量、时序一致性、物理合理性和审美表现。 - 为视频生成基模的训练、偏好对齐和效果优化提供反馈信号。
Agent 创作链路 - 研发基于 Omni VLM 的视频创作 Agent。 - 建设意图理解、任务规划、Prompt Enhance、素材理解、工具调用和结果评估等能力。 - 探索视频的多轮生成、局部修改和自动迭代优化
任职要求
计算机、人工智能、自动化、数学或相关专业硕士及以上学历。
具备扎实的机器学习、深度学习和 Transformer 基础,熟练使用 PyTorch 等主流框架。
熟悉多模态基础模型,对视觉编码、跨模态对齐、时序建模和语言建模有深入理解。
具有以下至少一个方向的研发经验: - Omni Model、VLM 或多模态理解基础模型; - VLM / LLM 预训练或后训练; - 视频理解、视频 Caption 或视频推理; - Reward Model、偏好对齐或强化学习; - 视频生成或图像生成基础模型; - 多模态 Agent、工具调用或任务规划。
熟悉基础模型的数据构建、分布式训练、推理优化和模型评估流程。
具备良好的工程能力、自驱力和协作能力,能够独立推进算法研发与实验迭代。 加分项 - 参与过大规模 VLM / LLM 的预训练或后训练。 - 具有多模态 SFT、RLHF、DPO、GRPO、RLAIF 或 Reward Model 经验。 - 具有视频生成、Diffusion 或 Flow Matching 相关经验。 - 具有长视频理解、音视频联合建模或多模态推理经验。 - 具有视频创作 Agent、多轮生成或工具调用系统经验。 - 在相关顶级会议或期刊发表过论文,或有高质量开源项目
信息来自企业官方招聘渠道
OfferSeek 对公开岗位信息进行聚合、去重和结构化整理,最终申请以企业官方页面为准。
