虎牙
(2027届)多模态视频生成算法工程师
岗位职责
参与多模态视频生成模型全链路研发工作,涵盖模型预训练、微调、推理优化等环节,跟进文本→视频、图像→视频、视频→视频、音频驱动视频、多条件可控生成等核心技术方向,积累完整的AIGC视频研发经验;
、学习并实践Diffusion、DiT、Transformer、GAN等主流视频生成模型架构,参与优化模型时序连贯性、画面一致性、物理合理性等基础技术问题,协助攻克长视频生成、角色稳定生成等行业重难点;
研究多模态跨模态对齐技术,参与文本、图像、音频、3D姿态、深度、分割等多维度条件的融合与可控生成方案优化,助力提升视频生成的精准度与可控性;
跟进Minimax H3、HunyuanVideo、Wan、LTX等行业前沿开源模型与训练范式,完成论文复现、模型微调、方案验证等工作,协助团队迭代优化技术方案,积累前沿技术落地经验;
参与AI视频生成全流程管线搭建与优化,涵盖数据处理、模型训练、效果评估、推理部署、后处理等环节,协助搭建自动化评测体系与质量监控指标,保障算法效果迭代与落地
任职要求
1、2027届硕士及以上应届毕业生,计算机科学与技术、人工智能、电子信息、数学、自动化等相关专业;
熟练掌握深度学习、计算机视觉、生成模型核心理论,深入理解Diffusion、Transformer、DiT、VAE等视频生成主流架构的核心原理,有相关课程研究、科研项目或竞赛经历优先;
具备大模型训练、优化相关项目/科研实战经验,了解混合精度训练、显存优化、分布式训练(DDP/FSDP/DeepSpeed)等常用技术方法,有落地实践经历加分;
精通PyTorch深度学习框架,熟悉Hugging Face、Diffusers、OpenCV、FFmpeg等AI视频生成常用工具链,具备良好的代码编写能力、工程实践能力和问题排查能力;
、具备优秀的英文文献阅读、顶会论文复现能力,拥有较强的自主学习、技术钻研和逻辑思维能力,能够快速跟进AIGC前沿技术并落地验证;
具备良好的沟通协作、团队配合能力和项目推进意识,责任心强,乐于沉淀技术,能够高效配合团队完成研发任务。
加分项
在CVPR、ICCV、ECCV、NeurIPS等AI顶会/期刊,以一作/学生一作身份发表生成模型、多模态、视频生成、AIGC相关论文;
有开源主流视频生成模型的复现、微调、二次开发相关科研或项目经验;
、深耕长视频生成、角色一致性、物理真实感渲染、音频驱动视频、多模态可控生成等细分方向,有相关课题研究、项目攻坚、竞赛实战经验;
了解模型量化、蒸馏、TensorRT/ONNX推理优化技术,有AI模型高性能推理、云端/端侧部署实践经验者优先;
参与过多模态视频数据集构建、数据清洗、标注规范设计、数据质量管控等相关工作;
GitHub拥有高星AIGC、视频生成相关开源项目、技术优化成果,或积极参与开源社区贡献;
有AIGC视频生成、多模态大模型、计算机视觉相关国家级竞赛、科研立项、实验室核心项目经历优先
信息来自企业官方招聘渠道
OfferSeek 对公开岗位信息进行聚合、去重和结构化整理,最终申请以企业官方页面为准。
