千问事业部
统一多模态大模型后训练算法研究-阿里星/C-Star
岗位职责
针对当前多模态大模型在后训练阶段面临的模态割裂、对齐效率低、奖励信号稀疏且场景泛化能力弱等关键挑战,本课题聚焦于构建统一的多模态大模型后训练算法体系。研究内容主要包括三个方面:
探索模型高效对齐的后训练算法,结合指令微调、偏好学习与知识蒸馏技术,提出低资源、高响应的对齐范式,实现模型行为与人类意图的高度契合。通过构建“奖励驱动—训练加速—对齐优化”三位一体的后训练框架,推动多模态大模型向更智能、更可靠、更可控的方向持续演进,为通用人工智能提供可复用、可扩展的算法基础设施;
开展超大规模强化学习(RL)训练架构优化,研究分布式训练中的梯度同步策略、样本效率提升方法与稳定收敛机制,支撑千亿级甚至万亿级参数模型在多模态环境下的高效策略优化;
设计面向通用场景的多模态统一奖励系统(Reward System),融合语言、视觉等多维信号,构建细粒度、可泛化的奖励函数,实现跨模态语义一致性与任务目标的联合建模。
任职要求
计算机科学、人工智能、机器学习或相关领域的硕士或博士学位;
在扩散模型、自回归模型、多模态生成理解、计算机视觉、NLP、AIGC、计算机图形学、机器学习等一个或多个领域有较深入的研究;数学公式推导能力强;熟悉流式音视频处理;
具有出色的分析、解决问题的能力,能深入解决大模型训练、应用存在的问题,有自主探索解决方案的能力者;
能够积极创新, 乐于面对挑战, 负责敬业,优秀的团队合作精神,一起探索新技术,推进技术进步。
【加分项】
具有优秀的基础算法、扎实的机器学习基础,在相关领域国际顶级会议(ACL、EMNLP、CVPR、ICCV、NeurIPS、ICLR、AAAI 等)有高质量论文发表者优先;
具有优秀的代码能力,在ACM/ICPC、NOI/IOl、Top Coder、Kaggle等比赛获奖者优先;
在多模态、大模型、基础模型、世界模型、RL、渲染生成领域,主导过大影响力项目者优先;
在算法竞赛中获得优异成绩(ACM-ICPC/挑战赛TOP10等)或者顶会论文发表。
信息来自企业官方招聘渠道
OfferSeek 对公开岗位信息进行聚合、去重和结构化整理,最终申请以企业官方页面为准。