快手
【快Star】强化学习算法研究员-【可灵AI】
RESPONSIBILITIES
岗位职责
面向多模态模型,负责强化学习、奖励模型等算法研究与落地;
构建适用于多模态生成的 reward 体系,推动模型从监督训练走向持续优化和自我提升。
REQUIREMENTS
任职要求
在强化学习、多模态生成模型、模型对齐、奖励模型等至少一个方向有项目经验;
具备扎实代码能力和实验能力,有大模型训练、调参、debug 经验;
好奇心强,思路灵活,做事靠谱细致,有责任心,能推动开放问题持续迭代;
熟练使用 AI coding/agent 工具,能够提升研发和实验效率。
加分项
有顶会论文、开源项目、产品落地或大规模模型训练经验;
在ACM-ICPC、NOI / IOI 等竞赛中取得优秀成绩。
信息来自企业官方招聘渠道
OfferSeek 对公开岗位信息进行聚合、去重和结构化整理,最终申请以企业官方页面为准。