小红书
【REDstar】多模态基础模型算法工程师
岗位职责
工作职责: 本岗位致力于构建多模态大模型的“感知-推理-交互”全链路能力,定义小红书下一代多模态智能基座。小红书拥有业界最独特的图文与短视频 UGC 数据生态,是多模态模型落地最肥沃的土壤。你将负责 VLM 的 Post-training(SFT/RL) 与 架构演进,让模型不仅能“看见”,更能“洞察”与“推理”及“交互”,构建小红书多模态基础模型,并与搜索、广告、推荐、电商、智能创作等团队合作赋能全链路业务场景。 你的工作内容:
多模态推理与强化学习 (VLM Reasoning & RL): 探索视觉场景下的 Long-thought 推理范式,利用强化学习等技术提升模型在复杂视觉空间、数学、逻辑及长视频序列下的深度推理能力,实现“边看边思考”。
极致指令遵循与对齐: 负责 VLM 的 SFT 与 RL 流程,针对小红书复杂图文/视频语义,优化多模态对齐质量,解决模型幻觉问题,提升指令遵循的鲁棒性。
超长视频与复杂序列理解: 针对海量视频场景,研发高效的长视频编码与时空注意力机制,优化多帧推理效率,挖掘短视频及直播流中的深层交互语义。
多模态Agent: 研发具备视觉反馈与自我修正能力的智能体技术,利用 VLM 驱动复杂工具链调用,探索 VLM 在自动化创作与交互式电商中的应用。
任职要求
本科及以上学历,计算机等相关专业;
卓越的实战经验: 在 MLLM 推理优化、视觉对齐、视频语义理解 或 大规模预训练 领域有深入研究或成功落地经验。
硬核的工程能力: 精通 PyTorch,熟悉 Megatron-LM、DeepSpeed 等分布式训练框架,能够处理百亿/千亿级参数模型在大规模集群上的高效训练。
数据洞察力: 对高质量多模态数据的构建、清洗及 Automated Data Mixing 策略有独特见解,能从海量无序数据中提炼知识。
卓越的评测与诊断能力: 熟悉主流多模态评测集,能够针对业务痛点构建垂直领域的 Benchmark;具备深度的模型表现诊断能力,能通过评测结果反向驱动数据混合(Data Mixing)与算法优化。 加分项: 在 CVPR, ICCV, NeurIPS, ICML, ICLR 等顶会发表过高影响力论文,或在知名开源多模态项目中有核心贡献。
信息来自企业官方招聘渠道
OfferSeek 对公开岗位信息进行聚合、去重和结构化整理,最终申请以企业官方页面为准。
