幻方&DeepSeek
多模态理解(数据/算法)研究员
岗位职责
负责多模态基座模型的迭代。探索视觉编码器和 VLM 的结构、训练策略和评测方式,针对多模态场景持续验证和迭代预训练与后训练(SFT / RL / OPD)算法。
负责多模态理解数据体系构建。定义图文/视频数据集的采集方式、质量标准和筛选方法,多部门协作建设大规模自动化清洗、质量筛选与数据合成管线,从数据侧提高模型表现。
针对通用问答、文档/图表解析、多模态推理等基础多模态场景,进行针对性的数据收集、模型训练和精细化调优。
推动 GUI、白领办公、多模态搜索等场景的多模态 Agent 核心能力建设与落地。
搭建面向“用户真实体验”的多维度多模态评测体系。从定义评测维度、收集真实数据、数据标注到模型反馈,定位模型短板,指引模型迭代。
【核心要求】(满足其一即可)
任职要求
深入理解主流视觉编码器(如 CLIP, SigLIP 等)的模型结构,熟悉其训练与评测方法。
熟悉主流多模态模型的架构,具备大规模多模态预训练或后训练(SFT/RL/OPD)实战经验。
具备极强的数据直觉,有大规模图文/视频数据清洗、质量标注及数据合成的实战经验。具备一定的工程代码能力。
主导和交付过多模态某个垂直领域(包括但不限于 OCR、Image Caption、空间理解、通用 QA、用户意图理解或 Agent 场景)的模型训练与数据迭代。
深入研究过多模态模型评测体系建设,不满足于依赖公开榜单,有独立设计人工评测或自动评测流程的经历。
即使没有上述特定经验,只要基础特别扎实、代码能力极强、对多模态有极致渴望,我们也欢迎。
【加分项】
有行业影响力的高引论文或知名项目贡献。
对模型自身真实能力的提升有极致追求,反感且不愿意通过“刷榜”来换取指标的虚假繁荣。
对多模态模型的技术发展趋势和应用场景有深刻洞察
信息来自企业官方招聘渠道
OfferSeek 对公开岗位信息进行聚合、去重和结构化整理,最终申请以企业官方页面为准。