阿里国际
算法研究员-多模态-深圳
岗位职责
探索多模态前沿能力并在真实垂类场景下落地验证,打造商业化盈利能力。包括不限于: ● 多模态检索与推理 (RAG+): 构建跨模态检索系统,通过多轮视觉推理精准识别商品属性(如面料、Logo 细节、防伪特征),并自动生成多维度竞品对比表辅助决策。
图像生成与场景落地: 研发面向客服场景的图像生成能力,包括根据业务需求自动生成或修改品牌 Logo、根据描述生成商品搭配效果图,以及营销文案配图的自动化创作。
复杂任务 Tool-use: 优化 Agent 识别 UI 截图或实拍图并触发工具调用的能力,将多模态理解直接转化为转化为标准化的业务指令集,实现自动化的信息补全、文件发送等业务系统操作。
多模态Agent构建: 将视觉选品、自动化属性提取、Logo 创作等技术点在Agent框架中以模块化可扩展的skill进行端到端部署与验证。
任职要求
探索多模态前沿能力并在真实垂类场景下落地验证,打造商业化盈利能力。包括不限于: ● 多模态检索与推理 (RAG+): 构建跨模态检索系统,通过多轮视觉推理精准识别商品属性(如面料、Logo 细节、防伪特征),并自动生成多维度竞品对比表辅助决策。
图像生成与场景落地: 研发面向客服场景的图像生成能力,包括根据业务需求自动生成或修改品牌 Logo、根据描述生成商品搭配效果图,以及营销文案配图的自动化创作。
复杂任务 Tool-use: 优化 Agent 识别 UI 截图或实拍图并触发工具调用的能力,将多模态理解直接转化为转化为标准化的业务指令集,实现自动化的信息补全、文件发送等业务系统操作。
多模态Agent构建: 将视觉选品、自动化属性提取、Logo 创作等技术点在Agent框架中以模块化可扩展的skill进行端到端部署与验证。
信息来自企业官方招聘渠道
OfferSeek 对公开岗位信息进行聚合、去重和结构化整理,最终申请以企业官方页面为准。