阿里巴巴
智多星-大模型与数据建模
岗位职责
跨模态语义对齐与统一表示学习 研究多模态异构数据在统一语义空间中的表示、对齐与融合方法。围绕弱标注/零标注条件下的跨模态实体归一、多粒度语义去重、动态增量更新等核心问题,探索面向大模型语义理解的数据汇聚与标准化接入机制,构建高质量、可演化的多源数据底座。
大模型可信度评估与信息质量建模 研究面向开放域、无金标准场景下的信息可信度建模与冲突消解方法。重点攻关多源交叉验证与动态可信度评估、大模型幻觉识别与事实性校验、稀疏长尾信号的检测与因果归因等问题,建立"评估—使用—反馈"闭环的质量管控体系。
检索增强生成(RAG)与大模型智能体 研究面向复杂查询的检索增强生成方法及多智能体协同框架。围绕图增强检索与多跳推理、跨模态可溯源生成、多智能体协同长文写作中的全局一致性保障等问题,构建高可信、可审计的知识问答与结构化内容自动生成能力。
前沿论文追踪与方法复现 持续跟踪NLP、多模态、RAG、LLM Agent等相关方向的最新研究进展,对关键论文进行深度解读与高质量复现,为团队的研究选题与技术方案提供一手实验验证与对标分析。
数据构造与生产技术 研究面向大模型训练的数据构造与规模化生产方法。追踪指令演化、自指令生成、拒绝采样等前沿数据合成技术,探索其质量边界与适用条件;结合RLHF/GRPO/DPO等对齐数据生产范式与偏好数据构建实践,进行本地化融合与工程验证,建立"度量—合成—验证淘汰"的迭代生成框架,推动数据生产从人力堆量向策略驱动演进。
多目标数据优化与课程编排 将数据集构建建模为质量、成本、可靠性的多目标约束优化问题。引入难度分层与课程学习思想自动编排训练序列,探索不同数据配比策略对模型能力增益的定量规律,在给定预算约束下求解帕累托最优数据组合,建立数据筛选、配比与训练编排的系统化方法。
任职要求
学历要求 国内外高校计算机科学、人工智能、数据科学等相关方向在读博士研究生。
论文复现与前沿追踪能力 具备较强的学术论文阅读与前沿工作复现能力,能够独立阅读顶会论文(ACL、EMNLP、NeurIPS、ICML、ICLR、KDD、CVPR等),快速理解核心方法并完成高质量代码复现。我们需要你能将论文中的idea快速落地为可运行、可对比、可迭代的实验,而非停留在阅读层面。
大模型与深度学习基础 具备扎实的机器学习与深度学习理论基础,熟悉主流大语言模型(GPT系列、Claude系列、Qwen系列、Llama系列、DeepSeek系列等)的原理与使用。熟练掌握Python编程,熟悉PyTorch/JAX等深度学习框架,具备良好的工程实现能力。
学术写作与协作能力 具备良好的中英文学术写作能力,能够独立或协作完成论文的实验设计、结果分析与撰写投稿工作。具备良好的沟通协作意识,能够在团队中高效推进研究进度。 加分项 ● 在以下方向有研究经历或发表记录:自然语言处理、多模态学习、信息检索、知识图谱、数据挖掘、时序分析 ● 有RAG系统(含GraphRAG、Agentic RAG等)的研究或开发经验 ● 有多模态大模型(视觉-语言模型、语音-语言模型等)的微调或应用经验 ● 有多智能体系统(AutoGen、MetaGPT等框架)的实践经验 ● 有大规模向量检索系统(FAISS、Milvus等)的工程经验 ● 有数据合成、训练集优化或数据价值评估相关研究经验 ● 有顶会论文发表记录
信息来自企业官方招聘渠道
OfferSeek 对公开岗位信息进行聚合、去重和结构化整理,最终申请以企业官方页面为准。