Token Foundry
研究型实习生-多模态大模型的世界感知能力提升
RESPONSIBILITIES
岗位职责
近年来,随着人工智能和深度学习技术的迅猛发展,多模态大模型(Multi-modal Large Models)取得了显著的进展。这些模型能够通过处理多种数据类型(如文本、图像、视频、音频等)来完成复杂的任务,与传统单一模态模型相比,展现出更强的理解与推理能力。尤其是在语言、视觉和音频等领域,多模态大模型为诸多实际问题提供了创新的解决方案,并越来越广泛地应用在产业和科研领域,显著提高了自动化和智能化的水平。 本项目将着眼于以下几个层面技术,以推进多模态大模型对于世界的感知和交互:
动态视内容的理解:提升多模态大模型可以实现对视频内容的自动理解与分析能力。
提升模型对于图像中人类知识的理解的识别水平。
多模态大模型推理与理解能力的持续提升。
REQUIREMENTS
任职要求
候选人应为
计算机及相关专业的博士或硕士研究生,且对多模态大模型有充分的兴趣;
最好有大模型,多模态学习、计算机视觉研究和开发经验,了解或熟悉vLLM、PyTorch、Ray等LLM推理相关系统;
需要产出论文和专利等高水平的学术成果。
信息来自企业官方招聘渠道
OfferSeek 对公开岗位信息进行聚合、去重和结构化整理,最终申请以企业官方页面为准。