Token Foundry
研究型实习生 - 全模态基座基础能力与Agentic应用
岗位职责
千问(Qwen)是由阿里巴巴自主研发的超大规模语言模型,具备跨语言、跨任务的理解与生成能力。Qwen系列模型,涵盖参数量从几百 M 到 T 级的基座大语言模型,并相继推出Qwen-VL、Qwen-Audio、Qwen-Omni、Qwen-Coder等系列模型。从多轮对话到代码生成,从逻辑推理到内容创作,从单一多模态到全模态统一理解生成,Qwen 正在打造全球领先的全模态模型技术体系,推动AI在企业服务、开发者生态、个人用户等领域的深度应用,引领下一代人工智能的发展。 团队致力于追逐实现 Omni 基座模型,实现全模态理解与对话统一。团队音频组负责围绕 Qwen 基座模型展开音视频/音频处理以及与音视频交互相关的基础研究及其应用,代表工作有 Qwen-Omni系列, Qwen-LiveTranslate系列等。 工作职责:
音频/音视频 Agentic能力: 原生音视频Agentic/Long-horizen, 全模态Agentic/Coding不降智等。
音视频理解基础能力:包括Caption, Grouding, 音视频Alignment, General QA,长视频,多音视频理解等。
音频/语音理解基础能力: 包括ASR, MultiSpkASR, 语音/音频Grouding/Counting/QA,音乐理解,长音频,多音频理解等。
音频/音视频Postrain/RL/OPD。
音视频通话与交互:包括全音视频双工, 音频query不降智/体感优化等。
语音生成基础能力: 包括音色克隆,可控性,长语音生成稳定性等。
全模态模型自主优化与Self-evolving。
任职要求
候选人应为计算机及相关专业的博士或硕士研究生,且对音视频领域有充分的兴趣。
具备音频/语音理解与生成、多模态对齐与交互(音视频Alignment/Captioning)、或 Agentic AI 与长程推理(Long-horizon/Omni模型)任一方向的深入项目经验。
在 ACL, ICML, NeurIPS, CVPR, Interspeech 等顶级会议/期刊发表论文,或在相关开源项目、技术竞赛中有突出表现者优先。
信息来自企业官方招聘渠道
OfferSeek 对公开岗位信息进行聚合、去重和结构化整理,最终申请以企业官方页面为准。