小红书
Dots-【Ace顶尖实习生】全模态实时交互大模型研究(语音方向)
RESPONSIBILITIES
岗位职责
尽管当前的多模态大模型(融合视觉、语音、文本)已展现出强大的感知与理解潜力,但是在实时交互场景中,由于模型设计导致的高延迟、生硬的轮次状态、频繁的打断或被打断严重影响信息传递效率。同时多个模态无法实时融合也限制了多模态模型在语音交互场景下的深度应用。生成的交互内容有时显得冗长、缺乏提炼或智能不足,这些问题限制了用户与大模型实时交流的体验。 本课题的目标是设计并验证一种全模态实时交互的大模型架构,将视觉模态、语音流模态、思考模态信息以及 SOTA LLM 进行实时融合。从而使得大模型可以与人进行即时、流畅、且深入浅出、富有智慧的多模态自然语音对话。
REQUIREMENTS
任职要求
不限年级,本科及以上在读,计算机/人工智能/软件工程等相关专业优先;
优秀的代码能力、数据结构和基础算法功底,熟练掌握至少一门编程语言,包括但不限于Python等;
有语音/视频等多模态大模型理解技术背景,或大规模模型训练实际项目经验者优先;
在ICASSP/Interspeech/ASRU/TPAMI/CVPR/NeurIPS/ICCV/ICML/ICLR/ACL等顶级期刊会议上发表相关论文者优先;
良好的沟通协作能力,责任心强,积极主动,能和团队一起探索新技术,推进技术进步。
信息来自企业官方招聘渠道
OfferSeek 对公开岗位信息进行聚合、去重和结构化整理,最终申请以企业官方页面为准。
