Token Foundry
研究型实习生-结合副语言和丰富音频信息的对话技术研究
岗位职责
以 GPT-4o、Gemini Live 为代表的端到端语音对话技术正逐步取代传统 ASR+LLM+TTS 级联架构,但当前方案普遍忽略犹豫、笑声、语调等副语言信号,也难以利用环境声、背景人声等丰富音频上下文,导致对话机械、缺乏共情。在车载、AI 眼镜、智能音箱、陪伴硬件等场景对自然交互需求日益提升的趋势下,副语言与音频上下文建模将成为下一代语音交互产品的核心竞争力。 现有端到端语音对话模型主要聚焦语音到语音的直接映射,对副语言现象建模较弱,难以利用非语音音频信息进行上下文感知,也缺乏对多说话人主体和话题语义的辨识能力,且在长程任务与复杂音频推理上表现不足。本课题旨在探索副语言、丰富音频上下文与 Agentic 能力在端到端对话模型中的统一建模路径,交付具备拟人化交互体验的下一代语音对话系统。 研究方向:
Voice Agentic 长程任务与音频推理:研究多步骤任务规划、工具调用、跨轮次记忆管理,并探索对说话人意图、情感变化及环境事件的综合推断,实现从"应答式助手"到"主动式伙伴"的跃迁。
副语言感知的对话能力建设:聚焦犹豫、情绪、年龄、性别等副语言信号,研究将其编码为端到端模型可用的语义表征,使模型在内容、语气与节奏上体现共情反馈。
多说话人感知与多方对话:研究多方对话中说话人角色的动态识别,探索对话意图与说话人目标的联合建模,实现端到端的多方语义解析。
指定说话人的端到端对话:研究声纹特征的隐式编码与说话人身份的动态绑定,支持个性化回复与跨 session 身份记忆,服务于智能音箱家庭成员识别、车载驾乘差异化服务等场景。
任职要求
计算机/人工智能/认知科学等相关专业在读硕士/博士;
有扎实的理论基础,对大模型、多模态建模、强化学习等相关技术研究感兴趣;
加分项:在ACL/NeurIPS/CVPR等顶会发表过人机交互或多模态相关论文 或 有实际的多模态对话系统、智能体交互或具身智能项目开发经验。
信息来自企业官方招聘渠道
OfferSeek 对公开岗位信息进行聚合、去重和结构化整理,最终申请以企业官方页面为准。