千问事业部
端到端语音智能体前沿技术研究-阿里星/C-Star
RESPONSIBILITIES
岗位职责
负责统一语音多模态大模型的设计、训练、优化,涵盖语音识别、语音合成、语音理解、文本-语音融合、跨模态检索与生成等方向;
推动语音与其他模态(文本、图像等)在统一建模框架下的深度融合,提升模型的理解、生成与交互能力;
跟踪并研究前沿的多模态学习方法,包括但不限于Transformer、对比学习、扩散模型、自监督学习、强化学习等;
参与大规模数据预处理、模型训练与推理优化,推动模型在实际场景中的高效部署;
与产品、工程团队紧密协作,将研究成果应用于智能助手、虚拟人、智能硬件、会议记录等业务场景。
REQUIREMENTS
任职要求
计算机科学、电子工程、人工智能、信号处理等相关专业硕士及以上学历,博士优先;
精通语音识别(ASR)、语音合成(TTS)、语音理解(SLU)等相关技术;
熟悉主流大模型及深度学习框架(PyTorch/Megatron/DeepSpeed),具备大规模模型训练与调优能力;
熟悉多模态表示学习、跨模态对齐与融合、自监督预训练方法;
具备良好的算法实现能力和工程落地经验,熟悉模型压缩、蒸馏、量化、加速等技术;
具有较强的研究能力和创新意识,曾在顶级会议(如NeurIPS、ICML、ICLR、ACL、INTERSPEECH、ICASSP等)发表过论文者优先;
良好的沟通能力和团队协作精神,能够承担高强度的研发任务。
【加分项】
有大规模语音-文本数据构建与清洗经验;
有端到端多模态对话系统开发经验或者实时通话经验;
了解语音前端处理(VAD、说话人分离、语音增强等);
熟悉语音大模型及其扩展应用;
有开源社区贡献经历或主导过知名开源项目者优先。
信息来自企业官方招聘渠道
OfferSeek 对公开岗位信息进行聚合、去重和结构化整理,最终申请以企业官方页面为准。