Token Foundry
语音大模型算法研究-阿里星
岗位职责
近年来,以大模型为核心的生成式人工智能技术在语音理解、语音合成、语音交互等领域取得了突破性进展,展现出前所未有的技术潜力与广泛的应用前景。 我们致力于语音通用大模型方向的前沿探索与产业落地创新。一方面,在迈向通用语音智能的长期路径中,随着语音基座模型能力的持续进化,语音感知、语义理解、语音生成与韵律建模等关键问题日益凸显,成为构建通用语音智能系统的核心挑战;另一方面,围绕典型行业场景(如智能语音交互、高质量语音合成、跨语种语音理解、实时对话系统等),如何将现有语音大模型能力有效转化为可落地、可扩展、可持续的解决方案,也成为当前研究与工程实践的重点方向。 如果你对语音生成式AI、通用语音智能前沿探索、语音大模型建模与智能语音交互系统有浓厚兴趣,并渴望深入参与下一代语音通用大模型的研发与演进,欢迎加入我们,共同定义未来语音AI的能力边界,牵引千行百业在智能时代的深度变革。
语音大模型算法创新:定义下一代语音通用大模型技术范式,实现语音识别、语音合成、语音交互等核心能力的统一建模,探寻和解决语音端到端建模、语音语义对齐、流式推理、Agentic等方面的核心挑战,不断追寻语音通用大模型的效果上限。
场景驱动的算法创新:结合业务场景(如智能语音交互、实时翻译、语音内容生成等),设计并优化语音大模型架构,提升效果、效率与鲁棒性,重点关注低延迟流式推理、端侧部署与弱网环境适配等工程化难题。
端到端技术闭环:从语音数据构建、模型训练、评测到部署,主导技术方案落地,通过AB实验、调用量、用户反馈验证价值,建立完善的语音模型评估体系(如WER、MOS、自然度、相似度等核心指标)。
前沿应用技术探索:紧跟并能驱动LLM、Speech LM、Diffusion Models、强化学习、Neural Codec等技术相关进展,定义语音大模型技术新范式,快速实验并迭代创新方案,拉升相关模型SOTA。
任职要求
来自全球Top高校计算机科学、人工智能、数学、物理或相关领域应届博士/顶尖硕士毕业生。
深入掌握深度学习、强化学习、表示学习等建模方法;在多模态建模和跨模态对齐等方面有深入研究。
在国际顶级计算机会议/期刊(如NeurIPS、ICLR、TPAMI、CVPR、ECCV、InterSpeech、ICASSP、ACL等)以一作身份发表过多篇论文,或在开源社区、竞赛中展示出引领性的研究成果。
良好的工程与实验思维:熟悉PyTorch/TensorFlow等主流框架,具备大规模语言/视觉模型调优经验,能高效实现定制化训练流程;重视代码质量与实验结果,追求“不仅work,而且高效优雅”。
技术热情与好奇心:有志于将AI从实验室推向真实业务场景,构建“可解释、可控制、可落地”的行业智能系统,善于从复杂的行业需求中提炼出核心AI建模问题,并设计创新性的解决方案。
善于跨团队协作:能与产品、基础研究团队高效沟通,平衡技术理想与落地实现。
信息来自企业官方招聘渠道
OfferSeek 对公开岗位信息进行聚合、去重和结构化整理,最终申请以企业官方页面为准。