阿里巴巴
AI应用算法工程师-PostTrain
岗位职责
面向 LLM/MLLM 及 AIGC 场景,致力于将前沿的大模型数据生成、后训练(Post-training)和效果评测链路打造为高可用、可迭代、成本可控的企业级微调产品与 API 服务。 具体职责包括:
数据飞轮:搭建高效、自动化的数据管线,助力互联网及头部行业客户构建“数据合成/增强 -> 模型训练 -> 部署推理 -> 效果评测 -> 数据回流”的完整闭环。
模型训练:持续追踪业界后训练领域的前沿技术(如 Agentic RL、OPD、PRM 等);支持十亿至万亿(1B to 1T+)参数规模上的一方/三方大模型的后训练,面向客户垂直场景交付定制化对齐方案。
评测体系:面向通用基准能力(General Benchmarks)以及业务垂直领域数据构建科学、多维度的 Rubric 评估体系;研发涵盖 LLM-as-a-Judge 与自动化评测的工具链,精准牵引模型迭代方向。
性能优化:优化大规模分布式异构训练任务的整体吞吐,定位任务的计算、显存、通信与系统瓶颈;通过极致的 5D 并行策略及高效推理等技术,实现模型算力利用率(MFU)的最大化与生产级成本管控。
平台集成:主导前沿后训练算法与数据链路在百炼平台的工程化与产品化集成;构建高可靠、易扩展的分布式训练调度与容错架构,全面保障线上交付质量、服务 SLA 与系统的长期稳定性。
任职要求
基础条件 a. 计算机、人工智能等相关专业优先。 b. 熟悉大模型原理、热衷于数据结构和算法、在ACM大赛成绩优异者优先;有顶会论文/高影响项目/开源贡献者加分。
专业能力 a. 系统工程与编程能力:具备良好的系统工程基础,熟悉 Linux 开发环境,掌握 Python、Go等至少一门编程语言,具备扎实的工程实现能力,能够使用 vibe coding 快速构建项目原型。 b. 主流框架:理解并应用分布式训练与推理加速框架(如 Megatron-LM/FSDP2, vLLM/SGLang, Slime/VeRL, Ray 等),掌握 Nsight 等调试分析工具,有大规模集群训练性能调优经验者优先。 c. 模型与后训练:了解 Transformer 及主流 LLM 模型架构、演进原理与局限;对后训练算法有实践经验和深刻认知,具备模型迭代能力(含数据合成、模型评测与优化);深度参与或主导过 Agentic RL、PRM、OPD 等前沿对齐算法的落地经验者优先。
能力特质 a. 学习力与极客精神:对 AI 与大模型技术充满热情与好奇心,对未知开放,能举一反三;具备快速吸收学术界最新成果的能力,渴望在高性能计算与 AI 架构领域实现技术突破。 b. 跨域视野与协同:有较宽的技术视野与知识面,对算法研发流程、数据、训练、推理等相关领域的技术逻辑都有涉猎;能与跨域岗位,如:算法、产品等,进行良好的沟通。 c. 系统思维:乐于挑战复杂系统的性能极限,具备良好的性能分析与调优能力,具备严谨的工程习惯,喜欢从底层视角拆解并解决问题。
信息来自企业官方招聘渠道
OfferSeek 对公开岗位信息进行聚合、去重和结构化整理,最终申请以企业官方页面为准。