淘天集团
Agent在线强化学习-阿里星/T-Star
岗位职责
课题背景:淘天业务平台承载亿级用户的交易、营销、导购等核心链路,面临全球最复杂的在线决策挑战:双11峰值数十万QPS、分钟级故障处置窗口、大促规则年年迭代带来的分布漂移、研发变更与运维保障的目标冲突。现有基于规则引擎和离线模型的智能化手段已触及天花板——规则无法覆盖组合爆炸的决策空间,离线模型部署即过时,孤立的运维/研发/业务知识无法形成合力。 本课题旨在构建全球首个本体知识增强 × 在线安全强化学习 × 模型能力自进化三位一体的智能体系统,在淘天真实大促场景中实现从""人工经验驱动""到""数据-知识-决策闭环自主进化""的范式跃迁。 ——从人工经验到自主进化:面向淘天业务平台全链路智能决策与运维系统的在线强化学习范式 核心问题: ● 构建一个能在非平稳、高风险、知识密集的在线环境中持续安全学习并自主进化决策能力的智能体 研究内容包括:
基于本体知识驱动的在线安全强化学习框架:让领域知识成为RL的""骨架""而非""旁注"",在生产环境中安全地在线学习,解决生产环境RL的样本效率低、安全无保障、奖励设计难的问题
LLM-RL协同的全链路智能决策与运维系统:基于LLM、在线策略强化学习、本体常识约束,打造生产级决策与运维系统
面向业务演进的模型能力自进化机制:构建多层进化循环机制,包括跨大促元学习、单次大促内的持续适应,以及实时决策与反馈的闭环,交付跨大促的元学习快速适应算法,实现策略-本体双向进化的闭环构建。 岗位职责:
理论研究:负责本体约束的在线强化学习框架建模,并进行理论证明、自进化的收敛性分析
算法开发:设计并实现本体增强的安全在线RL算法族、LLM-RL协同决策算法、跨大促Meta-RL与经验固化算法
场景落地:在双11/618等真实大促中验证系统效果;与SRE/研发团队协作确保决策可信赖;量化评估业务价值
任职要求
硬性要求: ● 计算机科学、人工智能、运筹学、自动化等相关方向博士 ● 扎实的强化学习理论功底,精通主流RL算法(Policy Gradient/PPO/GRPO及其变体),有实际实现与调优经验 ● 熟练Python + PyTorch,具备生产级代码交付能力 ● 在ICML/NeurIPS/ICLR/AAAI/ACL/WWW等顶会有一作或共同一作论文发表,或有等价的突出研究成果 优先条件: ● 包括安全强化学习、在线学习、元学习、多智能体,了解本体工程、神经符号推理,有LLM与决策系统结合的研究经验,了解大规模分布式系统、AIOps、SRE相关背景知识,有扎实的数学功底,包括优化理论、概率论、随机过程功底扎实,能独立完成定理证明 素质要求: ● 第一性原理思维: 能从问题本质出发设计方案,而非套用现有方法 ● 理论与实践并重: 既能推公式证定理,也能写出高质量生产代码 ● 大促体感: 对""安全红线""有敬畏心,理解生产环境不允许trial-and-error ● 跨域学习能力: 愿意深入理解业务/运维/研发领域知识,而非将其视为黑箱 ● 长期主义: 认同""自进化""的愿景,愿意用3年时间构建有壁垒的系统 我们提供:
丰富的数据:淘天历次大促全链路运维/研发/业务数据,全球独一无二
顶级的场景:双11/618,全球最大规模在线决策试验场
充足的算力:GPU/CPU集群支持大规模RL训练与模拟
成熟的基础设施:成熟的监控/追踪/日志/变更管控平台作为感知与执行底座
密切的协作:与平台SRE、研发、业务团队的直接协作通道
导师:配备顶级业务+技术双导师,定期进行学术交流 加入我们一起构建面向下一个十年的智能决策范式!
信息来自企业官方招聘渠道
OfferSeek 对公开岗位信息进行聚合、去重和结构化整理,最终申请以企业官方页面为准。