小红书
Dots-【Ace顶尖实习生】Long Horizon Agentic Task 能力提升研究
RESPONSIBILITIES
岗位职责
本课题聚焦于提升大模型在上百轮交互的超长程 Agent 任务中的自主执行能力,目标场景涵盖 CLI/GUI Computer Use、Software Engineering、科研与专业任务等,并致力于让模型从被动响应指令转变为能够主动推进任务的 Proactive Agent。当前面临的核心挑战贯穿训练与推理两侧:在训练侧,缺乏能够覆盖真实世界复杂性与多样性的 RL 训练环境,现有环境难以模拟长程任务中工具调用、状态变迁与多步依赖的真实分布;稀疏的结果奖励无法为上百步的中间过程提供有效训练信号,如何设计面向长程任务的 Reward Signal 与 Credit Assignment 机制是关键瓶颈;在推理侧,模型在长时执行中面临目标漂移、错误累积与上下文认知负载持续增长等问题,缺乏有效的自我监控与恢复能力。研究将围绕复杂真实多样的 RL 训练环境合成、特定场景下长程稀疏奖励下关键决策步骤的信用归因,以及主动规划与长程目标对齐等核心问题展开。
REQUIREMENTS
任职要求
不限年级,本科及以上在读,计算机/人工智能/软件工程等相关专业优先;
优秀的代码能力、数据结构和基础算法功底,熟练掌握至少一门编程语言,包括但不限于Python等;
有LLM/MLLM等多模态理解技术背景,或大规模模型训练实际项目经验者优先;
在TPAMI/CVPR/NeurIPS/ICCV/ICML/ICLR等顶级期刊会议上发表相关论文者优先;
良好的沟通协作能力,责任心强,积极主动,能和团队一起探索新技术,推进技术进步。
信息来自企业官方招聘渠道
OfferSeek 对公开岗位信息进行聚合、去重和结构化整理,最终申请以企业官方页面为准。
