Token Foundry
研究型实习生 - Agentic Search算法
RESPONSIBILITIES
岗位职责
参与 Agentic Search 模型的全链路研发:从检索/推理轨迹(Trajectory)数据构建、SFT 冷启,到 GRPO 等强化学习优化,端到端提升搜索智能体的规划、多轮检索与工具调用能力。
设计与迭代奖励机制:探索 rubric-based reward、RLVR 等方案,兼顾答案正确性、格式规范与工具使用效率,并主动识别与治理 reward hacking / 奖励过度优化问题。
优化智能体的上下文管理与推理效率:研究长轨迹下的上下文压缩、观察折叠、多模态检索等方向,在不降低效果的前提下压缩响应长度与调用开销。
参与 Trajectory 质量评估体系建设:从工具调用效率、错误率、指令遵循度、回复相关性等维度分析线上对话日志,反哺数据与奖励设计,形成闭环。
跟踪前沿并快速落地:将学术界最新的 Agentic Search / RL / Reward Modeling 工作转化为可验证的实验方案。
REQUIREMENTS
任职要求
计算机、人工智能、统计等相关专业在读博士。
扎实的算法基础,熟练使用 Python 与 PyTorch,具备独立完成实验设计、执行与分析的能力。
熟悉 Agent / Tool-Use / RAG / 多轮检索推理范式,了解 ReAct 类框架与 search agent 的典型 pipeline。
具备良好的科研品味、独立思考能力与跨团队协作沟通能力,对前沿问题有持续热情,敢于挑战现有范式。
在NeurIPS、ICML、ICLR、ACL、EMNLP等大模型领域顶级会议以第一作者发表过论文者优先,研究方向与大语言模型、强化学习、Agent、多模态模型等强相关。
信息来自企业官方招聘渠道
OfferSeek 对公开岗位信息进行聚合、去重和结构化整理,最终申请以企业官方页面为准。