月之暗面
Scientist, Frontier Science Evals 前沿科学评估研究员(FTE/intern)
岗位职责
Domain Scientist, Agent Evals,AI4S Evals Scientist 一句话定义: 定义、评估并提升 AI 进行科学研究的能力边界与研究品味。 这个岗位不预设你的领域。无论你来自生命科学、药物发现、材料科学、AI 芯片设计,还是其他我们尚未列出的前沿方向,我们寻找的是同一种人:懂科学、信 AI、能动手。 工作范围 • 定义真正重要的科学问题与任务:在物理、化学、生物、数学等领域,从核心基础到研究前沿 —— 你出的每道题,都在教模型如何做好的 Scientific Research • 构建真正困难、对模型有挑战的 RL Tasks:把你领域中最难、最真实的研究问题,转化为可训练、可验证的 RL 任务与环境;同时构建内部评测集,敏感地衡量模型的每一次进步——既标定当前的能力边界,也直接推动边界前移;
把科研工作流变成数据与评估飞轮:搭建可运行、可复现的评测与分析 pipeline;深入分析模型的失败轨迹,定位错误出在知识缺口、推理链条还是对研究流程的理解,并将其转化为训练信号;
连接领域判断与模型进化:与 RL、Harness 及产品团队紧密协作,把你的专业判断转化为模型能力、评测基准,以及面向科学用户的真实产品功能。 我们看重的能力 • 在某个前沿科学领域有足够的研究深度:生命科学、药物发现、材料科学、化学、物理、AI 芯片设计 / EDA 等方向,博士学位或同等深度的研究 / 产业经验;
具备Research Taste(研究品味):你能从无数“看着还行”的研究问题中,识别出真正重要而尚未解决的问题,并且具备贯穿整个研究过程的判断力 • 敏锐、严谨,能够做模型最严厉的导师:当你审阅推导、论文或实验设计时,能一针见血地指出漏洞,享受提出challenge与推动改错、迭代的过程 • 对 Agent 有真实的使用与信念:在科研中深度使用 Agent 产品解决专业问题,对它的能力边界有基于实践的第一手判断,并相信 AI 将从根本上重塑科学研究的方式。 加分: • 造过 benchmark、写过 verifier / 评分标准,有公开发表的 benchmark paper • 定义过领域专用的开源工具、数据集、pipeline 被同行广泛使用 你将获得: • 关于 AI4S 前沿的第一手判断。你设计的题目,标定着模型科学能力的边界——关于这条边界的进展,你比几乎所有人都更早看到。
把你的领域专业判断力,转化为更大的影响力。你作为“导师”带出来的模型,将被全球范围的科学研究人员使用,帮助他们探索那些关乎人类未来的科学问题。
任职要求
任职要求暂未独立解析,请以企业官方岗位页面的信息为准。
信息来自企业官方招聘渠道
OfferSeek 对公开岗位信息进行聚合、去重和结构化整理,最终申请以企业官方页面为准。