Token Foundry
研究型实习生 - 大模型 Rubrics 评测与奖励建模算法
岗位职责
面向开放式与 Agentic 任务,设计和迭代 Rubric 体系:原子化准则拆分、意图对齐、难度/区分度校准、必需项/加分项/惩罚项的分层评分:
把 Rubric 转化为奖励信号,训练 / 微调 Reward Model 与 Verifier,接入 SFT + RL 流程;分析并抑制 reward hacking 与奖励过度优化;
构建与优化 Rubric-based 评测流水线(LLM-as-Judge / rubric coverage / ensemble judge),持续提升与人类标注的一致性(相关系数、ICC、偏好一致率);
搭建评测与训练的数据闭环:日志回流、合成 query、Rubric 自动/半自动生成、短板数据反馈;
复现前沿论文方法并做对比实验,沉淀可复用的评测基准与 baseline,产出实验报告。
探索 Rubrics 在 RL 训练中的动态演化,识别并缓解 reward hacking。
研究评分项权重分配与聚合策略,提升自动打分与人类偏好的排序一致性。
参与 Rubrics 自动生成方法研究,实现从任务描述与少量样本推导结构化评分标准的能力,解决条目覆盖度、正交性与可判定性问题。
优化 Judge 模型的判定稳定性,降低位置偏好、长度偏好与随机波动,并控制推理成本。
在评测打分、训练样本筛选、RL 奖励信号三个下游场景完成验证实验,参与基准数据集建设与论文撰写。
任职要求
计算机、人工智能、统计等相关专业在读博士。
熟练 Python 与 PyTorch,能独立完成数据处理、训练脚本编写与实验分析。
扎实的机器学习与深度学习基础,熟悉 LLM 的 Post-Training 范式(SFT / RLHF / RLVR / DPO 至少了解其一)。
有模型评测、奖励模型训练相关经验,了解 RL 训练的常见方法和挑战,对高质量数据有极高的敏锐度,能通过实验快速验证数据配比对模型能力的影响并总结为方法论。
对"如何定义好坏"这类评价问题有兴趣与判断力,做事细致,能耐受大量对照实验。
有顶会论文(NeurIPS/ICLR/ICML/ACL 等)、高质量开源项目或知名比赛经历者优先。 加分项
做过 Rubric-based / LLM-as-Judge 评测,或 Reward Model / Verifier 训练;了解 rubric 评分制的对齐研究(如 0–5 分制与人类标注一致性)。
熟悉 reward hacking / reward over-optimization 的成因与缓解(verifier failure、rubric-design 缺陷、KL 约束下高奖励区误差放大等),并有实操经验。
了解自适应 / 自动 Rubric 生成、置信度加权评估、rubric 蒸馏(免 judge 调用)等方向。
熟悉主流评测基准与方法论(如 HealthBench、ResearchQA、PaperBench 等 rubric-based benchmark)。
有 Agentic / Agentic Search 训练或评测经验,理解 Trajectory 质量(工具调用效率、指令遵循、回复相关性)。
信息来自企业官方招聘渠道
OfferSeek 对公开岗位信息进行聚合、去重和结构化整理,最终申请以企业官方页面为准。