小红书
AI 评测平台 Leader
岗位职责
核心使命: 面向 C 端 AI Agent 应用建设行业领先的评测平台与评测驱动研发体系,将模型和应用的概率性效果转化为可衡量、可归因、可优化、可持续演进的工程闭环,让评测结论持续驱动模型、Agent 工程、关键 Tool 与产品体验提升。 岗位职责
负责评测体系设计,建设覆盖评测集、评测标准、Rubric、参考答案及必过/黄金/挑战分层的评测资产体系,明确业务场景的质量定义与准出口径。
建设自动化评测平台,打通数据集管理、任务编排、多模型/多配置运行、机评、人评、结果分析、问题下钻与回归验证,提升评测规模、效率和研发使用体验。
完善多层评测能力,建设面向用户最终体验的端到端评测,以及模型、关键 Tool、组件、Trace 过程和多配置消融等专项评测。
建立持续校准与资产回流机制,结合线上真实会话、人机一致性、需求迭代和行业变化,持续校准 Judge、评测集和评测标准,使离线评测长期贴近真实用户体感。
与产品、算法、工程和 QA 深度协作,将评测前置到需求设计和技术方案阶段,并推动评测结论进入模型后训练、Agent 架构和工程能力迭代。
任职要求
具有生产级大模型、Agent 或复杂 AI 应用评测体系的建设经验,能够主导从方法设计、平台研发到业务落地的完整闭环。
深入理解 Rubric 设计、LLM-as-a-Judge、机评与人评协同、人机一致性校准、盲评/对比评测及结果可信性分析。
熟悉 Agent 应用关键链路,能够理解并评估模型推理、Context/Memory、Tool Calling、RAG、执行编排、Trace 和终端输出之间的相互影响。
具备扎实的平台工程和数据工程能力,能够设计高可用、可扩展的评测任务系统、数据处理链路、可观测体系及自动化分析能力,并亲自解决关键技术问题。
具备较强的技术判断、产品意识和跨团队推动力,能够从用户体验出发定义质量标准,并在标准不完全确定的场景中持续形成可执行结论。
信息来自企业官方招聘渠道
OfferSeek 对公开岗位信息进行聚合、去重和结构化整理,最终申请以企业官方页面为准。
