上海人工智能实验室
AI应用评测工程师
RESPONSIBILITIES
岗位职责
评测框架与平台开发:构建以模型、Harness为评测对象,以AI4S多研究领域为核心内容的的评测能力,实现对 ” 任务 X 模型 X Harness “ 多维度组合的评测,建设使用门槛低、效率高、自动化、可信赖的评测框架与平台
评测方法建设:能够快速跑通、复现开源Benchmark;协同领域科学家、产品经理共同构建符合AI4S业务属性的评测方法,包含自建Benchmark,探索新的评估范式以解决静态评估及榜单的弊端
评测结果分析:对评测结果进行深入分析,形成评测报告,为模型、Agent研发迭代提供参考。Agent评测,对工具调用、工具轨迹、权限、状态变化、消耗资源、Agent产物等全链路评测结果进行真实性反馈,形成Agent迭代优化的依据
AI研发体系建设:协同数据研发、模型研发、Agent研发、模型服务等多个研发团队,建设起 “ 数据语料-AI研发-AI评测 ”的闭环研发体系,不断提升模型与Agent表现
REQUIREMENTS
任职要求
计算机相关专业,本科及以上学历,3年以上相关工作经验;具备Python/Java/Go至少一种语言的开发能力,熟悉JSON、YAML等数据格式,熟悉Linux开发环境,能够使用Shell脚本进行自动化任务。
熟悉Agent的评估指标,不仅限于文本生成质量,还包括规划能力、工具调用成功率等维度;有LLM 应用、AI Agent的AI原生产品研发经验加分;
紧跟业界前沿趋势,高效率的论文、技术报告的阅读能力;动手能力强,能够快速复现开源项目
积极主动,对AI有激情,具备较强的团队协作能力、组织协调能力、复杂问题解决能力。
信息来自企业官方招聘渠道
OfferSeek 对公开岗位信息进行聚合、去重和结构化整理,最终申请以企业官方页面为准。
