传音
大模型算法测试工程师(J20215)
RESPONSIBILITIES
岗位职责
岗位概述: 测试大语言模型(LLM)的生成质量、一致性、安全性、多语言能力等。重点关注模型输出的准确性和可靠性。 岗位要求:
构建 LLM 测试用例库:包括文本理解、代码生成、多轮对话、知识问答等
设计评估指标体系:准确率、相关性、毒性检测、幻觉评估等
执行黄金测试集测试:对 LLM 输出进行人工或自动打分
使用 LLM-as-a-Judge 方法进行大规模自动评估
红队测试:通过对抗性提示词测试模型边界和安全性
多语言测试:验证模型在中文、英文、印度语等市场语言上的表现
性能监控:跟踪模型输出延迟、成本、稳定性
REQUIREMENTS
任职要求
本科及以上学历(计算机、NLP、数学相关经验等专业)
Python 编程能力强
对大语言模型有基本认知(理解 Transformer、Token、Prompt 概念)
逻辑严谨,能设计系统的评估方案
有数据标注或质量评估经验(优先)
加分项
使用过 ChatGPT、Claude、国内大模型的实际体验
理解 Prompt Engineering 基础
有 NLP 课程设计或竞赛经验
了解评估指标:BLEU、ROUGE、BERTScore 等
参与过文本分类、情感分析等 NLP 项目
对文史哲感兴趣且有对应背景知识
信息来自企业官方招聘渠道
OfferSeek 对公开岗位信息进行聚合、去重和结构化整理,最终申请以企业官方页面为准。
