宁德时代
AI4S 大模型数据工程师(NLP / 多模态方向)
岗位职责
大规模多源数据采集与处理 负责多类型训练数据的采集、处理和组织,包括但不限于: 互联网数据 • Web网页(HTML) • Wikipedia、论坛、技术博客 • PDF论文、教材、专利、技术报告 科学数据 • 科学论文与专业知识库 • 实验数据与模拟数据 • 化学、材料、物理、生物等科学数据库 代码和推理数据 • 开源代码仓库 • 软件工程数据 • 数学题、证明与推理过程 • 科学推理与问题求解数据 多模态数据 • 图像 • 表格 • 结构化数据 • 时序数据 • 科学图谱和模拟轨迹等 主要工作包括: • 网络爬虫与数据获取;
PDF解析、OCR识别、版面分析;
数据格式转换与统一模式设计;
多模态数据组织与管理。 大模型数据处理与质量治理 建设大模型训练数据 pipeline,包括: • 数据清洗与标准化;
数据去重(精确去重 / 近似去重);
数据分类(领域、模态、质量、语言等);
数据质量评估与过滤;
数据污染检测;
数据混合设计与优化。 高质量训练数据构建 负责模型训练所需高质量数据建设,包括: • 代码、数学、推理、科学数据整理;
合成数据生成、筛选和质量评估;
Agent/ 工具调用数据构建;
指令数据构建与优化;
数据标注规范制定与标注流程优化。 数据驱动模型迭代 结合模型训练与评测结果,持续优化数据体系,包括: • 模型失败案例分析;
数据缺陷定位;
新数据需求发现;
数据采集与生成策略优化。 建立“数据采集 → 数据处理 → 模型训练 → 模型评测 → 数据优化”的数据飞轮
任职要求
必备条件 • 计算机、人工智能、自然语言处理、数据科学等相关专业硕士及以上学历;
扎实的 NLP 基础,熟悉大语言模型训练流程,包括预训练、监督微调、强化学习等;
熟悉大规模文本和多模态数据处理技术;
熟悉常见数据处理工具和框架;
具有大模型、多模态模型或相关数据 pipeline 搭建经验;
具备优秀的数据质量意识和工程实践能力。 优先考虑 具有以下经验者优先: 大模型数据经验 • 大规模互联网数据处理;
Web crawler 及 HTML 数据解析;
PDF文档解析和科学文献处理;
多模态数据处理;
代码、数学、推理数据构建;
合成数据和智能体数据建设;
数据评测与数据治理经验。 AI4S 相关背景 具备以下任一方向经验者优先: • 材料科学;
化学;
物理;
生物信息学;
科学计算与模拟
信息来自企业官方招聘渠道
OfferSeek 对公开岗位信息进行聚合、去重和结构化整理,最终申请以企业官方页面为准。
