上海人工智能实验室
文档与 PDF 预训练数据研究工程师-大模型中心
岗位职责
【岗位介绍】 团队已具备大规模 PDF 和复杂文档数据、基础解析与清洗 pipeline,以及 proxy training、模型评测和数据版本交付能力。现阶段的主要目标,是将复杂文档恢复为适合大语言模型预训练的高质量 Markdown,并在需要时使用 LaTeX 保留数学和科学内容。 该岗位负责文档预训练数据的质量研究和最终质量把关,重点探索高价值文档数据源,以及更有效的解析质量评估、内容修复、结构恢复、评分和采样方法。
【团队协作】 我们有专门的数据工程团队,负责 PDF 数据接入、通用解析、Markdown/LaTeX 转换、基础清洗、规模化 pipeline 和生产运行。 本岗位侧重目标文档表示、质量评价方法、关键问题研究和训练效果分析。双方将共同分析解析结果、确定优先改进方向、推动有效方案的规模化应用,并持续提升文档数据的结构保真度和训练价值。 岗位职责
负责 PDF 及复杂文档预训练数据的质量研究、数据方案实现和版本化交付。
基于现有 PDF pipeline,研究解析质量、文档结构恢复和内容筛选策略对模型预训练效果的影响。
建设 PDF 和文档质量评价体系,包括: - OCR 和文本抽取质量评估; - 阅读顺序、段落、标题及章节结构恢复; - 页眉页脚、目录、引用和重复内容清理; - 表格、公式、代码块及图注等特殊内容识别; - 文档完整性、知识密度、专业性和教育价值评分。
对解析失败或当前被过滤的文档进行分类,研究通过重新解析、版面恢复、段落重组、内容修复或模型重写等方式恢复数据价值。
重点建设高质量 STEM、数学、教材、论文、技术报告及专业知识数据。
设计 PDF 数据与网页数据之间的去重、互补性分析和采样策略,避免重复 Token 占用训练预算。
设计并执行数据消融和 proxy training 实验,评估 PDF 数据对 Knowledge、STEM、Math、Reasoning 及 Multilingual 能力的贡献。
按照统一标准完成 PDF candidate、primary 和 fallback 数据版本的 materialization,包括质量统计、失败类型分析、抽样验收和版本记录。
与网页、代码数据负责人及预训练负责人协作,参与整体数据 mixture 设计。
任职要求
具有文档理解、OCR、版面分析、NLP 或大语言模型数据处理经验。
熟悉 PDF 和复杂文档常见问题,包括多栏布局、扫描件、公式、表格、乱码和阅读顺序错误。
能够结合规则、模型和统计方法建立文档质量评价和修复流程。
熟练使用 Python,能够独立完成数据分析、实验实现和数据版本交付。
能够设计训练实验,判断文档质量变化是否真正改善模型能力。 加分项 - 具有图书、教材、论文、专利或技术文档处理经验; - 熟悉数学公式、表格或科学文献解析; - 具有多语言 OCR 或低资源语言文档经验; - 做过文档修复、结构化抽取或多模态文档理解。
信息来自企业官方招聘渠道
OfferSeek 对公开岗位信息进行聚合、去重和结构化整理,最终申请以企业官方页面为准。
