上海人工智能实验室
网页预训练数据研究工程师-大模型中心
岗位职责
【岗位介绍】 团队已具备大规模网页数据、基础预处理和粗清洗 pipeline、已有质量评分系统,以及 proxy training、模型评测和数据版本交付能力。 该岗位负责网页预训练数据的质量研究和最终质量把关,重点探索高价值数据源,以及更有效的筛选、评分、修复、合成和采样方法,在扩大有效数据规模的同时持续提升数据质量。
【团队协作】 我们有专门的数据工程团队,负责网页数据接入、基础预处理、粗清洗、规模化 pipeline 和生产运行。 本岗位侧重网页数据源评估、质量算法研究、原型验证和训练效果分析。双方将共同定义网页数据方案和质量指标,协同推动有效方法的规模化落地,并结合数据统计、抽样分析和模型实验持续迭代数据版本。 岗位职责
负责网页预训练数据的质量研究、数据方案实现和版本化交付。
基于现有网页处理 pipeline,研究不同数据筛选、分类、评分、修复和采样策略对模型能力的影响。
建设和优化网页质量评价体系,包括但不限于: - 内容质量、知识密度和教育价值评分; - 广告、导航、SEO、模板化和低信息内容识别; - 领域、主题、语言及难度分类; - LLM scorer、轻量分类器和规则的组合使用。
分析当前被过滤网页数据中的 false rejection,研究通过正文修复、重新切分、去模板、重写、重新评分或降低采样权重等方式恢复其训练价值。
负责网页数据中的通用知识、STEM、推理及多语言数据覆盖分析,并提出相应的数据采样和配比方案。
设计并执行数据消融及 proxy training 实验,评估不同网页数据方案对 General、Knowledge、Reasoning 和 Multilingual benchmark 的影响。
按照统一标准完成网页 candidate、primary 和 fallback 数据版本的 materialization,包括质量统计、抽样检查、版本记录和发布验收。
与 PDF、代码数据负责人及预训练负责人协作,参与整体预训练数据 mixture 的设计和迭代。
任职要求
具有 NLP、大语言模型、搜索、推荐、内容理解或大规模文本数据处理经验。
熟悉网页文本中的正文抽取、模板内容、重复内容、垃圾内容和语言识别等问题。
能够独立设计数据质量指标、训练实验和对照实验,并根据模型结果迭代数据策略。
熟练使用 Python,具备良好的数据分析和工程实现能力。
熟悉至少一种分布式数据处理或大规模推理框架。 加分项 - 具有 LLM 预训练数据建设经验; - 做过网页质量排序、内容理解或搜索索引; - 具有多语言或低资源语言数据经验; - 熟悉数据去污染、数据溯源和训练数据合规问题。
信息来自企业官方招聘渠道
OfferSeek 对公开岗位信息进行聚合、去重和结构化整理,最终申请以企业官方页面为准。
