上海人工智能实验室
代码预训练数据研究工程师-大模型中心
岗位职责
【岗位介绍】 团队已具备大规模代码数据、file-level 基础预处理和粗清洗 pipeline、已有代码质量评分系统,以及 proxy training、代码评测和数据版本交付能力。 该岗位负责代码预训练数据的质量研究和最终质量把关,重点探索高价值代码数据源和数据形态,以及更有效的筛选、评分、修复、合成和采样方法。 我们希望候选人不仅能够判断代码是否可解析或可运行,还能够判断代码是否清晰、惯用、可维护、可测试,并且值得模型学习和模仿。
【团队协作】 我们有专门的数据工程团队,负责代码数据接入、file-level 基础预处理、粗清洗、规模化 pipeline 和生产运行。 本岗位侧重代码数据源与数据形态研究、代码质量算法、原型验证和训练效果分析。双方将共同定义预处理和质量方案,推动有效方法规模化应用,并结合代码质量分析和模型实验持续迭代代码数据版本。
负责代码预训练数据的质量研究、数据策略实现、训练验证和版本化交付。
与数据中心团队合作,定义并验收 file-level 代码 preprocessing substrate,包括语言识别、SHA256/MinHash 去重、语法解析、文件分类、reject reason 和数据版本接口。
建设代码质量评价体系,包括: - LLM teacher 标注和质量 rubric; - 回归 scorer、ranker 或轻量分类器; - 代码可读性、正确性、完整性、复杂度及教育价值评估; - Generated、vendored、minified、test、config 和 template 文件分类。
借鉴 Seed-Coder、Nemotron 等公开方法,验证 heuristic filtering、LLM scorer 和 soft weighting 等方案的训练效果。
研究当前被过滤代码数据中的 false rejection,探索修复、重新组织、重评分或转换为其他数据形态后对预训练的价值。
负责多编程语言数据覆盖、语言配比、代码领域配比和数据难度分布分析。
研究并实现 FIM、代码—注释、代码—文档、测试—实现、跨语言转换及其他代码数据形态。
建设代码 benchmark contamination 检测方案,覆盖 EvalPlus、MultiPL-E、MBPP、CRUX-O 等评测。
设计并执行代码数据消融及 proxy training 实验,评估代码数据对 Coding、Reasoning、Math/STEM 及 General 能力的影响。
按照统一标准完成代码 candidate、primary 和 fallback 数据版本的 materialization,包括质量统计、语言分布、污染检查、抽样验收和版本记录。
与网页、PDF 数据负责人及预训练负责人合作,确定代码数据在 Stable、Decay 等阶段中的使用方式和配比。
任职要求
具有大语言模型、代码模型、程序分析、机器学习或代码数据处理经验。
熟悉 Python,并能够阅读和处理多种主流编程语言。
理解 AST、parser、Tree-sitter、代码去重、FIM 和 repository/file 数据结构。
具有 LLM batch inference、数据评分、模型训练或数据消融实验经验。
能够在不完整基础设施条件下快速实现研究原型,并与工程团队协作完成规模化。 加分项 - 参与过代码大模型预训练或代码语料建设; - 熟悉 Seed-Coder、StarCoder、The Stack、OpenCoder 或 Nemotron Code 数据方法; - 具有代码执行、编译、单元测试或沙箱环境经验; - 熟悉多编程语言 benchmark 和代码数据污染检测; - 具有合成代码、代码重写、代码审查或跨语言转换数据经验。
信息来自企业官方招聘渠道
OfferSeek 对公开岗位信息进行聚合、去重和结构化整理,最终申请以企业官方页面为准。
