宁德时代
科学数据/数据治理/知识图谱研究员
岗位职责
岗位概述: 我们在构建面向科学推理的新一代大语言模型(LLM)与多模态大语言模型(MLLM)。要让模型真正“理解科学”,数据不能只是堆砌语料,而必须成为可追溯、可验证、可演化的科学资产:每一条结论都能回到原始证据,每一次训练都能复现,每一次迭代都能解释“为什么更好”。 你将参与建设一套长期可扩展的“科学知识工厂”:将论文、教科书、专利、实验记录、工艺日志等多源数据规模化采集、清洗与结构化,沉淀为高质量训练数据、评测数据与知识图谱基础设施,直接影响模型的推理可靠性、引用可追溯性与跨学科泛化能力,支撑科学大语言模型和AI Agents的训练,检索,推理与决策。 你将负责: 建设端到端数据工厂:搭建持续的数据获取与解析能力,将多源科学数据稳定转化为结构化资产(文本、表格、图表、公式、元数据等),并保证可扩展、可复用。 规模化数据质量与治理:建立面向大模型训练的数据质量体系与治理机制(去重、版本管理、数据血缘、质量指标、隔离策略),让数据管线长期运行且可持续迭代。 面向科学推理的知识表示与图谱:设计支持推理的知识结构(图谱 Schema/索引/检索接口等),纳入关键科学要素(概念、变量与物理量关系、符号与单位一致性等),为科学推理、理论推导与模型评测提供可查询、可验证的基础。 服务训练、检索与智能体工作流:为模型训练与 AI Agents 提供可审计的数据供给能力:可追溯样本、数据卡(data card)、引用证据链与权限控制;支持 RAG/GraphRAG 等检索增强推理。 平台化与自动化:把数据管线做成“平台能力”:自动化、可观测、可回滚、可扩容;持续优化吞吐、稳定性与成本。 研究沉淀(鼓励):在信息抽取、科学NLP、知识图谱、数据治理与评测等方向沉淀方法与结果(论文/技术报告/开源组件,在合规与IP边界内)。 必备要求: 具备大规模数据工程经验:ETL、数据管线、数据仓库/湖、对象存储、SQL/计算引擎等,能把系统跑稳、跑长、能演进。 在至少一个方向具备扎实技术深度:信息抽取(IE)/NLP/检索(IR)/图数据库与知识图谱/复杂文档结构化(PDF、表格、公式)。 具备工程化交付能力与可靠性意识:版本管理、监控与可观测、权限与审计、可复现、故障定位与恢复。 具备跨团队协作能力:能把研究需求转化为可维护的数据产品与评测资产,并对端到端效果负责。 加分项: 熟悉 GraphRAG / 检索增强推理落地;了解 Neo4j/JanusGraph 等图数据库或相关图计算栈。 机器学习/AI/数据方向博士学位(PhD)或同等研究训练;或具备长期负责复杂数据系统的 owner 经验。 高质量发表记录(方向匹配即可):ACL/EMNLP/NAACL/KDD/WWW/NeurIPS/ICLR/ICML/Nature Machine Intelligence 等。 有科学领域数据经验(材料/化学/制造/实验数据)或企业级数据合规与治理经验。 你在这里的成功标准: 数据获取—治理—供给形成稳定闭环:研究者能快速获得可信数据,训练与评测可复现、可追溯。 数据质量可量化:质量指标与隔离策略建立,显著降低噪声与泄露风险。 知识层可用:结构化知识与检索接口支撑推理与引用证据链,推动模型可靠性与可解释性提升
任职要求
任职要求暂未独立解析,请以企业官方岗位页面的信息为准。
信息来自企业官方招聘渠道
OfferSeek 对公开岗位信息进行聚合、去重和结构化整理,最终申请以企业官方页面为准。
