之江实验室
海纳数据自然语言处理工程师
RESPONSIBILITIES
岗位职责
从常见格式(如PDF、HTML、XML等)的学术文献中提取标题、作者、摘要、参考文献等基础元数据;
参与设计并实现文本清洗与字段标准化流程(如作者名、机构名、期刊名的格式统一);
协助解析参考文献并建立基本的引文关联;
参与开发去重与实体匹配逻辑,处理同一实体在不同来源中的表达差异;
配合团队建立基础的数据质量评估方法,跟踪关键字段的抽取效果;
与数据工程、知识图谱和产品团队协作,支持下游应用对结构化数据的需求。
REQUIREMENTS
任职要求
计算机科学、人工智能、信息科学或相关专业硕士及以上学历,硕士学历需有4年工作经验,博士学历无工作经验要求;
了解常见学术文献格式(如arXiv、PubMed、JATSXML等)的基本结构;
熟悉命名实体识别、文本标准化或正则表达式等基础文本处理技术;
熟练使用Python,了解常用NLP工具库;
具备良好的工程习惯,能编写清晰、可维护的代码和文档;
对数据质量敏感,愿意深入理解业务场景中的文本处理问题。
加分项
有处理多语言文本的经验,了解不同语言(如中文、日语、韩语、俄语、阿拉伯语等)在书写、分词或表达上的差异;
熟悉多语言命名实体识别、跨语言实体链接、语言检测或多语言模糊匹配技术;
接触过作者消歧、机构归一化或多语言引用匹配相关任务;
使用过大语言模型辅助信息抽取或结果校验;
熟悉Unicode处理、多语言分词、语言特定正则规则等底层文本技术;
有PDF解析经验,或参与过多语言学术元数据项目;
了解多语言知识图谱构建的基本流程。
信息来自企业官方招聘渠道
OfferSeek 对公开岗位信息进行聚合、去重和结构化整理,最终申请以企业官方页面为准。