云尖信息
多模态数据算法工程师(ICT 领域大模型)
岗位职责
领域知识树设计与构建 · 深入研究 ICT(信息与通信技术)领域知识体系,主导设计并持续迭代领域知识树/概念分类层级(Taxonomy),作为数据分类、标注和知识蒸馏的语义基石。
与 ICT 领域专家紧密协作,将隐性领域知识转化为可计算、可标注的结构化分类体系。
种子数据策略与分类器训练 · 针对 Datasheet、网页、论文等多模态文档,制定高信息密度的种子数据选取与标注策略,组织并指导小批量、高质量的人工标注。
基于种子数据,负责训练和迭代用于海量数据过滤的多模态分类器(如文档主题分类、知识点映射、关键信息区域检测等)。
探索并应用主动学习、弱监督等策略,最大化有限标注数据的价值,高效筛选出高质量领域数据。
多模态知识提取与对齐 · 设计算法,从 OCR、版面解析后的半结构化结果中,进行高精度的多模态知识提取。这包括但不限于: · 图文对的自动关联与清洗。
复杂表格、参数列表的结构化提取。
框图、电路图等视觉信息的语义理解与文本对齐。
解决跨页、跨文档的信息关联问题,提升知识提取的完整度。
预训练语料蒸馏与质量建模 · 设计知识浓缩与蒸馏策略,从海量原始文档中提炼高信息密度的预训练语料(如纯文本、图文对、知识QA对),去除冗余与噪声。
构建多维自动质量评估模型,对蒸馏后的语料进行准确性、领域相关性、信息一致性的自动化打分,并设计人工抽检闭环机制,确保入库数据的高可靠性。
数据飞轮与闭环优化 · 根据预训练效果反馈(如 perplexity、领域 benchmark 表现),反向诊断数据质量问题,持续优化数据分类、提取和蒸馏策略。
追踪多模态数据合成、知识增强等领域前沿技术,并探索其落地应用。
任职要求
硬性基础 · 计算机、人工智能等相关专业硕士及以上学历,3 年以上 NLP/多模态/机器学习相关算法经验。
精通 Python,熟练使用 PyTorch 等深度学习框架,具备扎实的算法模型开发与实验能力。
有丰富的多模态分类、文本分类或图像分类实战经验,熟悉分类模型训练、评估与错误分析的完整流程。
熟悉各类文档(PDF、扫描件)的典型处理链路,理解 OCR、版面解析等工具的输出格式与常见噪声。
核心经验(至少满足两点) · 知识工程经验:有知识图谱、本体(Ontology)、Taxonomy 构建或维护的实际项目经验,理解知识体系设计的挑战。
信息抽取经验:有从复杂文档(尤其是 Datasheet、学术论文)中抽取实体、关系、表格、图表信息的深入实践。
数据质量建模经验:有过设计并实现数据质量评估、筛选、去重模型的经验,理解高质量数据集构建的难点。
弱监督/主动学习经验:在项目中成功应用过 Active Learning 或 Weak Supervision 来减少标注成本,提升训练效率。
软素质 · 对 ICT 领域(通信、半导体、电子工程等)有强烈的好奇心和学习意愿,愿意深入理解领域知识。
优秀的逻辑思维与问题拆解能力,能将模糊的数据需求转化为清晰的算法方案与评估指标。
良好的沟通协作能力,能高效地与硬件领域专家对齐目标。 加分项 · 有大语言模型或多模态大模型预训练数据构建、知识蒸馏的实战经验。
对 Datasheet、专利、标准文档的结构与信息分布有深入理解。
在信息抽取、文档理解等相关顶级会议/期刊(ACL, EMNLP, CVPR, ICDAR 等)有论文发表。
信息来自企业官方招聘渠道
OfferSeek 对公开岗位信息进行聚合、去重和结构化整理,最终申请以企业官方页面为准。
