之江实验室
多模态OCR模型算法研发工程师
RESPONSIBILITIES
岗位职责
前沿技术追踪与复现:系统性追踪、阅读并总结计算机视觉、多模态学习及强化学习领域的最新顶会论文,重点关注OCR(检测、识别、VLM)相关研究,负责关键算法的复现与初步验证工作。
强化学习在OCR中的应用探索:设计并实现基于强化学习的算法框架,针对性优化OCR任务中的关键难点(如高难度表格、公式识别),开展充分的实验验证与效果分析。
多模态OCR模型训练与调优:参与或主导构建融合视觉、文本等多维度信息的OCR模型,负责相关数据集准备、模型训练、评测指标设计与分析,持续迭代提升模型在实际复杂场景下的性能与鲁棒性。
技术沉淀与输出:将研究成果转化为高质量技术报告,有机会参与专利撰写或学术论文发表。
REQUIREMENTS
任职要求
计算机科学、人工智能、模式识别、自动化等相关专业硕士及以上学历,硕士学历需有4年工作经验,博士学历无工作经验要求;
以第一作者或核心贡献者身份在CVPR/ICCV/ECCV/NeurIPS/ICLR/AAAI等人工智能顶级会议或期刊发表过论文者优先;
具备强化学习的扎实理论知识,拥有至少一个相关项目研究或实践经验,熟悉PPO、GRPO等主流RL框架;
熟悉OCR领域基本任务(检测、识别)和MinerU、PaddleOCR、DeepseekOCR、HunyuanOCR等主流框架;
精通Python,熟练掌握PyTorch或Transformers框架,具备优秀的代码实现和调试能力;
综合素质: a)具备极强的自主学习能力和英文文献阅读能力,能够快速跟进领域前沿动态; b)拥有出色的分析问题和解决问题能力,对挑战性技术难题充满热情; c)具备良好的沟通能力和团队协作精神,能清晰阐述实验思路与结果。
信息来自企业官方招聘渠道
OfferSeek 对公开岗位信息进行聚合、去重和结构化整理,最终申请以企业官方页面为准。