群核科技
科研算法工程师(具身测评方向)
岗位职责
评测体系设计与基准构建: 研究具身智能能力的科学分解方法论,定义可量化的多维度评测框架(操作灵巧度、长序推理能力、泛化鲁棒性、空间感知精度等)。 设计覆盖单一技能与长序组合的评测任务套件,制定任务成功准则、难度分级与评分规则。 实现评测任务的程序化生成,自动产出不同难度、不同初始条件的多样化测试用例,确保评测覆盖度与统计显著性。
自动化评测管线与算法评估: 搭建统一的算法评测接口层(Gym-style API),适配主流具身算法(ACT、Diffusion Policy、VLA 大模型等)。 构建从“算法提交 → 并行评测执行 → 多维指标统计 → 可视化结果生成”的全自动化流水线。 复现主流 Baseline 算法并产出标准化性能基准报告,设计消融实验与错误模式分析框架,输出算法能力画像。
前沿评测范式跟踪与技术迭代: 持续跟踪具身评测方向前沿工作(RoboCasa、BEHAVIOR、Habitat、ManiSkill、SimplerEnv、Isaac Lab Arena 等),系统分析其评测任务设计、指标定义与方法论。 针对现有基准的不足(任务过于简单、评测维度单一、缺乏长序评估等),提出改进方案并迭代内部评测体系。 将评测过程中发现的算法共性问题与改进建议反馈给算法团队,形成“评测驱动算法迭代”的闭环
任职要求
教育背景与经验: 计算机科学、人工智能、机器人学等相关专业硕士及以上学历。 硕士 2 年以上或博士应届,有具身智能、机器人操作、评测基准构建相关方向的科研或工程经验。
计算机与编程基础: 精通 Python,具备良好的代码架构能力(模块化、可扩展),代码风格整洁规范。 扎实的数据结构与算法功底,熟练掌握概率统计与实验设计方法。 熟练使用 PyTorch、Linux、Git、Docker 等工具链。
专业核心能力: 深入理解至少一种具身智能主流算法范式(Imitation Learning 如 ACT/Diffusion Policy,或 VLA 大模型 如 RT-2/Octo),能独立复现并分析性能。 有使用或构建过机器人/具身评测基准的经历(如 RoboCasa、BEHAVIOR、Habitat、ManiSkill、Isaac Lab Arena、CALVIN 等),理解评测设计原则与常见陷阱。 掌握科学的实验设计方法(控制变量、统计检验、消融实验),能设计逻辑严谨的算法对比实验。 能熟练使用至少一种机器人仿真环境(Isaac Sim / Isaac LAB / MuJoCo 等)进行算法训练与评估。
加分项: 主导或核心参与过知名评测基准项目的构建。 有 Sim-to-Real 评测链路搭建经验,以真机实验验证过仿真评测结论的可迁移性。 了解 LLM-as-Judge 等多模态模型在具身任务自动评估中的应用。
综合素质: 科学严谨,对实验可复现性和结论可靠性有高度要求。 系统化思维,能从“能力定义 → 任务设计 → 实验执行 → 结果分析”全链路视角工作。 具备良好的沟通能力,能将评测结论清晰传达给算法团队,推动算法迭代优化
信息来自企业官方招聘渠道
OfferSeek 对公开岗位信息进行聚合、去重和结构化整理,最终申请以企业官方页面为准。
