哔哩哔哩集团
大模型算法与平台研发实习生
岗位职责
大模型训练与后训练 ●基于 Qwen3.5 等开源大模型,开展 SFT、GRPO、DPO及知识蒸馏实验。 ●参与 On-Policy 蒸馏流程建设,包括 Student Rollout、Teacher 反馈、训练样本构造、样本筛选和迭代评测。 ●根据内容理解和 Agent 任务特点,设计训练数据、Prompt、Reward 与采样策略。 ●分析 reward、loss、KL、entropy、response length、gradient norm 等训练指标。 ●排查训练不稳定、Reward Hacking、长度偏置、模式坍缩、能力退化和训练推理不一致等问题。 ●对不同模型、数据配比、训练策略和超参数进行对照与消融实验,形成可信、可复现的实验结论。
模型与 Agent 效果评测 ●建设面向内容理解、多模态分类和 Agent 任务的评估集。 ●从 Precision、Recall、F1、格式合规率、任务完成率和稳定性等维度评价模型效果。 ●分析模型 bad case,区分数据质量、Prompt、基础模型、训练策略、Reward 设计和工具调用等不同问题。 ●设计固定评估集、回归集和对照实验,验证效果提升是否真实来自目标变量。 ●关注训练指标与真实任务效果的一致性,不以 loss 下降或 reward 上升代替最终效果验证。 ●对模型实验形成结构化结论,明确哪些方案有效、哪些无效,以及后续优化方向。
算法流程平台化 ●将数据构建、训练提交、模型推理、离线评测和结果分析流程沉淀为可复用的平台能力。 ●建设自动化训练与评测流程,减少依赖个人环境和一次性脚本的人工操作。 ●完善实验配置、任务状态、指标记录、模型版本和产物管理,保证实验可追踪、可比较、可复现。 ●参与算法任务的异常处理、日志分析、监控告警和失败恢复。 ●对自己负责的算法能力完成从实验验证到稳定交付的
任职要求
计算机、人工智能、软件工程、数学或相关专业在读。
熟悉 Python,能够独立完成数据处理、模型训练、效果评测和问题排查。
熟悉 PyTorch,能够阅读和修改常见的大模型训练代码。
理解 Transformer、Attention、自回归生成、Tokenization 等基本原理。
对大模型后训练有基本认识,至少实际接触过以下一个方向:
SFT 或指令微调;
GRPO、PPO、DPO 等强化学习或偏好优化方法;
知识蒸馏、模型压缩或合成数据构建;
多模态模型训练与评测。
理解训练集、验证集和测试集的边界,能够设计基本的对照实验和消融实验。
能够结合训练曲线、离线指标和 bad case 判断实验结果,而不只是确认训练任务是否成功。
理解 Precision、Recall、F1 等常见指标,对多分类、多标签或层级分类评测有基本认识。
具备基本的 Linux、Git 和 SQL 能力,能够独立运行任务、检查数据和排查日志。
具备工程意识,愿意为算法流程补充测试、监控、异常处理和使用文档。
对平台相关工作不排斥,愿意把有效的算法实验沉淀为其他同学可以稳定复用的能力
信息来自企业官方招聘渠道
OfferSeek 对公开岗位信息进行聚合、去重和结构化整理,最终申请以企业官方页面为准。
