快手
【快Star】多模态生成模型计算效率优化工程师-【可灵AI】
RESPONSIBILITIES
岗位职责
高效Attention设计: 探索新一代注意力实现机制, 包括但不限于: Sparse/Quant-Attention, Linear-Attention, Mamba等, 破除 Attention 计算平方复杂度限制, 推进新一代大模型推理极限;
量化加速: 探索NV-FP4 / INT4 等低bit 精度的量化后训练(QAT) 和KV-cache 压缩, 优化模型计算效率的同时保证模型的效果无损;
投机推理: 致力于提升Auto-Regressive 模型的生成效率, 利用draft-verify 机制实现低成本token 生成,追求极致的接收率和突破更高的接收长度。
REQUIREMENTS
任职要求
硕士及以上学历,数学、计算机、自动化、电子等专业优先;
熟悉Transformer结构及其变种, 熟悉Attention的设计和多种变种实现, 熟练使用Triton / TileLang 等工具;
数理要求: 熟练掌握 线性代数, 概率率和矩阵论;
有较强的自驱力和学习力,对生成式模型有强烈的兴趣;
加分项
有 NIPS/ICLR/ICML/CVPR 等顶会发表经历者优先。
信息来自企业官方招聘渠道
OfferSeek 对公开岗位信息进行聚合、去重和结构化整理,最终申请以企业官方页面为准。