阿里云
KV Cache分布式存储的网络优化-阿里星/A Star
RESPONSIBILITIES
岗位职责
负责大模型推理系统中网络性能优化和设计。深入了解计算机体系结构与网络系统相关知识。熟悉推理系统算法及推理基础设施的原理、关键问题与方案。核心工作职责包括:
KV Cache相关的传输优化;
通信协议优化:RDMA、TCP实现高效的分布式传输;
模型特定的优化方案:针对MOE、Prefix KV Cache等特殊模型架构,提供定制化的优化解决方案,支持各类大模型架构;
性能基准测试与监控系统建设:建立完整的性能评估框架,实现实时监控和分析,提供性能优化的数据支撑;
开源社区贡献与技术文档撰写:积极参与vLLM、HiCache等开源项目,撰写详细的技术文档和优化指南。
REQUIREMENTS
任职要求
有GPU计算系统优化经验,熟悉CUDA编程和GPU系统架构;
深入理解PyTorch/vLLM推理框架的架构和工作原理,有框架优化经验;
掌握CUDA、NCCL等并行编程技术,了解GPU间的通信机制;
有大规模分布式系统的设计与实现经验,理解分布式系统的核心问题;
良好的工程能力和代码质量意识,能够编写高性能、可维护的代码。
加分项
有顶级开源社区(Linux Kernel、PyTorch、TensorFlow等)的实质性贡献经验;
发表过系统优化或并行计算相关的学术论文(CCF A类以上);
有AWS/GCP/Azure等云服务AI推理优化的实战经验;
深入了解NVLink、RDMA等高性能通信协议,有优化经验。
信息来自企业官方招聘渠道
OfferSeek 对公开岗位信息进行聚合、去重和结构化整理,最终申请以企业官方页面为准。