招商局集团
招商金科-AI算力工程师(J33326)
RESPONSIBILITIES
岗位职责
算力集群运维:负责GPU算力集群部署与运维,熟练运用Docker、Kubernetes容器化技术,实现算力资源高效调度与管理,保障集群稳定高可用。
网络搭建与监控:负责InfiniBand、RoCE等高性能网络搭建与优化,降低传输延迟、提升数据处理效率;依托Prometheus、Grafana搭建监控预警体系,实时监测设备运行状态,及时排查故障与性能瓶颈。
资源优化管理:依据项目优先级合理分配算力资源,制定资源调度策略,提升资源利用率;定期对算力基础设施进行软硬件调优、资源重组升级,持续优化算力性能,适配业务增长需求。
模型推理优化:针对Transformer、CNN等主流深度学习模型,运用算子融合、图优化、量化、剪枝等技术,优化模型推理效果,有效降低推理延迟、提升模型吞吐量。
性能评估调优:搭建完善的模型推理性能评估体系,围绕延迟、吞吐量、资源利用率等核心指标开展测试评估,输出性能报告;精准定位性能瓶颈,落地优化方案并验证效果,持续迭代提升模型性能。
REQUIREMENTS
任职要求
熟悉 GPU 硬件架构和编程模型,熟练掌握 Kubernetes、Docker 等容器化技术。
熟悉 InfiniBand、RoCE 等高性能网络技术,具备网络配置和调优能力,能够搭建低延迟、高带宽的网络环境。
掌握常用的监控和配置工具(如 Prometheus、Ansible 等),能够对算力基础设施进行全面的监控和管理。
熟悉常用的大模型推理框架(如 TensorRT - LLM、vLLM 等)的设计思路和使用方法,有相关框架的优化经验者优先。
责任心强,工作积极主动,具备出色沟通能力。
信息来自企业官方招聘渠道
OfferSeek 对公开岗位信息进行聚合、去重和结构化整理,最终申请以企业官方页面为准。