曦望Sunrise
智算中心与容器网络工程师
岗位职责
聚焦智算中心底层网络与容器网络领域,负责网络环境维护、CNI插件优化与网络问题排查,搭建安全稳定的算力网络体系,保障GPU算力业务平稳运行。 岗位职责 - 负责智算中心底层网络环境的日常维护、状态巡检与运维保障工作,持续稳固网络稳定性,保障GPU算力网络持续平稳、高效运行。 - 系统学习容器网络核心技术,参与Kubernetes容器网络相关功能迭代,协助完成CNI插件开发、性能优化与集群网络通信调试工作。 - 协助排查智算中心、容器集群内各类基础网络故障,完成问题定位、日志梳理、原因复盘与优化跟进,保障网络服务稳定。 - 参与智算中心 RDMA/RoCE 高性能网络及 GPU 集合通信环境建设与优化,协助开展 NCCL 等集合通信性能测试、问题定位与网络调优,保障大规模 GPU 集群通信稳定与高效运行。 - 参与网络安全、网络隔离相关基础体系建设与落地迭代,配合团队完善算力网络安全防护能力与资源隔离能力。 - 面向大规模 GPU 集群通信和容器网络稳定性,推动网络能力服务于真实训练/推理业务负载。
任职要求
任职要求 - 2027届硕士及以上学历毕业生,计算机网络、计算机科学、软件工程等相关专业优先,对智算中心、容器网络方向有浓厚探索兴趣。 - 熟练掌握Linux系统基础操作与运维命令,精通TCP/IP协议栈核心原理,熟悉iptables等常用网络工具的使用与配置逻辑。 - 了解Kubernetes基础架构与容器网络模型,具备较强的技术学习意愿,拥有基础网络问题排查、分析与解决能力。 - 逻辑思维清晰,工作细致严谨,责任心强,具备良好的问题梳理与复盘能力,自主学习能力优异。 - 熟悉 RDMA/RoCE 网络基础原理,了解 NCCL 等 GPU 集合通信机制,具备集合通信网络部署、性能测试、问题排查或调优经。 - 具备良好的团队协作与沟通能力,执行力强,能够积极配合团队推进网络运维、开发优化与项目落地工作。 - 我们期待你对大规模集群网络、容器网络和 GPU 集合通信有真实兴趣,能以稳定性和业务连续性为目标,严谨排查问题并推动网络能力持续优化。 加分项 - 拥有智算中心运维、容器网络、K8s集群、CNI插件开发相关实习经历或落地项目经验。 - 熟悉Kubernetes网络生态、主流CNI插件、云数据中心网络架构,有网络调试、网络优化实战经验。 - 掌握网络安全、网络隔离、流量管控相关技术,有算力集群、云平台网络运维建设相关经历优先。 - 自驱力强,具备独立拆解网络复杂问题、自主学习前沿容器网络技术的能力,能够独立完成基础开发与优化工作。 加入曦望,你将获得什么 - 难得的创造机会:参与 AI 推理 GPU 和算力基础设施从 0 到 1 到 N 的真实建设。 - 真问题、真战场、大空间:解决成本、稳定性、规模化落地中的关键问题,在核心岗位承担真实责任。 - 顶级人才共事:和行业优秀的工程、架构、产品与业务团队一起做复杂系统。 - 简单坦诚的文化:被信任、讲事实、少内耗,专业高效地把事做成。 - 长期回报与保障:有竞争力的薪酬激励、token 补贴、补充商保、员工及家人体检、晚餐与夜间出行支持等。
信息来自企业官方招聘渠道
OfferSeek 对公开岗位信息进行聚合、去重和结构化整理,最终申请以企业官方页面为准。