到岗时间:不限
婚况要求:不限
一、岗位定位
负责 AI 算力集群的网络性能优化、通信链路调优和故障定位,保障模型服务在多机多卡环境下稳定高效运行。
二、工作职责
1. 负责 AI 算力集群网络架构设计、性能测试和优化;
2. 负责 RoCE、InfiniBand、Ethernet 等不同组网环境下的性能调优;
3. 负责多机多卡通信、RDMA、P2P、网络延迟、丢包、拥塞等问题定位;
4. 支撑模型服务在多节点、多实例、高并发场景下稳定运行;
5. 负责网络压测、链路检测、带宽利用率、丢包率、延迟等指标分析;
6. 配合集群运维团队完成服务器、交换机、网卡、驱动、固件等环境确认;
7. 建设网络性能基线和巡检机制,输出压测报告、故障定位手册和***实践文档;
8. 与模型性能团队协作,分析网络对整体吞吐、延迟和稳定性的影响。
三、任职要求
1. 计算机、网络工程、通信工程等相关专业本科及以上学历;
2. 熟悉 TCP/IP、RDMA、RoCE、InfiniBand、VLAN、Bond、路由交换等网络基础;
3. 熟悉 Linux 网络配置、性能分析和故障排查;
4. 熟悉 GPU 集群网络、NCCL 通信、CX 网卡、交换机调优者优先;
5. 熟悉 iperf、ib_write_bw、nccl-tests、ethtool、tcpdump 等工具;
6. 有数据中心网络、高性能计算网络、HPC 集群或 AI 集群网络经验;
7. 具备较强现场问题定位和跨团队协作能力。
加分项
- 有 H100 / H200 / H20 / B200 / B300 / 6000D 等 GPU 集群网络调优经验;
- 有 RoCE 网络调优、PFC / ECN / QoS 配置经验;
- 有 InfiniBand / UFM / NCCL Tests 使用经验;
- 有大模型推理集群、训练集群或 HPC 集群经验;
- 熟悉 spine-leaf 网络架构和多机房组网方案。
求职提醒:求职过程请勿缴纳费用,谨防诈骗!若信息不实请举报。