到岗时间:不限
婚况要求:不限
岗位职责:
1. 单机与集***付
负责GPU服务器的安装、调试及上架工作,确保服务器硬件系统初始状态正常;
完成大规模GPU集群上线前期基础配置,涵盖硬件一致性检查、BIOS/BMC/固件一致性升级、单机压测、系统安装、环境部署、线序检查,保障集群基础环境标准化、合规化。
2. 集群多机稳定性测试
熟练执行集群多机压测全流程操作,主导all to all(全节点互联)测试,验证多节点间数据传输的带宽、延迟及稳定性,确保节点间通信无瓶颈、无丢包,满足大规模并行计算需求;
精通NCCL(NVIDIA Collective Communications Library)测试,配置测试参数、执行通信性能验证,排查NCCL通信失败、性能不达标的问题,优化集群通信效率,适配GPU集群协同计算场景;
开展多维度GPU集群稳定性测试,包括长时间满负载并行压测、节点故障注入测试、网络波动模拟测试等,全面验证集群在高压力、复杂场景下的运行稳定性;
记录测试数据、分析测试结果,输出测试报告,针对测试中发现的硬件、网络或配置问题,协同相关人员完成优化整改,确保集***付前达到预设稳定性标准。
3. 监控与环境部署
部署设备监控系统,确保GPU利用率、功耗、健康状态及集群通信状态可在监控平台中正常查看,设置异常告警机制,保障集群运行状态可追溯、可预警。
4. 项目与沟通
与PM、交付经理、TAM沟通,合理规划服务器交付排期,同步测试进度及问题整改情况,推进并完成服务器交付实施;
协调硬件、网络等相关团队,解决交付及测试过程中的跨部门协作问题,保障交付流程顺畅。
5. 文档与交接
项目交付完成后,及时整理项目交付文档,包括集群配置手册、测试报告、监控部署文档等,确保接维团队可以正常开展运维工作。
任职要求:
1. 本科及以上学历,至少三年相关工作经验,具有GPU服务器和数据中心运维经验,熟悉NVIDIA主流显卡架构(Hopper/Blackwell)者优先;
2. 熟悉Linux系统、命令行,掌握自动化工具(Ansible/Kubernetes)、监控平台及集群管理工具(Slurm);熟悉Python/Shell脚本开发,可协助优化测试及交付效率;
3. 精通GPU集群多机压测技术,熟练掌握all to all、NCCL测试流程及问题排查方法,具备较强的集群稳定性分析与优化能力;
4. 具备快速故障定位能力,能及时响应交付及测试过程中的紧急事件,拥有良好的沟通协调能力;
5. 做事细心,处事稳重,有强烈的责任心、良好的团队合作精神,能适配大规模集***付的高强度工作节奏。
求职提醒:求职过程请勿缴纳费用,谨防诈骗!若信息不实请举报。