电话:0351-7221990
关闭
开发工程师-云平台 5000-10000 收藏 申请职位 主管直聊
您当前的位置: 首页 > 职位列表 > 职位详情

开发工程师-云平台

5000-10000
上海-上海 | 3年以上经验 | 本科学历
2026-06-10 更新 被浏览:
企业未开启查看联系方式,请直接投递简历 投递简历
职位描述
到岗时间:不限 婚况要求:不限 一、岗位职责 Docker 计算机相关专业 1、设计、构建和维护基于Kubernetes的云原生AI基础设施平台,支撑大规模模型训推评; 2、负责自动化CI/CD流⽔线的构建和优化,确保代码质量和⾼效交付; 3、设计并实施基于Docker和Kubernetes的容器化部署⽅案,支持AI模型的快速迭代和部署; 4、构建基于Istio的服务网格架构,实现微服务间的流量管理、安全通信和灰度发布; 5、参与统⼀智能体开发环境的设计与实现,为科研人员提供高效便捷的开发测试环境; 6、搭建完善的监控告警系统,及时发现并解决生产环境问题; 7、推动团队工程规范和***实践,确保系统稳定性和可维护性; 8、参与技术选型和架构设计,为AI平台提供可靠的技术支撑; 二、任职要求 1、熟悉Docker容器技术,熟悉容器网络、存储及安全机制,有大规模容器化应用实践经验; 2、深入掌握Kubernetes生态系统,具备集群搭建、调优、故障排查经验,熟悉自定义Operator开发; 3、熟练应用Istio服务网格技术,有实际项目中实施流量管理、安全策略和监控的经验; 4、熟悉Go/Python/Java等至少一门语言,有大型分布式系统开发经验; 5、熟悉云原生监控体系(Prometheus/Grafana等)和日志系统(ELK等); 6、熟悉至少一种主流云平台(AWS/Azure/阿里云)的云原生服务; 7、有Kubeflow、Argo等AI开源工具链的深度实践经验(加分项); 8、有开源项目贡献经历,特别是在云原生领域(加分项); 项目经验 1、3年以上后端开发或DevOps经验,2年以上Kubernetes生产环境实战经验; 2、有AI基础设施或大规模分布式系统建设经验者优先; 3、有完整参与过从0到1构建云原生平台的经验; 有在生产环境中解决Kubernetes集群稳定性、性能问题的实际案例优先
求职提醒:求职过程请勿缴纳费用,谨防诈骗!若信息不实请举报。
该公司的其他职位
会员等级
  • 互联网服务
  • 10-50人
  • 500万
负责裸金属服务器全生命周期管理平台的设计、开发与迭代,覆盖服务器部署、配置、监控、运维、销毁等核心流程,支撑智算基础设施高效稳定运行; 设计并实现高可用、高性能平台核心模块,包括资源调度、带外管理、镜像管理、PXE 部署、RAID 配置、任务编排等; 负责平台 API 设计与开发,支撑前端交互、第三方系统集成,推动运维操作平台化、自动化; 面向大规模裸金属及 GPU 集群场景,解决批量交付、并发管控、硬件兼容性、异常恢复等关键问题,保障平台在复杂场景下的稳定性与交付效率。 参与平台架构设计、技术选型与方案评审,沉淀裸金属管理核心技术能力,实现技术对内沉淀、对外赋能。 与运维、网络、IDC 等相关团队协作,将线下操作流程抽象为平台能力,推动设备运维自动化闭环。 任职要求: 本科及以上学历,计算机、电子信息、软件工程等相关专业,3 年及以上 Golang 后台开发经验; 熟练掌握 Golang 语言特性,具备扎实的并发编程、性能优化能力;有高并发、高可用系统设计经验,具备 RESTful API 设计、服务治理、可观测性等工程化能力。 深入理解裸金属服务器管理相关核心技术,包括但不限于 BMC 带外管理、PXE 网络装机、镜像制作与分发、RAID / LVM 配置、服务器健康检测与故障定位 等。 熟悉 Linux 系统及常见问题排查,具备基础的网络知识,理解 TCP/IP、HTTP、DNS、DHCP、TFTP 等常见协议与服务;了解 Nginx、Ansible 等常见基础组件和自动化工具。 熟悉 MySQL、Redis 等常用存储组件,具备数据库设计、索引优化和高并发场景下的数据处理经验。 具备良好的问题分析与系统设计能力,能够在复杂基础设施场景下推进问题定位、方案落地和跨团队协作,对云基础设施或智算基础设施有较强兴趣和理解。 任职要求 本科及以上学历,计算机、电子信息、软件工程等相关专业,3 年及以上 Golang 后台开发经验; 熟练掌握 Golang 语言特性,具备扎实的并发编程、性能优化能力;有高并发、高可用系统设计经验,具备 RESTful API 设计、服务治理、可观测性等工程化能力。 深入理解裸金属服务器管理相关核心技术,包括但不限于 BMC 带外管理、PXE 网络装机、镜像制作与分发、RAID / LVM 配置、服务器健康检测与故障定位 等。 熟悉 Linux 系统及常见问题排查,具备基础的网络知识,理解 TCP/IP、HTTP、DNS、DHCP、TFTP 等常见协议与服务;了解 Nginx、Ansible 等常见基础组件和自动化工具。 熟悉 MySQL、Redis 等常用存储组件,具备数据库设计、索引优化和高并发场景下的数据处理经验。 具备良好的问题分析与系统设计能力,能够在复杂基础设施场景下推进问题定位、方案落地和跨团队协作,对云基础设施或智算基础设施有较强兴趣和理解。 加分项 有 IaaS 管理平台、裸金属管理平台、装机平台、资源调度平台 等相关研发经验。 有 OpenStack / Ironic、CloudStack、MAAS、Tinkerbell 等基础设施平台或裸金属管理体系相关经验。 熟悉面向 GPU 服务器 / 训练集群 的裸金属管理场景,包括批量装机、节点健康检查、拓扑识别、多机互联压测,以及 RDMA / InfiniBand / NVlink 等基础能力验证。 有大规模服务器集群、智算集群或数据中心基础设施相关研发经验者优先。
分享到朋友圈
分享至朋友圈
↑微信扫上方二维码↑
生成职位海报
分享到朋友圈
竞争力分析
综合竞争力评估
问公司
对职位有疑问?快来问问吧
手机扫一扫
随时随地找工作
简历投递成功
您可以在 个人中心 - 简历管理 - 我的简历 中查看您创建的简历
您可能感兴趣的职位:
关注微信公众号
申请结果早知道
联系时请说明是在英联优聘-找工作,学技能,拓人脉,上英联优聘!上看到的
正在获取二维码...
请使用微信扫一扫
客服服务热线
0351-7221990
周一到周日 9:00-19:00
微信公众号
手机浏览

温馨提示:根据国家有关规定,用人单位不得向求职者收取抵押金及任何费用,请求职者加强自我保护意识!
Copyright © 2016-2022 All Rights Reserved 晋ICP备2021018695号

地址:中国 · 山西 · 太原 EMAIL:1020552200@qq.com

人力资源证: 1401002200248

用微信扫一扫