到岗时间:不限
婚况要求:不限
主要职责
1、架构设计与路线图
(1)设计端到端软件栈(kernel driver → runtime → framework adapters → model serving)和模块边界。
(2)制定短中长期产品/技术路线图(兼容性、性能、可用性目标)。
2、方案拆解与技术评审
将高层目标拆解成可执行任务、里程碑与验收标准;组织跨团队评审并追踪实现情况。
3、性能与可观测性策略
定义关键性能指标(KPI)与观测点(metrics/tracing/perf counters),指导性能调优与瓶颈定位流程。
4、生态适配 & 兼容策略
制定对 PyTorch/TensorFlow/ONNX/Ollama 的适配方案与兼容测试矩阵,确定兼容层的 API&ABI 策略(如是否支持 CUDA-ABI shim)。
5、跨团队协调
与 FPGA/RTL 团队、驱动组、应用工程、产品经理、客户/合作方沟通,保障接口、时间线和验收一致。
6、质量保证 & 发布治理
定义 CI/CD 策略、回归测试、release checklist、以及灰度/回滚流程。
7、技术领导
指导开发人员技术实现、code review、设计指导;参与关键模块编码或原型实现(hands-on)。
8、客户/方案支持
支持客户集成、性能调优、问题定位;编写架构文档与方案白皮书。
任职要求(必须)
1、8 年在系统软件、驱动、或深度学习框架相关的工程/架构经验。
2、精通 Linux 内核与 PCIe 设备驱动开发(至少参与过内核模块或 VFIO 相关工作)。
3、熟悉 C/C 、Python,能够读写复杂的代码库并进行性能剖析。
4、有深度学习框架适配经验(至少 PyTorch 或 TensorFlow 的 backend / custom kernel 开发)。
5、熟悉模型推理优化:量化、内核融合、batching、memory planning。
6、有跨团队技术协调与项目管理经验,能拆解并推动落地复杂技术方案。
加分项
1、有 FPGA/ASIC、HW/SW co-design 或固件经验。
2、熟悉 OnNX Runtime、TFRT、Torchscript、NCCL 等生态。
3、有 LLM/transformer 推理优化经验(kv-cache、attention kernels)。
4、有云厂商/用户侧部署经验(K8s、operator、multi-tenant)。
求职提醒:求职过程请勿缴纳费用,谨防诈骗!若信息不实请举报。