到岗时间:不限
婚况要求:不限
岗位职责
61具身智能模型优化:负责具身智能核心算法(VLA、大型视觉语言模型、语音模型、感知模型)在边缘端(如NVIDIA Jetson Orin)的部署与加速。主导模型从训练态到推理态的转化,解决 大模型上机 的显存与算力瓶颈。
61深度量化与压缩实战:针对不同架构模型制定差异化压缩策略。针对Transformer类(VLA/VLM)模型,负责FP8/INT4/INT8混合精度量化,优化KV Cache显存占用,解决量化后的精度对齐与长文本推理稳定性问题;针对CNN类(感知/识别)模型,实施通道剪枝与定点量化,确保在极低算力消耗下保持高识别率。
61高性能推理引擎开发:基于TensorRT、ONNX Runtime构建高性能推理引擎。利用Python接口进行模型转换与优化,解决复杂算子不支持问题,实现多模型(视觉 语音 动作)并发推理的流水线并行。
61工程化落地与LeRobot应用:利用LeRobot等框架快速验证算法可行性,并将其转化为高性能Python生产代码。设计低延迟、高吞吐的推理服务架构,确保多模态交互(ASR/TTS)的实时性与动作控制的平滑性。
61全链路性能调优:负责从传感器数据采集、预处理、模型推理到后处理的全链路性能剖析(Profiling),定位并消除系统瓶颈,确保端到端延迟满足实时控制要求。
任职要求
61学历背景:计算机、电子工程、自动化等相关专业,本科3年以上或硕士1年以上相关工作经验。
61量化专家级能力:精通模型量化技术,深入理解PTQ(训练后量化)与QAT(量化感知训练)原理。有Transformer(LLM/VLM)与CNN混合架构的量化实战经验,能独立解决量化掉点、算子不支持等棘手问题。熟悉SmoothQuant、AWQ、GPTQ等主流量化算法者优先。
61部署加速实战:精通TensorRT或ONNX Runtime,具备深厚的模型优化功底,能熟练使用各类量化工具链。熟悉模型在嵌入式GPU(Jetson系列)上的显存管理、带宽优化及功耗控制。
61工程化与框架:精通PyTorch模型导出ONNX及TensorRT的全流程,熟悉动态Shape处理。具备极强的Python工程能力,代码逻辑严密,熟悉多线程/多进程编程及异步IO,能编写高质量、可维护的生产级代码。了解LeRobot等开源框架,能快速理解其数据流与模型接口。
61加分项:有Qwen、Llama等大模型在端侧部署经验;熟悉ASR/TTS模型的流式推理优化;在GitHub上有高星量化库或推理框架开源项目。
核心关键词:模型量化 | TensorRT/ONNX加速 | VLA/VLM部署 | Python工程化 | LeRobot | 边缘计算
求职提醒:求职过程请勿缴纳费用,谨防诈骗!若信息不实请举报。