到岗时间:不限
婚况要求:不限
多模态大模型算法工程师(产品创新团队)
【关于角色】
多模态大模型是具身智能机器人理解物理世界的"大脑核心"。作为多模态大模型算法工程师,你将负责研发和优化能够同时理解视觉、语言、音频等多种模态信息的大规模模型,赋予机器人与人类自然交互并理解复杂场景的能力。你的工作将直接决定机器人在开放世界中的语义理解深度与交互智能水平。解决用户看不见的技术问题,让用户可感知到的是扎实技术带来的流畅自然体验。
【核心责任】
- 研究并实现多模态大模型(VLM)在机器人场景下的适配与优化
- 设计多模态数据处理与对齐策略,构建高质量视觉-语言-行动训练数据集
- 主导多模态模型的预训练、指令微调(SFT)与偏好对齐(RLHF/DPO)流程
- 优化大模型在边缘设备上的推理效率,探索量化、蒸馏、稀疏化等压缩方案
- 设计多模态理解的评估体系,建立完善的模型能力基准与迭代闭环
- 与机器人感知、规划、控制团队协作,将多模态理解能力融入端到端系统
【基础要求】
- 扎实的深度学习基础,深入理解Transformer架构及其在视觉、语言领域的应用
- 精通Python和PyTorch,有大规模模型训练(10B 参数)的实际经验
- 熟悉主流多模态基础模型(LLaVA、CLIP、BLIP2、Flamingo等)的架构与训练方法
- 有完整的多模态模型训练流程经验:数据工程、分布式训练、RLHF/DPO对齐
- 熟悉大模型推理优化技术(vLLM、TensorRT-LLM、量化等)
- 良好的实验设计与分析能力,能够高效定位模型性能瓶颈并推动改进
【更好】
- 有具身智能或机器人操控相关多模态模型(如RT-2、OpenVLA)研究经验
- 熟悉视频理解、时序建模或3D场景理解方向
- 有大规模多模态数据集构建与标注流程设计经验
- 在***学术会议(NeurIPS、ICML、ICLR、CVPR、ACL等)发表过相关论文
- 有开源多模态项目贡献经验
求职提醒:求职过程请勿缴纳费用,谨防诈骗!若信息不实请举报。