到岗时间:不限
婚况要求:不限
职位描述
负责构建工业级的具身智能模型训练与进化流水线,屏蔽底层算力复杂性,支撑 VLA(视觉-语言-动作)大模型及强化学习策略的规模化产出与高效部署。
高效训练流水线开发:构建一站式 MLOps 平台,支持从超大规模预训练到场景化微调的自动化编排,缩短模型从研发到上线的时间。
算力调度与分布式优化:针对 GPU 集群进行深度优化,提升异构算力利用率,保障大规模并行训练与仿真任务的稳定性与效率。
端到端模型部署工具链:研发面向机器人终端的高性能部署框架,支持 VLA 等复杂模型在异构嵌入式平台上的实时推断与轻量化。
自动化评测体系:建立物理仿真与真机表现相结合的自动化评测系统,量化模型各版本的性能边界,确保每次 周级进化 的稳定性。
任职要求
计算机、人工智能相关专业硕士/博士,具有 5 年以上 AI 训练平台或分布式系统研发经验。
深度理解 PyTorch/TensorFlow 框架及分布式训练协议,有大规模集群调度(如 K8s 深度定制)经验。
熟悉强化学习(RL)、扩散模型(Diffusion)或端到端控制算法的工程化落地流程。
具备极强的工程治理意识,能够将前沿算法快速转化为标准化的生产力工具库。
加分项
有 MLOps/DataOps平台(如MLflow, Kubeflow)从0到1建设经验。
熟悉分布式训练加速技术(如FSDP, DeepSpeed, NCCL优化)。
了解 ROS2、Protobuf、ZMQ 等机器人通信协议。
求职提醒:求职过程请勿缴纳费用,谨防诈骗!若信息不实请举报。