到岗时间:不限
婚况要求:不限
岗位职责:
1.研发基于深度强化学习的机器人操作技能训练算法(PPO/SAC/TD3/PPX);
2.设计双臂协调、灵巧手操作等复杂任务的RL训练框架与奖励函数;
3.构建从仿真到真机(sim-to-real)的迁移流水线,包括Domain Randomization;
4.优化RL训练效率,包括样本效率提升、分布式rollout、GPU利用率优化;
5.与预训练团队协作,设计从预训练模型到RL精调的衔接方案;
6.研究如何将模仿学习与强化学习结合(IL RL),提升策略泛化能力。
任职资格:
1.具备头部高校计算机/机器人/强化学习/机器学习等相关专业硕士及以上学历
2.2年以上深度强化学习算法研发相关经验;
3.扎实的强化学习基础(PPO、GRPO、SAC、TD-MPC等),有真实机器人RL部署经验者优先;
4.熟悉模仿学习算法(ACT、Diffusion Policy、BC-Z等)并有落地经验;
5.有高度的安全意识,深刻理解真实机器人训练风险。
求职提醒:求职过程请勿缴纳费用,谨防诈骗!若信息不实请举报。