电话:0351-7221990
关闭
具身大模型算法工程师 (后训练方向) (MJ002325) 40000-70000 收藏 申请职位 主管直聊
您当前的位置: 首页 > 职位列表 > 职位详情

具身大模型算法工程师 (后训练方向) (MJ002325)

40000-70000
上海-上海 | 2年以上经验 | 硕士学历
2026-06-10 更新 被浏览:
企业未开启查看联系方式,请直接投递简历 投递简历
职位描述
到岗时间:不限 婚况要求:不限 岗位职责: 1.研发基于深度强化学习的机器人操作技能训练算法(PPO/SAC/TD3/PPX); 2.设计双臂协调、灵巧手操作等复杂任务的RL训练框架与奖励函数; 3.构建从仿真到真机(sim-to-real)的迁移流水线,包括Domain Randomization; 4.优化RL训练效率,包括样本效率提升、分布式rollout、GPU利用率优化; 5.与预训练团队协作,设计从预训练模型到RL精调的衔接方案; 6.研究如何将模仿学习与强化学习结合(IL RL),提升策略泛化能力。 任职资格: 1.具备头部高校计算机/机器人/强化学习/机器学习等相关专业硕士及以上学历 2.2年以上深度强化学习算法研发相关经验; 3.扎实的强化学习基础(PPO、GRPO、SAC、TD-MPC等),有真实机器人RL部署经验者优先; 4.熟悉模仿学习算法(ACT、Diffusion Policy、BC-Z等)并有落地经验; 5.有高度的安全意识,深刻理解真实机器人训练风险。
求职提醒:求职过程请勿缴纳费用,谨防诈骗!若信息不实请举报。
该公司的其他职位
会员等级
  • 互联网服务
  • 10-50人
  • 500万
岗位职责: 1.研发基于深度强化学习的机器人操作技能训练算法(PPO/SAC/TD3/PPX); 2.设计双臂协调、灵巧手操作等复杂任务的RL训练框架与奖励函数; 3.构建从仿真到真机(sim-to-real)的迁移流水线,包括Domain Randomization; 4.优化RL训练效率,包括样本效率提升、分布式rollout、GPU利用率优化; 5.与预训练团队协作,设计从预训练模型到RL精调的衔接方案; 6.研究如何将模仿学习与强化学习结合(IL RL),提升策略泛化能力。 任职资格: 1.具备头部高校计算机/机器人/强化学习/机器学习等相关专业硕士及以上学历 2.2年以上深度强化学习算法研发相关经验; 3.扎实的强化学习基础(PPO、GRPO、SAC、TD-MPC等),有真实机器人RL部署经验者优先; 4.熟悉模仿学习算法(ACT、Diffusion Policy、BC-Z等)并有落地经验; 5.有高度的安全意识,深刻理解真实机器人训练风险。
分享到朋友圈
分享至朋友圈
↑微信扫上方二维码↑
生成职位海报
分享到朋友圈
竞争力分析
综合竞争力评估
问公司
对职位有疑问?快来问问吧
手机扫一扫
随时随地找工作
简历投递成功
您可以在 个人中心 - 简历管理 - 我的简历 中查看您创建的简历
您可能感兴趣的职位:
关注微信公众号
申请结果早知道
联系时请说明是在英联优聘-找工作,学技能,拓人脉,上英联优聘!上看到的
正在获取二维码...
请使用微信扫一扫
客服服务热线
0351-7221990
周一到周日 9:00-19:00
微信公众号
手机浏览

温馨提示:根据国家有关规定,用人单位不得向求职者收取抵押金及任何费用,请求职者加强自我保护意识!
Copyright © 2016-2022 All Rights Reserved 晋ICP备2021018695号

地址:中国 · 山西 · 太原 EMAIL:1020552200@qq.com

人力资源证: 1401002200248

用微信扫一扫