机器人抓取的前沿到哪了?

图灵汇官网

前言

一年前我们曾讨论过Robot Learning的发展,如今经过近一年的时间,这一领域取得了许多新的进展,特别是在元学习方面。然而,今天我们专注于探讨Robot Learning中的一个具体应用——机器人抓取技术。之所以选择这一话题,是因为它代表了机器人智能当前亟需解决的关键问题之一。

家用机器人所需的核心能力

我们可以设想一下,家用机器人需要具备哪些智能?最重要的能力包括移动导航能力和机械臂的抓取能力。例如,Fetch机器人已经具备了家用机器人所需的硬件条件。然而,今天我们将重点讨论机器人抓取技术的研究前沿。

机器人抓取技术的研究现状

关于机器人抓取,有许多具体的研究问题和方法。目前,伯克利的Dex-Net 4.0系统在抓取技术上处于领先地位。不过,Dex-Net 并不是一个端到端的深度学习系统,而是一种通过神经网络进行位置估计,再结合规划策略的开环控制系统。这类系统对于静态简单的物体处理效果良好,但对于动态变化的物体则显得有些力不从心。鉴于我们更关注通用人工智能(AGI),我们将重点放在一种端到端的解决方案上,即:

端到端基于视觉的机器人抓取

我们希望整个机器人抓取过程都是机器人自主学习的结果,这非常类似于人类的行为!

关键研究团队

目前,这一领域的研究主要集中在两个团队: 1. Google Brain Robotics团队 2. 伯克利的Sergey Levine团队

此外,DeepMind、OpenAI、斯坦福大学的Li Fei-Fei团队以及卡内基梅隆大学的Abhinav Gupta团队也有一些亮点研究,但它们并没有特别专注于机器人抓取问题。实际上,Google Brain团队中的Sergey Levine也在其中,因此接下来我们将主要介绍他的研究成果。

Paper列表

以下是近期与机器人抓取技术直接相关的几篇重要论文: 1. Sadeghi, Fereshteh, et al. "Sim2real view invariant visual servoing by recurrent control." arXiv preprint arXiv:1712.07642 (2017). 2. Riedmiller, Martin, et al. "Learning by Playing-Solving Sparse Reward Tasks from Scratch." arXiv preprint arXiv:1802.10567 (2018). 3. Quillen, Deirdre, et al. "Deep Reinforcement Learning for Vision-Based Robotic Grasping: A Simulated Comparative Evaluation of Off-Policy Methods." arXiv preprint arXiv:1802.10264 (2018). 4. Haarnoja, Tuomas, et al. "Composable Deep Reinforcement Learning for Robotic Manipulation." arXiv preprint arXiv:1803.06773 (2018). 5. Fang, Kuan, et al. "Learning Task-Oriented Grasping for Tool Manipulation from Simulated Self-Supervision." arXiv preprint arXiv:1806.09266 (2018). 6. Kalashnikov, Dmitry, et al. "QT-Opt: Scalable Deep Reinforcement Learning for Vision-Based Robotic Manipulation." arXiv preprint arXiv:1806.10293 (2018). 7. Matas, Jan, Stephen James, and Andrew J. Davison. "Sim-to-Real Reinforcement Learning for Deformable Object Manipulation." arXiv preprint arXiv:1806.07851 (2018). 8. OpenAI "Learning Dexterous In-Hand Manipulation" (2018).

以上这些论文是近一年来与机器人抓取技术密切相关的研究成果。由于我更关注Sergey Levine团队的成果,可能会忽略其他一些研究。如果您有关于这一领域的优秀论文推荐,欢迎在评论区留言,非常感谢!

整体分析

本文将从整体上分析目前机器人抓取技术的研究进展,而不是详细分析每篇论文的具体内容。目前机器人抓取或整个机器人学习的核心问题集中在三个层面:算法层面、仿真到真实环境的迁移以及应用层面。

算法层面

在算法层面,我们希望深度强化学习(DRL)算法能在机器人抓取上具有更高的效率、更快的学习速度以及处理更复杂的学习任务。例如,论文[3]对多种DRL off-policy算法进行了评估;论文[6]使用其中一个算法在真实环境中进行大规模实验;论文[4]基于软Q学习增强了机器人的探索能力;论文[2]则通过辅助奖励来处理复杂任务中稀疏奖励的问题。

仿真到真实环境的迁移

仿真到真实环境的迁移是另一个关键问题。由于真实环境下的机器人实验不便且成本高昂,仿真到真实的迁移成为一种必然选择。例如,论文[1]通过多视角研究了仿真到真实环境的迁移;论文[7]则在仿真环境中研究了非刚体物体的操作;论文[3]提出了一套面向机器人抓取的仿真基准,这对研究有很大促进作用。

应用层面

在应用层面,不仅关注简单的普通机器人抓取问题,还研究更复杂的操作问题。例如,OpenAI的最新成果展示了如何通过DRL实现机械手灵巧操作方块,这虽然不直接针对抓取,但其方法论对机器人抓取问题有很强的借鉴意义。

OpenAI的最新成果

OpenAI最近的一项成果展示了使用DRL算法在仿真环境中训练机械手玩方块,并将训练好的模型成功迁移到真实环境中。这项工作的成功原因包括高度仿真的系统、仿真环境随机化以及大规模分布式并行训练。这一成果表明,DRL能够通过学习实现传统非学习算法无法做到的效果,仿真环境的重要性日益凸显,而大规模计算能够弥补样本效率低的问题。

进一步分析

尽管OpenAI的成果令人印象深刻,但它更多地体现了工程上的胜利,而非算法上的突破。同样,Google的QT-Opt算法也只是Q-Learning的一个变种,但通过进化算法CEM获取actor,使得训练更稳定,并便于大规模分布式训练。

下一步发展

预计未来将出现更多更好的仿真环境,以及更快更强的分布式学习系统。有了这些进步,即使保持现有算法不变,也能训练出比现在更强大的机器人学习成果,甚至达到商用水平。

未来研究方向

对于算法层面的发展,我们需要更复杂的任务牵引,如多机械臂协作抓取、长任务序列处理、多任务学习等。这些都需要在新的任务和基准上推动算法和技术的发展。

结论

本文对机器人抓取及机器人学习的整体研究进展进行了宽泛的分析,而非详细剖析每篇论文的具体想法。总体而言,从工业应用的角度来看,机器人抓取技术将很快实现落地,关键在于仿真系统的研发和大规模分布式学习的推进。对于学术研究来说,定义新的任务和基准是推动算法和应用发展的关键。

本文来源: 图灵汇 文章作者: 许钦说智能