机器人技术中低可预测性任务的问题
在机器人步态的强化学习中,有一系列无法达到收敛的任务--即使经过长时间的训练也是如此。原因通常是早期终止探索轨迹:大多数尝试在获得有用的梯度信号之前就结束了。这些被称为“狭窄可行性”的任务,对于标准算法来说尤其难以掌握。研究人员发现问题不在于缺乏奖励,而在于系统的物理和动态限制,这使得长时间的探索变得不可能。
特别是,“从四足行走过渡到手撑状态”这样的任务是这类任务的一个例子。在这些情况下,即使是最先进的模型也无法学习,因为大多数尝试都以跌倒或超出稳定性范围结束,并且没有获得任何学习信号。
动态执行器课程作为解决方案
一种名为“执行器动力学课程”的新方法是在训练过程中逐渐降低关节的刚度。最初设置较高的刚度--这会导致高于临界阻尼的较高自然频率反馈--从而在马尔可夫决策过程中增加了任务的可预测性区域。随着情节变得更长,刚度会逐渐降低到系统识别的值。
研究人员使用一个旋转木马(cart-pole)系统作为代表性示例,并表明这种策略扩大了“单调化核”--即可以执行该任务的状态空间的一部分。这使得可以在不提前终止轨迹的情况下进行更长时间的探索。
放大图像关闭放大上一张图片在波士顿动力公司的Spot机器人上进行验证
该方法应用于波士顿动力公司的Spot机器人的一个困难任务,即从四足行走过渡到手撑状态。在具有固定刚度的标准训练条件下,模型只能达到很小的程度,并且从未完成过渡。通过使用动态执行器课程,对模型进行了训练,并证明了其在模拟中能够在十个不同的随机集合上执行过渡的能力。
这一结果证实,采用动态执行器课程的强化学习方法可以解决以前无法克服的问题。此外,该方法已被转移到硬件上--这表明它具有实际应用价值。
该方法的重要性和局限性
这种新方法为腿式机器人技术开辟了新的可能性,尤其是在处理高度复杂和预测性差的任务时。它表明,执行器的动态特性可以用作一种新型课程的基础--不仅作为优化参数,而且作为塑造探索空间的一种工具。
同时,该方法也有局限性:它最适用于那些问题在于轨迹过早结束而不是缺乏奖励的任务。这并不是一种通用的强化学习方法。此外,它的有效性取决于对系统动力学参数的准确识别。
这种方法的意义超越了单个任务--它为设计能够应对动态和不可预测的环境条件的机器人学习系统开辟了新的可能性。通过逐步调整执行器的动态特性,机器人可以更长时间地探索状态空间,从而更好地整合学习信号并提高训练过程中的稳定性。这在实际应用中尤其重要,因为无法模拟所有极端条件。但是,该方法也有其局限性:它最适用于那些问题在于轨迹预测性差而不是缺乏奖励或模型对学习信号的敏感度低的情况。
因此,它的应用应根据特定任务的条件进行调整,并且需要精确识别系统动力学参数。未来,可以将这一概念扩展到其他类型的机器人,例如人形机器人或具有多个自由度的机器人,从而可以实现更灵活和可靠的自主系统。在全局机器人技术的背景下,这种方法有助于实现先进的探索任务。 移动机器人 值得强调的是,动态执行器课程方法并不是解决所有自主机器人问题的方案。它的有效性仅限于那些主要障碍在于过早结束探索轨迹而不是缺乏奖励或模型对学习信号的敏感度低的任务。在实践中,这意味着该技术最适用于高度复杂和预测性差的任务,例如从运动状态到静止状态之间的过渡,这需要长时间的探索而不会失去稳定性。
腿式机器人学习中用于解决窄可行性任务的执行器动态课程



