不再需要地图--只需图像和智能
许多用于机器人的自主导航系统依赖于精确的地图或深度传感器,这限制了它们在不可预测环境中的应用。亚马逊科学团队开发了一种新的方法,消除了这种依赖性--它完全基于来自单个 RGB 摄像头的图像数据。这意味着机器人可以在没有预先准备好的地图的情况下移动并进行检查,从而为物流、基础设施监控或救援工作开辟了新的可能性。
这个解决方案的关键不仅在于图像,还在于如何解释图像。与其向机器人提供完整的目标图像,不如让系统根据来自摄像机的视频流不断更新目标的表示形式。这使得它能够更好地适应低质量的检测或与物体的距离--即使最初看不到目标,机器人也可以在移动时“完善”它。
在此方法中,该团队引入了基于视频流中对象检测的实时目标反射。每一帧都会更新目标的表示形式,从而可以平滑地适应不断变化的环境并提高对检测干扰的抵抗力。
阶段与控制:机器人如何理解何时停止
该系统将导航过程分为两个阶段--长距离方法和近距离轨道检查。每个阶段都有自己的目标,并且需要不同的控制策略。长距离需要稳定的方向,而近距离检查则需要精确地将物体保持在视野中心。为了实现这一点,该团队设计了一种具有分离控件的策略结构,它使用相同的基本导航架构,但针对每个阶段的特定需求进行了调整。
这使得可以在不完全重新配置的情况下平滑地过渡到不同的阶段。在测试中,该系统在较大的视角下表现出特别好的效果,这意味着机器人可以从侧面或以较大角度接近目标--这是传统方法经常失败的情况。
将相位分离可以优化控制:在长距离阶段,机器人专注于运动方向和稳定性;在近距离阶段,它专注于精确的定位并使目标保持在图像中心。
无需深度信息即可停止:视觉机制的工作原理
放大图像关闭放大上一张图片无地图导航的最大挑战之一不仅是找到目标,而且还要准确地停止。许多系统依赖于深度传感器,这些传感器价格昂贵且容易受到干扰。新的停止机制完全基于视觉:它分析检测矩形(bbox)与整个图像区域的比例,并应用平滑的时间处理,以消除由机器人运动引起的抖动。
此外,该系统使用视觉伺服控制回路,即使在不稳定运动或相机因移动而产生的抖动期间,也能使目标保持在图像中心。这使得能够在距离目标 1.0-1.2 米的范围内实现稳定的停止 - 这对于精确检查至关重要。
此机制不需要测量深度或额外的传感器。相反,它使用图像比例的动态变化作为停止信号,从而确保稳定性和结果的可重复性。
测试和通用性:不受架构限制的有效性
在所有情况下,该系统都实现了很高的最终效率。为了验证其与特定模型的独立性,还对两种不同的架构(ViNT 和 NoMaD)进行了测试 - 没有进行任何修改。结果证实了这种方法是通用的,可以应用于各种导航系统中。
这意味着该技术不限于特定的机器人模型或算法 - 它可以部署到现有或未来的解决方案中。然而,缺乏来自实际环境而非测试场景的数据仍然是一个限制,这意味着在极端条件下(例如雨水、雾)的有效性尚未得到证实。
研究表明,该系统在简单的轨迹和较大的视角下都能稳定运行 - 这对于在难以到达的区域中的应用至关重要。
意义与未来:从测试到实践
新的方法表明,在恶劣条件下进行自主导航不必依赖于复杂的传感器系统。基于视觉的方法,结合动态目标反射和深度相位分离,可能是开发用于工业、物流或救援等领域机器人的关键 - 在这些领域中,无法准备地图或安装额外的传感器。
虽然该系统被展示为一个研究演示,但其应用可以扩展到实际场景。然而,缺乏关于在现实条件下部署或进行长期测试的数据仍然留下了一些关于耐用性和时间稳定性方面的问题。
未来,可以将这种方法扩展到更复杂的场景中,例如多个机器人的协作或与物流管理系统的集成。



