NexaRob 新闻/报告和研究

如何通过单个示例让语言-视觉模型教会机器人进行抽象规划

新的 PDDL-ART 方法使机器人能够从单个演示和自然语言描述中自动创建详细的操作计划。研究表明,该系统在困难的任务中达到了 93.3% 的成功率--比基本的语言-视觉模型高出 15 个百分点。关键在于它能够自主地利用工具。

在本页上

PDDL-ART 方法使机器人能够根据单个演示和自然语言描述自动创建详细的操作计划。研究表明,该方法在需要抽象推理和记忆的困难任务中具有很高的有效性,这归功于它能够自主地利用内部 VLM 工具。

一个无法在没有抽象的情况下解决的任务

许多现实环境中的操作任务--从发动机维护到食物准备--都需要长期规划和记忆。仅基于图像运行的机器人通常会失去上下文:它们不理解“移动按钮”意味着什么,因为当按钮在操作后看起来与之前相同。这正是符号机器人面临的关键挑战--需要对状态和动作进行抽象描述,而这些状态和动作不能直接从图像中看到。

PDDL-ART 通过将语言-视觉模型与正式的规划方法相结合来解决这个问题。与其仅学习视觉数据,不如利用 VLM 的“思考”能力--例如,计算物体之间的距离或分析操作顺序--从而使它能够理解在照片中不可见的关联。

PDDL-ART 如何通过单个示例进行学习

PDDL-ART 以自主方式运行:它接收一个运动演示、自然语言中的任务描述以及可用高级动作的列表。在此基础上,它生成完整的 PDDL 域描述--即规则、状态和操作的集合--这些可以由符号规划器使用。关键在于,它不需要任何模板或模型调整--该系统会自行发现任务结构。

这个过程不会在代码生成时结束。PDDL-ART 启动了一个多阶段校正过程:首先检查语法正确性,然后是语义(计划是否有意义),最后是执行性--机器人是否可以在现实中执行它。在最后一个阶段,该系统使用内部 VLM 工具来解决几何和时间问题,这些问题无法从图像中看到。

有效性:在困难任务中,93.3% 的成功率

在复杂任务(包括家庭环境和发动机维修)中进行的研究表明,PDDL-ART的平均成功率达到93.3%。这意味着在十个案例中的九个以上,机器人都能正确完成任务。与仅达到78.3%的基本VLM规划器相比,这种差异是显著的,并显示出真正的进步。

特别是,该系统能够处理需要记忆的任务--例如记住物品放置的位置--以及进行抽象推理,即当最终状态在视觉上与初始状态不同时。这表明PDDL-ART不仅“看”,而且还“理解”任务的上下文和目标。

这对机器人的未来意味着什么?

PDDL-ART不是一个可以直接部署的产品,但它展示了一种新方法的潜力:将语言-视觉模型与形式化的符号规划相结合。如果这些系统得到发展,机器人可以学习复杂的任务,而无需手动编程每个动作。

然而,存在一些限制:该方法在受控环境中工作,并且需要访问高性能的VLM。在实践中,这可能意味着需要强大的计算能力或连接到云端。此外,该系统无法确认其计划在现实世界中是否安全--例如,它不会导致硬件损坏。

PDDL-ART为工业、医疗和家庭领域的机器人技术开辟了新的可能性。由于能够从单个演示中自动生成计划,该系统可以大大缩短部署新流程所需的时间。在生产线变更频繁的工厂中,机器人可以快速适应新任务,而无需手动编程。在家中,这些解决方案可以帮助老年人或残疾人在日常活动中,例如准备食物或整理房间。虽然该系统目前在受控环境中运行,但其概念可以扩展到更灵活和独立于基础设施的解决方案。

重要的是,未来的版本还应考虑安全性和伦理方面--例如,防止硬件损坏或避免可能对人类造成危险的行为。PDDL-ART不仅解决了抽象规划问题,而且将其转化为实际应用,这些应用可能会改变机器人与人类互动的方式。

更多背景信息

相关NexaRob页面

与本文主题相关的NexaRob解决方案、技术和材料。

分享内容
简体中文ZH-CN