代码层面的闭环--一种新的机器人学理念
许多现代机器人系统都依赖于语言-视觉模型 (VLM),这些模型生成控制决策。传统上,为了使这些模型在实践中起作用,需要对其进行调整以适应特定任务--这个过程被称为微调。这需要大量的数据和时间。VLCP 采用了不同的方法:它不修改模型,而是保持模型不变(冻结),并使用该模型来生成 Python 中的控制函数。重要的是,它不需要示例或训练中的干扰。
关键创新在于在代码层面而不是在决策层面或子任务层面关闭控制回路。当机器人犯错时--例如,未能抓取物体--系统不会选择新的任务或重复相同的函数。相反,每隔几个步骤,模型会重新分析来自多个角度的场景并重写刚刚失败的控制代码。这使得能够在单个周期内改进错误,然后再使其变得不可逆转。
效率:是传统方法的十倍
在 MuJoCo/RoboVerse 任务集上进行的研究,该任务集包括 57 种不同的操作活动,结果表明成功率大幅提高。VLCP 系统实现了比以相同方式运行的开放系统(每个周期一个查询)更好的结果。这种差异不是偶然的--即使对于单个场景系列,置信区间也不重叠。
主要改进在于周期内的错误修正。研究表明,该系统能够恢复部分失败的抓取情况--即传统开放系统将其视为周期结束的情况。当机器人未能抓取物体时,VLCP 不会在决策层面做出反应,而是会重写控制代码,以便它可以在新的情况下正确运行。
计算效率:低成本和高性能
尽管具有先进的重新规划功能,但 VLCP 并不是一个计算负担。 研究表明, 大部分输入令牌都进入缓存(cache),从而大大减少了响应时间。每个周期只需要大约 10 个简短的查询--这与单个完整处理所需的时间差不多。
此外,在重新规划过程中生成的控制函数存储在技能库中,并在后续的各个阶段中使用。这意味着该系统不仅可以在运行过程中不断改进,还可以从自身的经验中学习--这可能会导致长期能力发展,而无需进行新的训练。
对未来机器人技术的意义和局限性
VLCP 的结果令人鼓舞,但需要注意的是,这些结果是在模拟环境中获得的--在 MuJoCo/RoboVerse 平台上。这意味着尚未证实其在现实世界中与物理机器人和传感器噪声一起工作时的效果。同样值得强调的是,该系统仅适用于可以描述为简短 Python 函数的任务--这限制了它对特定类型操作的适用性。
然而,这项研究的重要性是巨大的。它表明,机器人不仅可以执行任务,还可以分析并实时改进自己的代码。这是 朝着 自主系统的方向迈出的重要一步,这些系统不受先前编程的操作限制,而是能够在控制层面进行自适应。



