Noticias de NexaRob/Informe e investigación

¿Cómo pueden los robots mejorar de forma autónoma su código de control durante el funcionamiento?

El nuevo método VLCP permite a los robots mejorar de forma autónoma su código de control mientras realizan una tarea, sin necesidad de ajustar el modelo, sin ejemplos y sin cambiar el objetivo. En las pruebas realizadas en 57 tareas, ha logrado una eficacia significativamente mayor que el enfoque tradicional abierto. La clave es cerrar el bucle de control no a nivel de decisión,

En esta página

Bucle cerrado a nivel de código: una nueva filosofía para la robótica

Muchos sistemas robóticos modernos se basan en modelos de lenguaje y visión (VLM) que generan decisiones de control. Tradicionalmente, para que estos modelos funcionen en la práctica, es necesario ajustarlos a una tarea específica, un proceso conocido como ajuste fino. Esto requiere grandes conjuntos de datos y tiempo. VLCP sigue otro camino: en lugar de modificar el modelo, lo deja sin cambios (congelado) y lo utiliza para generar una función de control en Python. Lo importante es que no necesita ejemplos ni interrupción del entrenamiento.

La innovación clave es cerrar el bucle de control a nivel del propio código, y no a nivel de la decisión o sub-tarea. Cuando un robot comete un error (por ejemplo, no agarra un objeto), el sistema no elige una nueva tarea ni repite la misma función. En cambio, cada pocos pasos, el modelo vuelve a analizar la escena desde múltiples perspectivas y reescribe el código de control que acaba de fallar. Esto permite corregir el error durante un solo episodio, antes de que se vuelva irreversible.

Eficacia: diez veces más éxitos que el enfoque tradicional

Las investigaciones realizadas en un conjunto de tareas MuJoCo/RoboVerse, que incluye 57 actividades de manipulación diferentes, han demostrado un aumento drástico de la eficacia. El sistema VLCP ha logrado un resultado significativamente mejor que un sistema idéntico que funciona en modo abierto (con una sola consulta por episodio). Esta diferencia no es casual: los intervalos de confianza ni siquiera se superponen para las familias de escenas individuales.

La principal mejora se debe a la corrección intra-episodio de los errores. El estudio ha demostrado que el sistema puede recuperar parte de los casos de agarre fallidos, es decir, aquellas situaciones que los sistemas abiertos tradicionales consideran como el final del episodio. Cuando un robot no agarra un objeto, VLCP no reacciona a nivel de decisión, sino que reescribe el código de control, que puede funcionar correctamente en la nueva situación.

Eficiencia computacional: bajo coste y alto rendimiento

A pesar de su avanzada función de replanificación, VLCP no supone una carga computacional. El estudio muestra que una gran parte de los tokens de entrada se almacenan en la memoria caché, lo que reduce significativamente el tiempo de respuesta. Para un episodio, son suficientes unas 10 consultas cortas, no más de las necesarias para un procesamiento completo.

Además, las funciones de control generadas durante la replanificación se almacenan en una biblioteca de habilidades que se utiliza en episodios posteriores. Esto significa que el sistema no solo mejora a medida que funciona, sino que también aprende de su propia experiencia, lo que puede conducir a un desarrollo a largo plazo de las competencias sin necesidad de un nuevo entrenamiento.

Límites e importancia para el futuro de la robótica

Los resultados de VLCP son prometedores, pero es importante recordar que se obtuvieron en una simulación, en la plataforma MuJoCo/RoboVerse. Esto significa que aún no hay confirmación de su funcionamiento en el mundo real con robots físicos y ruido sensorial. También vale la pena destacar que el sistema solo funciona para tareas que se pueden describir como funciones cortas de Python, lo que limita su aplicación a tipos específicos de manipulación.

Sin embargo, la importancia de este trabajo es enorme. Demuestra que los robots no solo pueden realizar tareas, sino también analizar y mejorar su propio código en tiempo real. Esto es un paso hacia sistemas autónomos que no están limitados a acciones preprogramadas, sino que pueden adaptarse a nivel del control mismo.

Transparencia editorial

Fuentes y materiales de referencia

El artículo fue elaborado por NexaRob basándose en el análisis de los materiales fuente disponibles. Los siguientes materiales se utilizaron para verificar la información y ampliar el contexto.

1fuente del material
1original
1mostrado públicamente
  1. Fuente originalInvestigaciónVerificación de información

    VLCP: Política de control de visión y lenguaje para la replanificación en bucle cerrado del código para la manipulación robótica

    arXiv - )arxiv.org
    Abrir fuente

¿Cómo leer esta sección? Las fuentes son materiales utilizados durante la investigación y la verificación. El artículo es un trabajo original de NexaRob, no una reimpresión de las publicaciones indicadas.

Compartir material
Ir a las fuentes
EspañolES