Bucle cerrado a nivel de código: una nueva filosofía para la robótica
Muchos sistemas robóticos modernos se basan en modelos de lenguaje y visión (VLM) que generan decisiones de control. Tradicionalmente, para que estos modelos funcionen en la práctica, es necesario ajustarlos a una tarea específica, un proceso conocido como ajuste fino. Esto requiere grandes conjuntos de datos y tiempo. VLCP sigue otro camino: en lugar de modificar el modelo, lo deja sin cambios (congelado) y lo utiliza para generar una función de control en Python. Lo importante es que no necesita ejemplos ni interrupción del entrenamiento.
La innovación clave es cerrar el bucle de control a nivel del propio código, y no a nivel de la decisión o sub-tarea. Cuando un robot comete un error (por ejemplo, no agarra un objeto), el sistema no elige una nueva tarea ni repite la misma función. En cambio, cada pocos pasos, el modelo vuelve a analizar la escena desde múltiples perspectivas y reescribe el código de control que acaba de fallar. Esto permite corregir el error durante un solo episodio, antes de que se vuelva irreversible.
Eficacia: diez veces más éxitos que el enfoque tradicional
Las investigaciones realizadas en un conjunto de tareas MuJoCo/RoboVerse, que incluye 57 actividades de manipulación diferentes, han demostrado un aumento drástico de la eficacia. El sistema VLCP ha logrado un resultado significativamente mejor que un sistema idéntico que funciona en modo abierto (con una sola consulta por episodio). Esta diferencia no es casual: los intervalos de confianza ni siquiera se superponen para las familias de escenas individuales.
La principal mejora se debe a la corrección intra-episodio de los errores. El estudio ha demostrado que el sistema puede recuperar parte de los casos de agarre fallidos, es decir, aquellas situaciones que los sistemas abiertos tradicionales consideran como el final del episodio. Cuando un robot no agarra un objeto, VLCP no reacciona a nivel de decisión, sino que reescribe el código de control, que puede funcionar correctamente en la nueva situación.
Eficiencia computacional: bajo coste y alto rendimiento
A pesar de su avanzada función de replanificación, VLCP no supone una carga computacional. El estudio muestra que una gran parte de los tokens de entrada se almacenan en la memoria caché, lo que reduce significativamente el tiempo de respuesta. Para un episodio, son suficientes unas 10 consultas cortas, no más de las necesarias para un procesamiento completo.
Además, las funciones de control generadas durante la replanificación se almacenan en una biblioteca de habilidades que se utiliza en episodios posteriores. Esto significa que el sistema no solo mejora a medida que funciona, sino que también aprende de su propia experiencia, lo que puede conducir a un desarrollo a largo plazo de las competencias sin necesidad de un nuevo entrenamiento.
Límites e importancia para el futuro de la robótica
Los resultados de VLCP son prometedores, pero es importante recordar que se obtuvieron en una simulación, en la plataforma MuJoCo/RoboVerse. Esto significa que aún no hay confirmación de su funcionamiento en el mundo real con robots físicos y ruido sensorial. También vale la pena destacar que el sistema solo funciona para tareas que se pueden describir como funciones cortas de Python, lo que limita su aplicación a tipos específicos de manipulación.
Sin embargo, la importancia de este trabajo es enorme. Demuestra que los robots no solo pueden realizar tareas, sino también analizar y mejorar su propio código en tiempo real. Esto es un paso hacia sistemas autónomos que no están limitados a acciones preprogramadas, sino que pueden adaptarse a nivel del control mismo.



