Новини NexaRob/Звіт і дослідження

Як роботи можуть самостійно покращувати свій код керування під час виконання?

Новий метод VLCP дозволяє роботам самостійно покращувати свій код керування під час виконання завдання - без адаптації моделі, без прикладів і без необхідності зміни мети. У тестах на 57 завданнях він досяг значно вищої ефективності, ніж традиційний відкритий підхід. Ключем є замикання контуру управління не на рівні прийняття рішень,

На цій сторінці

Замкнутий цикл на рівні коду - нова філософія робототехніки

Багато сучасних робототехнічних систем базуються на мовних та візуальних моделях (VLM), які генерують команди керування. Традиційно, щоб такі моделі працювали на практиці, їх потрібно адаптувати до конкретного завдання - процес, відомий як fine-tuning. Це вимагає великих наборів даних і часу. VLCP йде іншим шляхом: замість того, щоб модифікувати модель, він залишає її незмінною (замороженою) і використовує для генерування функції керування мовою Python. Що важливо - їй не потрібні приклади або перешкоджання в навчанні.

Ключовою інновацією є замикання контуру управління на рівні самого коду, а не на рівні рішення або підзадачі. Коли робот робить помилку - наприклад, не захоплює об’єкт - система не вибирає нове завдання і не повторює ту саму функцію. Замість цього, через кілька кроків, модель знову аналізує сцену з багатьох точок зору та переписує код керування, який щойно не спрацював. Це дозволяє виправити помилку протягом одного епізоду, перш ніж вона стане незворотною.

Ефективність: у десять разів більше успіхів, ніж традиційний підхід

Дослідження, проведене на наборі завдань MuJoCo/RoboVerse, що включає 57 різних маніпулятивних дій, показало значне збільшення ефективності. Система VLCP досягла значно кращих результатів, ніж ідентична система, яка працювала у відкритому режимі (з одним запитом на епізод). Ця різниця не є випадковою - інтервали довіри навіть не перетинаються для окремих сімейств сцен.

Основне покращення полягає у внутрішньоепізодичному виправленні помилок. Дослідження показало, що система може відновити частину випадків невдалого захоплення - тобто тих ситуацій, які традиційні відкриті системи вважають кінцем епізоду. Коли робот не захоплює об’єкт, VLCP не реагує на рівні прийняття рішень, а переписує код керування, який може вже працювати правильно в новій ситуації.

Обчислювальна ефективність: низька вартість і висока продуктивність

Незважаючи на розширену функцію повторного планування, VLCP не є обчислювальним навантаженням. Дослідження показує, що велика частина вхідних токенів потрапляє в кеш, що значно зменшує час відповіді. На один епізод достатньо близько 10 коротких запитів - не більше, ніж потрібно для одного повного оброблення.

Крім того, контрольні функції, згенеровані під час перепланування, зберігаються в бібліотеці навичок, яка використовується в наступних епізодах. Це означає, що система не тільки покращує свої показники під час роботи, але й навчається на власному досвіді - що може призвести до довгострокового розвитку компетенцій без необхідності нового навчання.

Межі та значення для майбутнього робототехніки

Результати VLCP є багатообіцяючими, але слід пам’ятати, що їх було досягнуто в симуляції - на платформі MuJoCo/RoboVerse. Це означає, що ще немає підтвердження їхньої роботи в реальному світі з фізичними роботами та сенсорним шумом. Варто також зазначити, що система працює лише для завдань, які можна описати як короткі функції Python - що обмежує її застосування до конкретних типів маніпуляцій.

Однак значення цієї роботи є величезним. Вона показує, що роботи можуть не тільки виконувати завдання, але й аналізувати та покращувати свій власний код у реальному часі. Це крок до автономних систем, які не обмежуються попередньо запрограмованими діями, а здатні адаптуватися на рівні самого керування.

Прозорість редакції.

Джерела та довідкові матеріали.

Стаття була розроблена NexaRob на основі аналізу доступних джерел. Наступні матеріали були використані для перевірки інформації та розширення контексту.

1джерела матеріалу.
1первинні.
1публічно представлені.
  1. Первинне джерело.ДослідженняПеревірка інформації

    VLCP: Vision Language Control Policy Closed-Loop Code Replanning for Robot Manipulation

    arXiv - розділ «Робототехніка»cs.RO)arxiv.org
    Відкрити джерело.

Як читати цей розділ? Джерела - це матеріали, використані під час дослідження та верифікації. Стаття є авторською розробкою NexaRob, а не передруком зазначених публікацій.

Поділитися матеріалом
Перейти до джерел
УкраїнськаUK