حلقة مغلقة على مستوى التعليمات البرمجية - فلسفة جديدة في مجال الروبوتات
تعتمد العديد من الأنظمة الروبوتية الحديثة على نماذج لغوية-مرئية (VLM) التي تولد قرارات التحكم. تقليديًا، لكي تعمل هذه النماذج في الممارسة العملية، يجب تعديلها لتناسب مهمة معينة - وهي عملية تُعرف باسم الضبط الدقيق. يتطلب ذلك مجموعات بيانات كبيرة ووقتًا طويلاً. يتبع VLCP مسارًا مختلفًا: بدلاً من تعديل النموذج، فإنه يبقيه دون تغيير ويستخدمه لإنشاء وظيفة تحكم بلغة Python. والأهم من ذلك أنه لا يحتاج إلى أمثلة أو تدخل في التدريب.
الابتكار الرئيسي هو إغلاق حلقة التحكم على مستوى التعليمات البرمجية نفسها، وليس على مستوى القرار أو المهمة الفرعية. عندما يرتكب الروبوت خطأ - على سبيل المثال، إذا لم يتمكن من الإمساك بجسم ما - لا يختار النظام مهمة جديدة أو يعيد نفس الوظيفة. بدلاً من ذلك، كل بضع خطوات، يقوم النموذج بتحليل المشهد مرة أخرى من وجهات نظر متعددة ويعيد كتابة التعليمات البرمجية التي فشلت للتو. وهذا يسمح بتصحيح الخطأ أثناء حلقة واحدة، قبل أن يصبح لا رجعة فيه.
الكفاءة: عشرة أضعاف عدد النجاحات مقارنة بالأساليب التقليدية
أظهرت الأبحاث التي أجريت على مجموعة مهام MuJoCo/RoboVerse، والتي تتضمن 57 مهمة تلاعب مختلفة، زيادة كبيرة في الكفاءة. حقق نظام VLCP نتيجة أفضل بكثير من نظام مماثل يعمل في الوضع المفتوح (باستخدام استعلام واحد لكل حلقة). هذا الاختلاف ليس عشوائيًا - لا تتداخل فترات الثقة حتى للعائلات الفرعية الفردية.
يعود التحسن الرئيسي إلى تحسين الأخطاء داخل الحلقة. أظهرت الدراسة أن النظام قادر على استعادة بعض حالات الإمساك غير الناجحة - أي الحالات التي تعتبرها الأنظمة المفتوحة التقليدية نهاية للحلقة. عندما لا يتمكن الروبوت من الإمساك بجسم ما، فإن VLCP لا يستجيب على مستوى القرار، بل يعيد كتابة التعليمات البرمجية التي قد تعمل بشكل صحيح في الوضع الجديد.
الكفاءة الحسابية: تكلفة منخفضة وكفاءة عالية
على الرغم من وظيفة إعادة التخطيط المتقدمة، فإن VLCP لا يمثل عبئًا حسابيًا. تُظهر الدراسة أن يتم توجيه جزء كبير من الرموز المدخلة إلى ذاكرة التخزين المؤقت (cache)، مما يقلل بشكل كبير من وقت الاستجابة. لكل حلقة، يكفي حوالي 10 استعلامات قصيرة - وهو ما لا يزيد عن المطلوب لمعالجة كاملة واحدة.
بالإضافة إلى ذلك، يتم تخزين وظائف التحقق التي تم إنشاؤها أثناء إعادة التخطيط في مكتبة المهارات المستخدمة في الحلقات اللاحقة. وهذا يعني أن النظام لا يتحسن فحسب أثناء التشغيل، بل يتعلم أيضًا من تجربته الخاصة - مما قد يؤدي إلى تطوير طويل الأجل للكفاءات دون الحاجة إلى تدريب جديد.
الحدود والأهمية لمستقبل الروبوتات
نتائج VLCP واعدة، ولكن يجب أن نتذكر أنها تحققت في المحاكاة - على منصة MuJoCo/RoboVerse. وهذا يعني أنه لا يوجد حتى الآن تأكيد لعملها في العالم الحقيقي مع الروبوتات المادية والضوضاء الحسية. ومن الجدير بالذكر أيضًا أن النظام يعمل فقط في حالة المهام التي يمكن وصفها كوظائف Python قصيرة - مما يحد من استخدامه لأنواع معينة من عمليات المعالجة.
ومع ذلك، فإن أهمية هذا العمل هائلة. إنه يدل على أن الروبوتات لا تستطيع فقط أداء المهام، ولكن أيضًا تحليل وتحسين التعليمات البرمجية الخاصة بها في الوقت الفعلي. هذا هو خطوة نحو الأنظمة المستقلة التي لا تقتصر على الإجراءات المبرمجة مسبقًا، ولكن يمكنها التكيف على مستوى التحكم نفسه.


