أخبار نيكسا روب/التقرير والدراسات

كيف يحسن الرؤية المجسمة التحكم في الإنسان الآلي؟ إطار عمل EATR-Stereo الجديد

يحسن إطار العمل الجديد EATR-Stereo، الذي طوره فريق بحثي من جامعة بكين، التحكم في الإنسان الآلي في المهام طويلة الأجل من خلال نقل ذكي للبيانات من كاميرتين مثبتتين على الرأس. في الاختبارات التي أجريت على روبوت مادي، حقق نجاحًا بنسبة 60٪ في المهمة الكاملة ونجاحًا بنسبة 80٪ مع وجود إعاقة غير متماثلة قوية - مما يعني

في هذه الصفحة

كيف يحل EATR-Stereo مشكلة الرؤية المجسمة لدى الإنسان الآلي؟

غالبًا ما تفقد الأنظمة المرئية العادية في الروبوتات القيم من العرض الثاني أو تدمج كلا الصورتين دون مراعاة دورهما في سياق المعالجة الرئيسية. يقدم EATR-Stereo نهجًا مبتكرًا: فهو يحافظ على الرموز المرئية الأساسية من كاميرا واحدة، مع إنشاء رموز مساعدة بناءً على العرض الثاني - والمعروفة باسم الرموز المساعدة للعرض المتقاطع (CVAT). لا تتم إضافة هذه البيانات الإضافية ببساطة، ولكن يتم نقلها بطريقة واعية، مع مراعاة تكوين جسم الروبوت. وهذا يسمح بفهم أفضل للمساحة وتحكم أكثر دقة في الحركات.

يكمن مفتاح هذا النهج ليس فقط في تحليل الصورة، ولكن أيضًا في دمج البيانات الاستقبالية - معلومات حول حالة جسم الروبوت. يستخدم إطار العمل ترميزًا مقسمًا إلى أجزاء الجسم، والذي يضبط الطريقة التي يتم بها استخدام البيانات الإضافية اعتمادًا على الموضع الحالي وتاريخ الحركة. وهذا يسمح للروبوت بمعاملة جميع المواقف بشكل مختلف ومعالجة المعلومات بطريقة أكثر طبيعية وقابلة للتكيف.

الاختبارات على الإنسان الآلي المادي: الكفاءة في الظروف الواقعية

تم إجراء الدراسات على إنسان آلي مادي بـ 33 درجة من الحرية و 37 حالة استقبالية، مع تنفيذ مهام مثل

كان أحد الاختبارات المهمة هو الوضع الذي توجد فيه إعاقة غير متماثلة قوية، حيث لم تتمكن كاميرا واحدة من رؤية الكائن. في هذه الظروف، حسّن EATR-Stereo القدرة على الاسترداد إلى 80٪، بينما حققت طريقة CVAT بمفردها 30٪ فقط. وهذا يدل على أن النقل الذكي للبيانات من العرض الثاني له تأثير حقيقي على استقرار الأداء في الظروف الصعبة.

لماذا يعتبر الحفاظ على الرموز الأساسية والتوجيه الاستقبالي أمرًا بالغ الأهمية؟

أظهرت دراسات الاستئصال أن ليست كل عناصر الإطار بنفس الأهمية. على وجه الخصوص، تبين أن الحفاظ على الرموز المرئية الأساسية أمر بالغ الأهمية - لأن فقدانها يؤدي إلى فقدان السياق المكاني. كما اتضح أن الجمع بين الميزات متعددة الرؤى مع التوجيه الهيكلي القائم على البيانات الحسية الحركية أمر ضروري للكفاءة.

هذا يعني أن EATR-Stereo ليس مجرد معالجة إضافية للصور. إنه نظام يفهم متى وكيف يستخدم المعلومات من العرض الثاني - اعتمادًا على مكان وجود الروبوت، وكيف يتحرك، وما هي القيود المادية التي يواجهها. هذا النهج مهم للتحكم طويل الأجل، حيث تتراكم الأخطاء بشكل أسرع مما هو الحال في المهام القصيرة.

الأهمية والقيود: ماذا يعني ذلك لمستقبل الروبوتات؟

يوضح EATR-Stereo أن تطوير الأنظمة البصرية اللغوية للروبوتات الشبيهة بالبشر لا يقتصر على مجرد وجود المزيد من البيانات، بل يتعلق بمعالجتها بذكاء. يجب أن يأخذ تدفق المعلومات في الاعتبار القيود المادية للروبوت والسياق المكاني.

ومع ذلك، يجدر التأكيد على أن النتائج تتعلق بنموذج اختبار معين - وهو روبوت بشري يمتلك 33 درجة من الحرية. لا توجد معلومات حول قابلية التوسع لتطبيقها على أنواع أخرى. من الروبوتات. ولا عن الأداء في الوقت الفعلي. بالإضافة إلى ذلك، لم يتم تطبيق الإطار بعد في الأنظمة التجارية ولم يتم التحقق منه من خلال دراسات مستقلة. تكمن قيمته في إظهار نهج جديد لدمج البيانات الحسية، والذي يمكن استخدامه في الحلول المستقبلية.

سياق إضافي

الصفحات ذات الصلة من NexaRob

الحلول والتقنيات والمواد الخاصة بـ NexaRob المرتبطة بموضوع هذه المقالة.

شارك المادة
العربيةAR