Aktualności NexaRob/Raport i badania

Jak stereoskopowe widzenie poprawia kontrolę humanoidów? Nowy framework EATR-Stereo

Nowy framework EATR-Stereo, opracowany przez zespół badawczy z Uniwersytetu Pekinu, poprawia kontrolę humanoidów w zadaniach długoterminowych dzięki inteligentnemu przekazywaniu danych z dwóch kamer montowanych na głowie. W testach na fizycznym robocie osiągnął 60% sukcesu w pełnym zadaniu i 80% skuteczności przy silnej asymetrycznej zasłonięciu - co oznacza

Na tej stronie

Jak EATR-Stereo rozwiązuje problem widzenia stereo u humanoidów?

Zwykłe systemy wizyjne w robotach często tracą wartości z drugiego widoku lub łączą oba obrazy bez uwzględnienia ich roli w kontekście głównego przetwarzania. EATR-Stereo wprowadza innowacyjny podejście: zachowuje podstawowe tokenu wizyjne z jednej kamery, jednocześnie tworząc pomocnicze tokeny na podstawie drugiego widoku - tak zwane Cross-View Auxiliary Tokens (CVAT). Te dodatkowe dane nie są po prostu dodawane, ale przekazywane w sposób świadomy, uwzględniający konfigurację ciała robota. To pozwala na lepsze zrozumienie przestrzeni i dokładniejszą kontrolę ruchów.

Kluczem do tego podejścia jest nie tylko analiza obrazu, ale także integracja danych proprioceptywnych - informacji o stanie ciała robota. Framework wykorzystuje kodowanie podzielone na segmenty ciała, które dostosowują sposób, w jaki dodatkowe dane są używane w zależności od aktualnej pozycji i historii ruchu. Dzięki temu robot nie traktuje wszystkich sytuacji jako identycznych, a przetwarza informacje w sposób bardziej naturalny i adaptacyjny.

Testy na fizycznym humanoidzie: efektywność w warunkach rzeczywistych

Badania przeprowadzono na fizycznym humanoidzie o 33 stopniach swobody i 37 stanach proprioceptywnych, wykonując zadania typu „poszukaj, podejdź, złap, połóż, wróć” trwające ponad 100 sekund. W tych warunkach EATR-Stereo osiągnął 60,0% sukcesu w pełnym zadaniu i 100,0% sukcesu przy chwyceniu przedmiotu - co wskazuje na wysoką precyzję w kluczowych etapach działania.

Ważnym testem była sytuacja z silną asymetryczną zasłonięciem, gdzie jedna kamera nie mogła zobaczyć obiektu. W takich warunkach EATR-Stereo poprawił zdolność do odzyskania do 80%, podczas gdy metoda CVAT samodzielnie osiągnęła tylko 30%. To pokazuje, że inteligentne przekazywanie danych z drugiego widoku ma realny wpływ na stabilność działania w trudnych warunkach.

Dlaczego zachowanie podstawowych tokenów i routing proprioceptywny są kluczowe?

Badania ablacji wykazały, że nie wszystkie elementy frameworku są równie ważne. W szczególności okazało się, że zachowanie podstawowych tokenu wizyjnych jest istotne - ich utrata prowadzi do utraty kontekstu przestrzennego. Również połączenie cech międzywidokowych z routingiem strukturalnym opartym na danych proprioceptywnych okazało się kluczowe dla efektywności.

To oznacza, że EATR-Stereo nie jest tylko dodatkowym przetwarzaniem obrazu. To system, który rozumie, kiedy i jak użyć informacji z drugiego widoku - w zależności od tego, gdzie się znajduje robot, jak się porusza i jakie ma ograniczenia fizyczne. Takie podejście jest istotne dla długoterminowej kontroli, gdzie błędy akumulują się szybciej niż w krótkich zadaniach.

Znaczenie i ograniczenia: co to oznacza dla przyszłości robotyki?

EATR-Stereo pokazuje, że rozwój systemów wizualno-językowych dla humanoidów nie polega tylko na większej ilości danych, ale na ich inteligentnym przetwarzaniu. Przepływ informacji musi uwzględniać zarówno fizyczne ograniczenia robota, jak i kontekst przestrzenny.

Jednak warto podkreślić, że wyniki dotyczą jednego konkretnego modelu testowego - humanoida o 33 stopniach swobody. Nie ma informacji o skalowalności do innych typów robotów ani o wydajności w czasie rzeczywistym. Dodatkowo, framework nie jest jeszcze wdrożony w komercyjnych systemach i nie został zweryfikowany przez niezależne badania. Jego wartość leży w pokazaniu nowego podejścia do integracji danych sensorycznych, które może być wykorzystane w przyszłych rozwiązaniach.

Dalszy kontekst

Powiązane strony NexaRob

Rozwiązania, technologie i materiały NexaRob powiązane z tematyką tego artykułu.

Udostępnij materiał
PolskiPL