GPT-6 Astra steruje robotem w nieznanej kuchni

Zespół naukowców ze Stanford i Caltech opracował HomeBody – system, który pozwala humanoidalnemu robotowi Unitree G1 samodzielnie poruszać się po nieznanej kuchni, porządkować przestrzeń i wyjmować przedmioty z szuflad. Kluczowym elementem rozwiązania jest model GPT-6 Astra, który pełni funkcję „mózgu” maszyny. To kolejny dowód na to, że duże modele językowe coraz lepiej współpracują z fizycznymi robotami.

Jak HomeBody zmienia architekturę sterowania robotem

Większość dotychczasowych rozwiązań zakłada istnienie pośredniej warstwy sterującej między modelem językowym a samym robotem. HomeBody odchodzi od tego schematu. Zamiast tego wymienny model widzenia i języka (VLM, czyli vision-language model) – w tym przypadku GPT Astra – wywołuje bezpośrednio funkcje z rozszerzalnej biblioteki umiejętności.

Biblioteka umiejętności zamiast sztywnego sterowania

Owa biblioteka obejmuje podstawowe zdolności: chwytanie obiektów, poruszanie się po pomieszczeniu czy otwieranie szuflad. Dzięki takiej konstrukcji system można łatwo rozbudowywać o nowe umiejętności bez przeprojektowywania całej architektury. Model językowy sam decyduje, którą zdolność uruchomić w danym momencie.

Cyfrowy bliźniak i pamięć przestrzenna

Zanim robot zacznie działać, najpierw eksploruje pomieszczenie. Tworzy przy tym cyfrową replikę kuchni w środowisku Isaac Sim firmy Nvidia, a następnie zapisuje informacje o obiektach i ich położeniu w pamięci przestrzennej. Dzięki temu potrafi odnaleźć przedmiot nawet wtedy, gdy ten zniknie z jego pola widzenia.

Planowanie zadań i samodzielna korekta błędów

Gdy użytkownik wyda polecenie w rodzaju „posprzątaj kuchnię”, model językowy rozkłada je na kolejne kroki. Co istotne, system potrafi samodzielnie wykrywać pomyłki i korygować swoje działania w trakcie realizacji zadania. To podejście przypomina sposób, w jaki człowiek radzi sobie z nieprzewidzianymi sytuacjami – zamiast sztywnego skryptu mamy elastyczne reagowanie na bieżący stan otoczenia.

Ograniczenia, które wciąż dają o sobie znać

Choć wyniki są obiecujące, badacze nie ukrywają problemów. Wśród głównych ograniczeń wymieniają opóźnienia w działaniu modelu Astra, przegrzewające się serwomechanizmy palców robota oraz wysokie koszty obliczeniowe. Te czynniki mogą utrudniać praktyczne wdrożenie rozwiązania poza laboratorium.

Wcześniejsze testy ujawniły problemy z bezpieczeństwem

Warto przypomnieć, że wcześniejsze benchmarki pokazały znaczną poprawę rozumienia przestrzennego przez model Astra. Jednocześnie inne badania zwróciły uwagę na kwestie bezpieczeństwa, gdy Astra sprawuje kontrolę nad robotem. To sygnał, że rozwój autonomicznych maszyn wymaga równoległego doskonalenia mechanizmów zabezpieczających.

Co dalej z robotyką opartą na modelach językowych

Kod systemu HomeBody został udostępniony publicznie na GitHubie, co pozwala innym zespołom na jego testowanie i rozwijanie. OpenAI zapowiedziało już powrót do robotyki, w tym projektów przeznaczonych do użytku osobistego. Można więc oczekiwać, że w najbliższych latach zobaczymy więcej prób łączenia zaawansowanych modeli AI z fizycznymi maszynami.

HomeBody pokazuje, że granica między cyfrową inteligencją a światem fizycznym stopniowo się zaciera. Kluczowe pytanie brzmi jednak, czy uda się rozwiązać problemy z opóźnieniami i kosztami obliczeniowymi, zanim tego typu rozwiązania trafią do naszych domów.

Źródło