GenCeption: model wideo jako uniwersalne narzędzie wizji komputerowej

Języki naturalne mają swojego uniwersalnego dżokera – duże modele językowe (LLM), które przez przewidywanie kolejnego słowa nauczyły się gramatyki, wiedzy o świecie i kontekstu. Computer vision wciąż czeka na taki przełom. Specjalistyczne modele, jak Segment Anything dla segmentacji czy Depth Anything dla głębi, królują w swoich niszech, ale każdy wymaga osobnej architektury i dużych zbiorów danych. Google DeepMind postanowił sprawdzić, czy generatory wideo mogą wypełnić tę lukę.

GenCeption – nowa jakość dzięki pojedynczemu przejściu

W nowej pracy badacze DeepMind przedstawiają GenCeption – metodę, która wykorzystuje pre-trenowany model generacji wideo jako podstawę do klasycznych zadań wizji komputerowej. Sercem systemu jest otwarty model Wan2.1 firmy Alibaba, który został poddany prostym modyfikacjom. Zamiast wieloetapowej dyfuzji (typowej dla generowania wideo z szumu), GenCeption wykonuje predykcję w jednym przejściu do przodu. To sprawia, że jest wystarczająco szybki dla praktycznych zastosowań.

Jak jeden model obsługuje wiele zadań

Kluczowym pomysłem jest ujednolicenie reprezentacji. Niezależnie od tego, czy wynikiem ma być mapa głębi, mapa normalnych powierzchni, maska segmentacyjna, czy oszacowanie położenia w 3D – GenCeption zawsze generuje standardowy obraz RGB o trzech kanałach. Nawet ruch kamery jest przekształcany na postać obrazową. Do tego dochodzi prompt tekstowy, który mówi modelowi, jakie zadanie ma wykonać – podobnie jak instrukcja dla chatbota.

Dla zadań, które z natury nie generują obrazów (jak przewidywanie kluczowych punktów 3D), zespół dodał trenowalne moduły. W całym procesie wykorzystuje jedną funkcję straty (loss function) dla wszystkich zadań. Zamiast zmieniać architekturę dla każdego przypadku, badacze przetworzyli dane treningowe tak, by uwzględniały specyficzne wymagania poszczególnych zadań.

Generalizacja wykraczająca poza dane treningowe

Źródło