Runway chce streamować wideo AI na żywo

Runway podzielił się wynikami badań nad generowaniem wideo w czasie rzeczywistym. Zamiast wpisywać prompt i czekać na gotowy klip, użytkownik opisywałby scenę, a obraz powstawałby na bieżąco – jak transmisja na żywo, którą można sterować. To podejście może zmienić sposób, w jaki tworzymy i konsumujemy treści wideo generowane przez AI.

Obecne modele wideo działają etapami. Wpisujesz opis, czekasz kilkanaście sekund lub minut, dostajesz skończony materiał. Jeśli efekt nie odpowiada oczekiwaniom, zaczynasz od nowa. Runway zauważa, że użytkownicy wielokrotnie zgłaszają, że najwięcej czasu tracą właśnie na generowanie i poprawianie klipów. Firma chce zminimalizować czas do pierwszej klatki, a następnie streamować wideo w miarę wpisywania poleceń.

Jak działa model GWM-1 i skąd pomysł na streaming

Koncepcja nie jest całkowicie nowa. Runway po raz pierwszy omawiał to podejście w marcu przy okazji projektu Runway Characters. Wykorzystuje on GWM-1 – pierwszy „General World Model” firmy, zaprezentowany w grudniu 2025 roku. Model ten bazuje na Gen-4.5, generuje wideo klatka po klatce i przyjmuje różne formy sterowania: ruchy kamery, komendy dla robotów czy sygnały audio.

Kilka tygodni wcześniej Runway pokazał Solaris – system oparty na Gen-4.5, który generuje interfejsy użytkownika klatka po klatce i reaguje na kliknięcia lub polecenia głosowe. To pokazuje, że firma konsekwentnie rozwija technologie interaktywne, w których użytkownik ma bezpośredni wpływ na to, co widzi na ekranie.

Problem, którego nie mają modele tekstowe

Modele językowe potrafią poprawić się w trakcie zdania. Model wideo buduje każdą klatkę na poprzedniej, przez co drobne błędy mogą narastać i zamieniać się w poważne zniekształcenia. Runway określa to jako kluczowy problem podejść opartych na LLM.

Rozwiązanie polega na trenowaniu modelu na jego własnych wynikach, a nie wyłącznie na bezbłędnych danych wejściowych. Dzięki temu model uczy się korygować własne odchylenia, zamiast je wzmacniać. To istotna różnica w stosunku do modeli językowych, które mogą cofnąć się do wcześniejszego błędu – model wideo nie ma takiej możliwości, bo każda nowa klatka opiera się na wadliwej poprzedniczce.

Koszty GPU i ekonomika zastosowań

Runway przekonuje, że generowanie w czasie rzeczywistym zmniejsza dystans między pomysłem a jego realizacją. Przy natychmiastowej informacji zwrotnej użytkownik spędza większość czasu na aktywnym sterowaniu obrazem, a nie na oczekiwaniu.

Firma wskazuje też na niższe koszty. Szybsze modele zużywają mniej czasu GPU, co czyni je bardziej opłacalnymi. Według Runway o tym, które zastosowania mają sens ekonomiczny, decyduje koszt pojedynczego wyniku przy danym poziomie jakości. Natychmiastowe generowanie obniża ten próg, dzięki czemu aplikacje wcześniej nieopłacalne stają się rentowne.

Real-time zmienia również rozkład obciążenia obliczeniowego – przenosi je z treningu na użytkowanie. Model musi generować każdą klatkę wystarczająco szybko, by nadążyć za odtwarzaniem, działając na sprzęcie współdzielonym przez kilka sesji jednocześnie.

Zastosowania: robotyka, pojazdy autonomiczne i nie tylko

Runway upatruje największego długoterminowego zastosowania AI-generowanych mediów w aplikacjach interaktywnych. Edukacja, gry i robotyka potrzebują wideo, które reaguje równie szybko jak odbiorca. Ocenianie zachowań robotów czy pojazdów autonomicznych wymaga środowisk generowanych w czasie rzeczywistym, które natychmiast odpowiadają na sytuacje brzegowe.

Firma wcześniej zaprezentowała GWM Robotics – wariant GWM-1, który tworzy syntetyczne dane treningowe dla robotów. Podobną drogę obrało Waymo ze swoim Waymo World Model, opartym na Genie 3 i dostosowanym do ruchu drogowego. System pozwala symulować sytuacje, których flota nigdy nie napotkała – spotkanie ze słoniem, tornado czy zalana osiedlowa ulica. Według Waymo jej pojazd pokonuje miliardy mil w wirtualnych światach, zanim trafi na scenariusze na publicznych drogach.

Inne podejścia do generowania w czasie rzeczywistym

Startup Decart zastosował podobną metodę w swoim modelu czasu rzeczywistego MirageLSD, celowo wystawiając go na zniekształcone obrazy podczas treningu. Google DeepMind twierdzi z kolei, że jego model świata Genie 3 utrzymuje spójność interaktywnych światów przez kilka minut przy 24 klatkach na sekundę w rozdzielczości 720p.

W marcu Runway pokazał również badawczą wersję modelu czasu rzeczywistego opracowanego z Nvidią podczas konferencji GTC tego producenta chipów. Działa na platformie Vera Rubin i ma dostarczać pierwszą klatkę w mniej niż 100 milisekund. Firma nie ogłosiła jeszcze terminu dostępności.

Generowanie wideo w czasie rzeczywistym to kierunek, który może zmienić nie tylko sposób tworzenia treści, ale też trening systemów robotycznych i autonomicznych. Pytanie brzmi, kiedy technologia ta stanie się dostępna na skalę komercyjną – i czy rzeczywiście obniży koszty na tyle, by otworzyć nowe rynki.

Źródło