Gemini Omni 1.1 Flash: tańsze wideo AI od Google

Google wprowadza istotną aktualizację swojego modelu generowania wideo. Gemini Omni Flash doczekał się wersji 1.1, która znacząco poprawia spójność wizualną i daje twórcom większą kontrolę nad finalnym materiałem. To odpowiedź na rosnące zapotrzebowanie na elastyczne i ekonomiczne narzędzia do produkcji wideo wspieranej przez sztuczną inteligencję.

Najważniejszą zmianą jest sposób analizowania materiału źródłowego. Poprzednia iteracja modelu opierała się wyłącznie na ostatniej sekundzie nagrania. Wersja 1.1 bierze pod uwagę aż dziesięć sekund istniejącego wideo, co przekłada się na znacznie bardziej spójne i naturalne rozszerzanie scen. Dla twórców oznacza to mniej niespodzianek i płynniejsze przejścia między klatkami.

Większa kontrola nad sceną i ruchem kamery

Nowa odsłona modelu oferuje kilka praktycznych funkcji, które zwiększają precyzję pracy. Przede wszystkim sceny można wydłużać w interwałach co dziesięć sekund, aż do maksymalnie czterdziestu sekund łącznego czasu trwania. To spore pole do popisu dla twórców, którzy potrzebują dłuższych ujęć bez utraty jakości.

Model przyjmuje również zewnętrzne nagrania o długości do trzech sekund jako referencję stylu. Dzięki temu można przenieść do nowego materiału charakterystyczne elementy, takie jak wygląd postaci czy specyficzny wzorzec ruchu. To rozwiązanie sprawdza się szczególnie w produkcjach, gdzie liczy się ciągłość wizualna.

Dodatkowo Gemini Omni 1.1 Flash umożliwia definiowanie klatek początkowej i końcowej. Ustawienie tych punktów pozwala generować płynne ruchy kamery pomiędzy kluczowymi momentami ujęcia. Twórcy zyskują narzędzie do tworzenia dynamicznych sekwencji bez konieczności ręcznej animacji.

Tryb draftu: szybciej i taniej

Jedną z najbardziej interesujących nowości jest tryb szkicu w rozdzielczości 360p. Ta opcja działa nawet o 60 procent szybciej niż standardowa jakość 720p, a koszt jej użycia to zaledwie jedna trzecia ceny. To praktyczne rozwiązanie do szybkiego prototypowania pomysłów i testowania koncepcji przed finalną produkcją.

Po zaakceptowaniu wstępnej wersji materiał można poddać procesowi upscalingu. Model obsługuje podbicie rozdzielczości do 1080p, a nawet do 4K. Dzięki temu workflow wygląda następująco: szybkie generowanie wersji roboczej, wybór najlepszego ujęcia i dopiero potem kosztowniejsze przetworzenie w wysokiej jakości.

Cennik generowania wideo w modelach Google

Google udostępniło szczegółowy cennik za sekundę wygenerowanego materiału. Nowy model Omni 1.1 Flash wyceniono następująco:

  • 360p: 0,03 dolara za sekundę
  • 720p: 0,10 dolara za sekundę
  • 1080p: 0,15 dolara za sekundę
  • 4K: 0,30 dolara za sekundę

Dla porównania, standardowa wersja Gemini Omni Flash oferuje wyłącznie jakość 720p w tej samej cenie 0,10 dolara. Z kolei model Veo 3.1 Lite kosztuje 0,05 dolara za 720p i 0,08 dolara za 1080p. Najdroższa opcja, Veo 3.1 Fast, to wydatek 0,10 dolara za 720p, 0,12 dolara za 1080p oraz 0,30 dolara za jakość 4K.

Taka struktura cenowa pokazuje, że Google stawia na segmentację oferty. Twórcy mogą wybierać pomiędzy ekonomicznymi wersjami do testów a droższymi, zaawansowanymi modelami do finalnej produkcji. To podejście obniża barierę wejścia dla mniejszych studiów i niezależnych artystów.

Dostępność i podsumowanie

Gemini Omni 1.1 Flash jest już dostępny dla deweloperów. Model można uruchomić za pośrednictwem Google AI Studio oraz dokumentacji dla programistów. To oznacza, że zespoły techniczne mogą od razu integrować nowe możliwości ze swoimi aplikacjami i pipeline’ami produkcyjnymi.

Aktualizacja do wersji 1.1 to krok w stronę bardziej przystępnego generowania wideo. Lepsza analiza kontekstu, możliwość pracy na klatkach kluczowych oraz opcja szybkiego podglądu w niskiej rozdzielczości sprawiają, że narzędzie staje się praktycznym wyborem dla szerokiego grona odbiorców. Rynek narzędzi AI do wideo ewoluuje w kierunku większej elastyczności i kontroli kosztów, a najnowsza propozycja Google wpisuje się w ten trend.

Źródło