Google rozszerza swoje portfolio narzędzi do generowania mowy o dwa nowe modele: Gemini 3.8 Flash TTS oraz Gemini 3.8 Flash-Lite TTS. Pierwszy z nich pozwala projektować głosy od podstaw wyłącznie na podstawie opisu tekstowego, drugi stawia na ekonomiczną syntezę mowy na dużą skalę. Oba rozwiązania mają wspierać ponad sto języków i dają twórcom precyzyjną kontrolę nad sposobem wypowiadania poszczególnych kwestii.
Projektowanie głosu zaczyna się od promptu
Największa nowość w modelu Flash TTS to możliwość stworzenia zupełnie nowego głosu bez nagrywania jakichkolwiek próbek. Użytkownik opisuje w promptcie rolę postaci, akcent oraz cechy wokalne, a system generuje spójny głos w wybranym języku lub dialekcie. To podejście otwiera drzwi do szybkiego prototypowania bohaterów gier, narratorów audiobooków czy prowadzących podcasty.
Dla osób, które nie chcą zaczynać od zera, Google przygotowało bibliotekę ponad dwóch tysięcy gotowych głosów. Znajdziemy tam warianty regionalne, takie jak hiszpański meksykański, francuski z Quebecu czy angielski szkocki. To istotne udogodnienie dla twórców lokalizujących treści na konkretne rynki.
Kloning głosu z próbki 30 sekund
Model oferuje również funkcję klonowania głosu, która buduje profil wokalny na podstawie trzydziestosekundowego nagrania. Aby z niej skorzystać, osoba, której głos jest powielany, musi zarejestrować ustne oświadczenie o wyrażeniu zgody, a barwa w tym nagraniu musi odpowiadać próbce źródłowej. Google podkreśla, że każdy wygenerowany klip zawiera niesłyszalny znak wodny SynthID, który pomaga wykrywać syntetyczną mowę.
Firma zapowiedziała także funkcję „Voice Remixing”, która umożliwi modyfikowanie barwy, wysokości, tempa i akcentu głosów z biblioteki. Na razie narzędzie nie jest jednak dostępne publicznie.
Reżyserskie wskazówki i stabilność długich nagrań
Oba modele pozwalają dopisywać wskazówki reżyserskie do pojedynczych linii dialogu lub pozostawić ich interpretację samemu systemowi. Google zapewnia, że generowanie może trwać godzinami przy minimalnym „dryfie mówcy”, czyli sytuacji, w której barwa głosu z czasem się zmienia.
Dostępny jest też tryb dwugłosowy, który tworzy dialog z jednego skryptu, zachowując wyraźny podział między postaciami. Użytkownicy mogą dodatkowo zapisywać w scenariuszu śmiech, westchnienia czy dźwięki typu „mhm”, aby precyzyjnie umiejscowić reakcje i pauzy.
Testy własne ujawniają niedoskonałości
W dwóch testach przeprowadzonych przez autora źródłowego artykułu użyto gotowego głosu z promptem stylu, który miał imitować zirytowanego berlińczyka mówiącego po angielsku z mocnym niemieckim akcentem. Kontrola stylu wygenerowała przekonujący akcent i intonację, ale w obu próbach w tle pojawił się wysoki pisk. W jednym przypadku głos zmienił się pod koniec klipu.
Według Google nowe modele prowadzą w większości kategorii benchmarku text-to-speech przygotowanego przez Hume AI.
Dostępność, ceny i integracje
Oba modele są udostępniane przez Gemini API oraz Google AI Studio. Flash TTS trafił również do Gemini Notebook, a Flash-Lite TTS do Google Vids. Dostęp przez Gemini Enterprise API ma pojawić się wkrótce. Platformy deweloperskie takie jak Agora, LiveKit, Pipecat i Vercel już obsługują integrację przez Gemini API.
Google nie podało jeszcze regionalnych endpointów dla nowych modeli, choć wcześniejsze wersje TTS oferowały przetwarzanie danych w UE. Dane z darmowego planu są wykorzystywane do ulepszania produktów, natomiast z planu płatnego – nie.
Ile kosztuje godzina syntetycznego audio
Ceny podano w dolarach amerykańskich za milion tokenów, przy czym tokeny tekstowe rozliczane są za wejście, a audio za wyjście. Według Google jedna sekunda wygenerowanego dźwięku odpowiada 25 tokenom audio, co daje 90 tysięcy tokenów na godzinę nagrania.
- Flash TTS do końca 2026 roku: 0,50 USD za tekst wejściowy i 9 USD za audio wyjściowe za milion tokenów
- Flash TTS od 2027 roku: 1 USD za tekst i 18 USD za audio
- Flash-Lite TTS do końca 2026 roku: 0,50 USD za tekst i 6 USD za audio
- Flash-Lite TTS od 2027 roku: 1 USD za tekst i 12 USD za audio
W praktyce godzina nagrania kosztuje 0,81 USD w przypadku Flash TTS i 0,54 USD w Flash-Lite TTS do końca 2026 roku. Od 1 stycznia 2027 roku stawki rosną odpowiednio do 1,62 USD i 1,08 USD, a koszt tekstu wejściowego rozliczany jest osobno.
Nowe modele Google wpisują się w rosnącą konkurencję na rynku syntezy mowy, gdzie liczy się nie tylko jakość brzmienia, ale też kontrola nad interpretacją i koszt generowania długich treści. Projektowanie głosów z opisu tekstowego może znacząco skrócić czas produkcji audio, choć pierwsze testy pokazują, że technologia wciąż mierzy się z artefaktami dźwiękowymi. Kluczowe pytanie brzmi, czy twórcy zaufaą syntetycznym głosom na tyle, by zastąpiły one ludzkich lektorów w produkcjach komercyjnych.

