ElevenLabs wprowadza na rynek Eleven v4 – nową generację modelu syntezy mowy, która ma rozwiązać dwa kluczowe problemy dotychczasowych systemów: precyzję w podążaniu za wskazówkami reżyserskimi oraz spójność głosu w długich produkcjach. Równolegle debiutuje wariant Turbo, zaprojektowany z myślą o agentach głosowych działających w czasie rzeczywistym.
Nowa architektura modelu analizuje ton, tempo i kontekst scenariusza, co przekłada się na lepsze odwzorowanie emocji, pauz i efektów dźwiękowych. To odpowiedź na ograniczenia wersji v3, która obsługiwała tagi audio, ale robiła to z mniejszą dokładnością.
Spójność głosu w długich produkcjach
Jednym z głównych wyzwań w syntezie mowy pozostaje utrzymanie jednolitego brzmienia narratora lub postaci przez całą produkcję. Eleven v4 ma sobie z tym radzić znacznie lepiej niż poprzednie modele.
Kontrola wymowy i tagi reżyserskie
Użytkownicy mogą sterować emocjami, pauzami i efektami dźwiękowymi za pomocą tagów umieszczanych w skrypcie. Alternatywnie wystarczy zwykłe zdanie opisujące pożądaną interpretację. Fonetyczny zapis pozwala precyzyjnie ustalić wymowę nazw własnych i terminów technicznych – firma zapewnia, że mechanizm ten działa teraz bardziej niezawodnie.
Długie formy i dialogi
Model przetwarza do 10 tysięcy znaków na jedno żądanie, co odpowiada mniej więcej dziesięciu minutom nagrania. Dłuższe projekty, takie jak audiobooki, są dzielone na segmenty – tempo i sposób dostarczania treści mają pozostać spójne na granicach fragmentów. W dialogach sztuczni mówcy reagują na kontekst całej sceny, a nie tylko pojedynczej kwestii.
Wielojęzyczność i klonowanie głosu
Eleven v4 obsługuje ponad 90 języków – wcześniej było ich około 70. Sklonowane głosy mają mówić w innych językach z natywnym akcentem, bez powracania do pierwotnego brzmienia w miarę upływu czasu. Funkcja Professional Voice Clones, niedostępna w v3, wraca do oferty. Z kolei Instant Voice Clone wymaga zaledwie dziesięciu sekund materiału audio.
Turbo: ekspresja bez kompromisów na szybkości
Dotychczas twórcy agentów głosowych musieli wybierać między szybkością odpowiedzi a jakością ekspresji. Wariant Turbo ma znieść tę dychotomię.
W testach wewnętrznych ElevenLabs Turbo zaczyna generować słyszalną mowę w około 150 milisekund. Dla porównania Cartesia Sonic 3.6 osiąga 262 milisekundy, a GPT-4o mini TTS od OpenAI – 814 milisekund. Optymalizacja przebiegała równolegle z rozwojem platformy ElevenAgents.
Wyniki na leaderboardach
Eleven v4 wyprzedza Cartesia Sonic 3.6 oraz Gemini 3.8 Flash TTS od Google na liście Provider Voice Arena prowadzonej przez Artificial Analysis. W benchmarku wymowy model osiąga 91,7 procent – wobec 85,6 procent w przypadku v3. W testach blind przeprowadzonych przez firmę około trzy czwarte słuchaczy preferowało v4 nad rozwiązaniami Cartesii, Inworld i Google. Ekspresję Eleven v4 oceniono wyżej w 65–81 procentach porównań, w zależności od konkurenta.
Zastosowania, ceny i dostępność
Wyższa jakość klonowania otwiera przed v4 zastosowania w dubbingu – ElevenLabs promuje możliwość wykorzystania głosu aktora we wszystkich obsługiwanych językach. Firma licencjonuje głosy od ich właścicieli. Aktorzy głosowi mogą udostępnić dokładnie wytrenowany klon w bibliotece ElevenLabs i zarabiać, gdy płacący użytkownicy z niego korzystają. W dedykowanym marketplace dostępne są już głosy celebrytów, takie jak Michael Caine.
Cennik i promocje
Standardowa cena API wynosi 80 dolarów za milion znaków dla v4 i 40 dolarów dla Turbo. Do 12 października stawki spadają odpowiednio do 22 i 11 dolarów. Użytkownicy planu Creator za 22 dolary miesięcznie lub wyższego mogą korzystać z v4 w ElevenCreative bez dodatkowych opłat przez dwa tygodnie, z limitem dwukrotności miesięcznych kredytów. Dla porównania Artificial Analysis podaje Sonic 3.6 w cenie 49 dolarów za milion znaków, a Gemini 3.8 Flash TTS – 16,49 dolara.
Przechowywanie danych
Domyślnie ElevenLabs przechowuje dane klientów w Stanach Zjednoczonych. Klienci enterprise mogą wybrać izolowane środowiska w Unii Europejskiej, Indiach lub Singapurze, choć część przetwarzania może odbywać się poza wybranym regionem. W UE dostępny jest tryb, który nie przechowuje danych i pozwala utrzymać przetwarzanie API w regionie.
Oba modele są już dostępne w ElevenAgents, ElevenCreative oraz przez API. We wrześniu firma wypuściła również model Music 2.5, zaprojektowany do generowania gęstszych i bardziej naturalnie brzmiących utworów.
Premiera Eleven v4 pokazuje, że wyścig w syntezie mowy przenosi się z pytania „czy brzmi jak człowiek?” na „czy potrafi zagrać rolę?”. Spójność długich produkcji i ekspresja w czasie rzeczywistym to obszary, w których różnice między modelami będą się teraz rozstrzygać.

