Awatar AI Tavus oszukał 48% rozmówców

Kalifornijski startup Tavus zaprezentował Griffin – model określany mianem pierwszego „Human Interaction Model” (HIM). To klasa systemów zaprojektowanych do prowadzenia rozmów twarzą w twarz w czasie rzeczywistym, z uwzględnieniem mowy, mimiki, tonu głosu, gestów i pauz. Wyniki badania firmy są zaskakujące: niemal połowa uczestników uznała awatara za prawdziwą osobę.

Jak Griffin radzi sobie z rozmową w czasie rzeczywistym

Griffin nie ogranicza się do generowania odpowiedzi tekstowych. Model jednocześnie odbiera i tworzy przekaz wideo, analizując przy tym sygnały niewerbalne rozmówcy. Oznacza to, że system wychwytuje nie tylko słowa, ale też sposób ich wypowiedzenia – drżenie głosu, zawahanie, wyraz twarzy czy gestykulację.

Takie podejście odróżnia Griffin od wcześniejszych rozwiązań, które koncentrowały się głównie na warstwie językowej. Tavus twierdzi, że jego model jako pierwszy łączy analizę i generowanie wideo w jednym, spójnym procesie.

Wyniki badania: 48% kontra 2%

W badaniu przeprowadzonym przez Tavus 48 procent uczestników po minutowej rozmowie wideo było przekonanych, że rozmawia z człowiekiem. Dla porównania – wcześniejsze systemy osiągały w tym samym teście maksymalnie 2 procent. To skok o ponad dwadzieścia razy.

Firma powołuje się również na niezależny test Nvidii, który mierzył wrażenie „ludzkości” w bezpośredniej rozmowie audio-wideo. Griffin uzyskał 3,83 punktu. Prawdziwi ludzie w tym samym badaniu zdobyli 3,92 punktu, a najlepszy wcześniejszy model AI – 2,80.

Co Tavus planuje zrobić z Griffin

Na razie udostępniono wersję zapowiedziową o nazwie Griffin-Lite, dostępną dla wybranych testerów w ramach „research preview”. Pełniejsza wersja modelu ma pojawić się dopiero po rozwiązaniu kwestii związanych z bezpieczeństwem.

Tavus wskazuje trzy główne obszary zastosowań:

  • korepetycje i nauka z wirtualnym nauczycielem,
  • ćwiczenie trudnych rozmów, np. rekrutacyjnych czy negocjacyjnych,
  • wsparcie techniczne prowadzone przez kamerę.

Firma z San Francisco działa od 2020 roku i pozyskała dotychczas około 64 milionów dolarów finansowania. Zaczynała od spersonalizowanych materiałów wideo dla sprzedaży i marketingu, by następnie rozszerzyć działalność na rozmowy na żywo z cyfrowymi personami. Szczegóły techniczne Griffin opisano w raporcie badawczym Tavus.

Dlaczego to więcej niż kolejny awatar

Granica między syntetycznym obrazem a prawdziwym człowiekiem w rozmowie wideo nigdy nie była tak cienka. Wynik 3,83 punktu w teście Nvidii – przy 3,92 dla ludzi – pokazuje, że różnica staje się statystycznie niewielka. To otwiera pytania nie tylko technologiczne, ale też etyczne i społeczne.

Z jednej strony takie modele mogą realnie wspierać edukację czy trening komunikacji. Z drugiej – rodzą obawy o możliwość podszywania się pod inne osoby, manipulację w rozmowach biznesowych czy dezinformację w wideokonferencjach. Sam Tavus przyznaje, że pełna wersja Griffin czeka na rozwiązanie kwestii bezpieczeństwa, co sugeruje, że twórcy mają świadomość tych zagrożeń.

Na razie Griffin-Lite trafia do ograniczonego grona testerów. Jeśli zapowiedzi się potwierdzą, kolejne miesiące mogą przynieść modele, które w rozmowie wideo będą nieodróżnialne od człowieka dla większości odbiorców. Pytanie brzmi nie „czy”, ale „kiedy” i „z jakimi konsekwencjami”.

Źródło