EmbeddingGemma 2: mały model Google z wielkimi możliwościami

Google zaprezentowało EmbeddingGemma 2 – otwarty model embeddingowy, który zamienia różne typy danych na wektory liczbowe. Dzięki temu możliwe jest wyszukiwanie i porównywanie podobnych treści niezależnie od ich formatu. Nowa wersja wyróżnia się nie tylko możliwościami, ale przede wszystkim rozmiarem – przy 740 milionach parametrów ma konkurować z rozwiązaniami dwukrotnie większymi.

Model obsługuje tekst, obrazy, wideo, dźwięk oraz kod źródłowy. To rozszerzenie względem poprzedniej generacji, która koncentrowała się głównie na tekście. Google twierdzi, że EmbeddingGemma 2 jest obecnie najbardziej kompaktowym modelem w swojej klasie.

Wyniki, które mogą zaskoczyć

Najbardziej wymiernym dowodem możliwości nowego modelu są rezultaty benchmarków. W Massive Text Embedding Benchmark (Code) EmbeddingGemma 2 osiąga 78,68 punktu. To niemal 10 punktów więcej niż jego poprzednik, który uzyskał 68,76. Taki wynik stawia go na równi z modelami znacznie większymi pod względem liczby parametrów.

Warto podkreślić, że benchmark dotyczy zadań związanych z kodem, co sugeruje, że model może być szczególnie użyteczny w narzędziach dla programistów. Wyszukiwanie fragmentów kodu, porównywanie implementacji czy analiza repozytoriów to tylko niektóre z potencjalnych zastosowań.

Działa lokalnie, bez klucza API

Jedną z kluczowych cech EmbeddingGemma 2 jest możliwość uruchomienia bezpośrednio na urządzeniu użytkownika. Model nie wymaga klucza API ani połączenia z zewnętrznymi serwerami. To istotna zmiana dla osób i firm, które cenią sobie prywatność danych lub pracują w środowiskach o ograniczonym dostępie do internetu.

Wydajność i wymagania sprzętowe

Pod względem zasobów EmbeddingGemma 2 prezentuje się wyjątkowo oszczędnie:

  • Zapytanie zajmuje od 20 do 70 milisekund przy użyciu WebGPU w przeglądarce
  • Model potrzebuje około 191 MB pamięci RAM
  • Lokalna baza wektorowa może zostać zmniejszona nawet sześciokrotnie

Dla zadań wyłącznie tekstowych wystarczy wersja z 270 milionami parametrów. To pokazuje, że Google myśli o różnych scenariuszach użycia – od prostego wyszukiwania tekstu po zaawansowane aplikacje multimodalne.

Offline RAG z małymi modelami

EmbeddingGemma 2 można łączyć z niewielkimi otwartymi modelami, takimi jak Gemma 4. Taka kombinacja pozwala budować aplikacje RAG (Retrieval-Augmented Generation) działające w trybie offline. Dane nie są wówczas wysyłane do zewnętrznych serwerów, co ma znaczenie zarówno dla prywatności, jak i dla kosztów operacyjnych.

RAG to technika, w której model językowy korzysta z zewnętrznej bazy wiedzy, aby udzielać trafniejszych odpowiedzi. Połączenie EmbeddingGemma 2 z lekkim modelem generatywnym otwiera drogę do tworzenia inteligentnych asystentów działających choćby na laptopie bez stałego dostępu do chmury.

Dostępność i dokumentacja

Wagi modelu są dostępne na platformach Hugging Face oraz Kaggle. Google udostępniło również przewodnik dla deweloperów oraz pełną dokumentację. To ważne, ponieważ otwartość ekosystemu sprzyja szybszemu wdrażaniu nowych rozwiązań i eksperymentowaniu.

Premiera EmbeddingGemma 2 wpisuje się w szerszy trend miniaturyzacji modeli AI. Coraz częściej okazuje się, że mniejsze sieci neuronowe – odpowiednio zaprojektowane – mogą dorównywać większym odpowiednikom w konkretnych zadaniach. Dla użytkowników oznacza to tańsze, szybsze i bardziej prywatne rozwiązania. Czy wkrótce przestaniemy potrzebować potężnych serwerów, by korzystać z zaawansowanej sztucznej inteligencji?

Źródło