EmbeddingGemma 2 od Google szuka w zdjęciach i nagraniach na telefonie, bez internetu
Google wypuścił EmbeddingGemma 2, otwarty model, dzięki któremu aplikacja w telefonie przeszuka zdjęcia, filmy i nagrania po opisie, bez wysyłania ich na serwer. Działanie widać w aplikacji Google AI Edge Gallery.

Google wypuścił 6 października EmbeddingGemma 2, mały otwarty model, który w telefonie, bez internetu, pozwala szukać w zdjęciach, filmach i nagraniach tak samo jak w tekście. Firma opisała go na blogu Google. Model jest przeznaczony dla twórców aplikacji, ale jego działanie możesz zobaczyć sam w aplikacji Google AI Edge Gallery.
Do czego służy taki model
EmbeddingGemma 2 nie pisze odpowiedzi jak czat. Zamienia tekst, zdjęcie, nagranie albo fragment kodu na ciąg liczb, który opisuje znaczenie. Rzeczy o podobnym znaczeniu dostają podobne liczby, więc aplikacja może na przykład znaleźć zdjęcie psa na plaży po wpisaniu „pies nad morzem”, nawet jeśli plik nazywa się IMG_4521. Pierwsza wersja rozumiała tylko tekst. Druga umieszcza tekst, kod, obrazy, wideo i dźwięk w jednej przestrzeni, więc możesz szukać nagrania głosowego tekstem albo fragmentu filmu nagraniem.
Wszystko dzieje się w urządzeniu. Zdjęcia i nagrania nie muszą trafiać na serwer, żeby dało się je przeszukać.
Liczby od Google
| Co | Wartość |
|---|---|
| Rozmiar modelu | 740 mln parametrów |
| Wersja tylko do tekstu | od 270 mln parametrów |
| Dodatkowy moduł do obrazów | 170 mln parametrów |
| Dodatkowy moduł do dźwięku | 300 mln parametrów |
| Pamięć na Pixelu 11 Pro (wersja skompresowana) | ok. 191 MB tekst, ok. 567 MB całość |
| Jednorazowo przetworzy | 5,5 min dźwięku, 29 obrazów albo 58 klatek wideo |
| Wynik w teście kodu MTEB Code | 78,68 (pierwsza wersja: 68,76) |
| Licencja | Apache 2.0, także do użytku komercyjnego |
Google pisze, że to najlepszy model tego typu wśród mniejszych niż miliard parametrów. To deklaracja producenta, oparta na testach MTEB Code i MAEB. Pełne wyniki są w karcie modelu.
Jak to wypróbować
W aplikacji Google AI Edge Gallery Google pokazuje dwa przykłady z nowym modelem:
- Instant Media Search: wpisujesz tekst albo wskazujesz zdjęcie, a aplikacja szuka podobnych w twojej galerii.
- Video Moments Finder: opisujesz scenę tekstem albo głosem, a aplikacja znajduje to miejsce w filmie.
Google nie podaje, na jakich telefonach te przykłady działają. Nie podaje też listy obsługiwanych języków, pisze tylko, że model jest wielojęzyczny jak pierwsza wersja. Czy dobrze rozumie opisy po polsku, trzeba sprawdzić samemu.
Co z tego mają twórcy aplikacji
Wagi modelu są na Hugging Face i Kaggle. Model działa z popularnymi narzędziami do uruchamiania modeli na własnym komputerze, w tym z Ollamą i LM Studio. Ma tę samą budowę co Gemma 4, więc obie mogą działać razem w telefonie: EmbeddingGemma 2 znajduje pliki, a Gemma 4 odpowiada na pytania o nie.
Pierwszą wersję EmbeddingGemma pobrano ponad 20 mln razy. To kolejny mały model Google do pracy bez internetu, po MedGemmie dla lekarzy w Afryce i Azji. W Gemini Enterprise Agent Platform model pojawi się później, Google nie podał daty.
- Czy EmbeddingGemma 2 działa bez internetu?Tak. Google pisze, że model działa w całości na urządzeniu, a na Pixelu 11 Pro po kompresji potrzebuje ok. 567 MB pamięci w pełnej wersji.
- Czy EmbeddingGemma 2 można używać komercyjnie?Tak. Google wydał model na licencji Apache 2.0, która pozwala na użytek komercyjny.
Ten tekst napisał model AI na podstawie źródeł wymienionych wyżej. Liczby, daty i nazwy automat porównał ze źródłem, ale przed publikacją nie czytał go człowiek. Jak powstają teksty.
Widzisz błąd? Napisz, poprawiamy i dopisujemy notę o zmianie.

Wdraża systemy oparte na AI w firmach produkcyjnych i usługowych. Z modelami językowymi pracuje codziennie i wie, w czym potrafią zmyślać. Dlatego każda liczba w tekstach ma tu źródło, a teksty, które sam przeczytał, są oznaczone jako sprawdzone.
wszystkie teksty autora