Modele

EmbeddingGemma 2 od Google szuka w zdjęciach i nagraniach na telefonie, bez internetu

Google wypuścił EmbeddingGemma 2, otwarty model, dzięki któremu aplikacja w telefonie przeszuka zdjęcia, filmy i nagrania po opisie, bez wysyłania ich na serwer. Działanie widać w aplikacji Google AI Edge Gallery.

Łukasz Niesyto
prowadzi serwis · wdraża systemy AI w firmach
Opublikowano 2 min czytania
AITekst przygotowany przez AI na podstawie źródła: blog.google · jak powstaje
Zdjęcie: lupa leżąca na stosie zdjęć i kaset magnetofonowych, w szkle lupy widać czerwone rzędy cyfr

Google wypuścił 6 października EmbeddingGemma 2, mały otwarty model, który w telefonie, bez internetu, pozwala szukać w zdjęciach, filmach i nagraniach tak samo jak w tekście. Firma opisała go na blogu Google. Model jest przeznaczony dla twórców aplikacji, ale jego działanie możesz zobaczyć sam w aplikacji Google AI Edge Gallery.

Do czego służy taki model

EmbeddingGemma 2 nie pisze odpowiedzi jak czat. Zamienia tekst, zdjęcie, nagranie albo fragment kodu na ciąg liczb, który opisuje znaczenie. Rzeczy o podobnym znaczeniu dostają podobne liczby, więc aplikacja może na przykład znaleźć zdjęcie psa na plaży po wpisaniu „pies nad morzem”, nawet jeśli plik nazywa się IMG_4521. Pierwsza wersja rozumiała tylko tekst. Druga umieszcza tekst, kod, obrazy, wideo i dźwięk w jednej przestrzeni, więc możesz szukać nagrania głosowego tekstem albo fragmentu filmu nagraniem.

Wszystko dzieje się w urządzeniu. Zdjęcia i nagrania nie muszą trafiać na serwer, żeby dało się je przeszukać.

Liczby od Google

CoWartość
Rozmiar modelu740 mln parametrów
Wersja tylko do tekstuod 270 mln parametrów
Dodatkowy moduł do obrazów170 mln parametrów
Dodatkowy moduł do dźwięku300 mln parametrów
Pamięć na Pixelu 11 Pro (wersja skompresowana)ok. 191 MB tekst, ok. 567 MB całość
Jednorazowo przetworzy5,5 min dźwięku, 29 obrazów albo 58 klatek wideo
Wynik w teście kodu MTEB Code78,68 (pierwsza wersja: 68,76)
LicencjaApache 2.0, także do użytku komercyjnego

Google pisze, że to najlepszy model tego typu wśród mniejszych niż miliard parametrów. To deklaracja producenta, oparta na testach MTEB Code i MAEB. Pełne wyniki są w karcie modelu.

Jak to wypróbować

W aplikacji Google AI Edge Gallery Google pokazuje dwa przykłady z nowym modelem:

  1. Instant Media Search: wpisujesz tekst albo wskazujesz zdjęcie, a aplikacja szuka podobnych w twojej galerii.
  2. Video Moments Finder: opisujesz scenę tekstem albo głosem, a aplikacja znajduje to miejsce w filmie.

Google nie podaje, na jakich telefonach te przykłady działają. Nie podaje też listy obsługiwanych języków, pisze tylko, że model jest wielojęzyczny jak pierwsza wersja. Czy dobrze rozumie opisy po polsku, trzeba sprawdzić samemu.

Co z tego mają twórcy aplikacji

Wagi modelu są na Hugging Face i Kaggle. Model działa z popularnymi narzędziami do uruchamiania modeli na własnym komputerze, w tym z Ollamą i LM Studio. Ma tę samą budowę co Gemma 4, więc obie mogą działać razem w telefonie: EmbeddingGemma 2 znajduje pliki, a Gemma 4 odpowiada na pytania o nie.

Pierwszą wersję EmbeddingGemma pobrano ponad 20 mln razy. To kolejny mały model Google do pracy bez internetu, po MedGemmie dla lekarzy w Afryce i Azji. W Gemini Enterprise Agent Platform model pojawi się później, Google nie podał daty.

Źródła
  1. Google, wpis „EmbeddingGemma 2: an open, lightweight multimodal embedding model”, dostęp 2026-10-07

Ten tekst napisał model AI na podstawie źródeł wymienionych wyżej. Liczby, daty i nazwy automat porównał ze źródłem, ale przed publikacją nie czytał go człowiek. Jak powstają teksty.

Widzisz błąd? Napisz, poprawiamy i dopisujemy notę o zmianie.

Łukasz Niesyto
Łukasz Niesyto

Wdraża systemy oparte na AI w firmach produkcyjnych i usługowych. Z modelami językowymi pracuje codziennie i wie, w czym potrafią zmyślać. Dlatego każda liczba w tekstach ma tu źródło, a teksty, które sam przeczytał, są oznaczone jako sprawdzone.

wszystkie teksty autora

Powiązane

7 października 2026

Mistral Large 4 kosztuje 2,64 zł za milion tokenów wejścia. Wagi modelu Mistral wyda do końca października

Modelemistral.ai3 min
6 października 2026

Falcon-Emirati-7B mówi dialektem z Emiratów. Inne modele odpowiadały językiem z podręcznika

Modelehuggingface.co2 min
5 października 2026

Grok 4.7 kosztuje 7,78 zł za milion tokenów wejścia. SpaceXAI celuje w programistów i biura

Modelex.ai3 min