Ceny

Gemini 3.8 Flash TTS czyta po polsku za ok. 3 zł za godzinę. Od stycznia 2027 stawka się podwoi

Google wypuścił w Gemini API dwa modele, które czytają tekst na głos, także po polsku. Cennik ma dwie daty: do końca 2026 roku stawki są o połowę niższe niż od 1 stycznia 2027.

Łukasz Niesyto
prowadzi serwis · wdraża systemy AI w firmach
Opublikowano 3 min czytania
Sprawdzone ze źródłem: ai.google.dev
Zdjęcie: mikrofon studyjny z częściowo zdjętą folią ochronną i ceglastoczerwoną gąbką na ciemnym tle

Google udostępnił 22 września w Gemini API dwa modele, które zamieniają tekst na mowę: Gemini 3.8 Flash TTS i tańszy Gemini 3.8 Flash-Lite TTS. Dotyczy to firm, które płacą za każde użycie modelu, na przykład przy automatycznej infolinii, czytaniu artykułów na głos albo nagrywaniu szkoleń. Premierę Google opisał w notatkach wydania Gemini API, a stawki podał w cenniku Gemini API.

Oba modele mówią po polsku. Według przewodnika Google po syntezie mowy Flash TTS obsługuje 130 języków, a polski jest na liście. Flash-Lite TTS zna ich 101, wśród nich też polski. Polska figuruje też na liście krajów, w których działa Gemini API.

Ile kosztuje godzina nagrania

Google rozlicza dźwięk w tokenach, czyli porcjach danych, od których liczy się opłata. Sekunda nagrania to 25 tokenów. Godzina daje więc 90 tys. tokenów. Na tej podstawie przeliczyliśmy stawki ze standardowego trybu płatnego planu na złote, po kursie NBP z 23 września (tabela 185/A/NBP/2026, 3,8175 zł za dolara).

ModelDźwięk, milion tokenów, do 2026-12-31Od 2027-01-01Godzina nagrania terazGodzina od 2027-01-01
Gemini 3.8 Flash TTS9 dolarów18 dolarówok. 3,09 złok. 6,18 zł
Gemini 3.8 Flash-Lite TTS6 dolarów12 dolarówok. 2,06 złok. 4,12 zł
Gemini 3.1 Flash TTS Preview (poprzednik)20 dolarówcennik nie podaje zmianyok. 6,87 złbrak danych

Do tego dochodzi opłata za tekst, który model czyta. W obu nowych modelach wynosi 0,50 dolara za milion tokenów do końca roku. Od stycznia będzie to 1 dolar.

Przyjmijmy firmę, która co miesiąc generuje 100 godzin nagrań: komunikaty infolinii i wersje audio artykułów. Z Flash-Lite TTS zapłaci za sam dźwięk ok. 206 zł miesięcznie. Od stycznia ta sama praca będzie kosztować ok. 412 zł. Z poprzednikiem, Gemini 3.1 Flash TTS Preview, firma płaci dziś ok. 687 zł. Stawki innych modeli w złotych zbieramy w cenniku modeli w złotych.

W trybach Batch i Flex oba modele kosztują połowę stawki standardowej. Za milion tokenów dźwięku z Flash TTS płacisz w nich 4,50 dolara do końca roku.

Podwyżka zapisana z góry

Cennik podaje przy każdej pozycji dwie stawki: do 31 grudnia 2026 i od 1 stycznia 2027. Druga jest dwa razy wyższa we wszystkich trybach, także w priorytetowym i przy przechowywaniu danych w pamięci podręcznej. Google nie podaje w cenniku powodu tej zmiany. Jeśli planujesz budżet na 2027 rok, licz od razu według wyższej stawki. Nawet po podwyżce dźwięk z obu nowych modeli będzie tańszy niż z poprzednika. Za tekst wszystkie trzy modele będą wtedy liczyć tyle samo, 1 dolar za milion tokenów.

Google nie wyznaczył daty wyłączenia poprzednika. Na stronie wycofywanych modeli Gemini 3.1 Flash TTS Preview nie ma daty wyłączenia, a jako następców wskazano oba nowe modele. Kilka dni wcześniej Google ograniczył nowym projektom dostęp do modeli Gemini 2.5.

Własne głosy i dane

Modele mają 30 gotowych głosów oraz bibliotekę setek kolejnych, z różnymi językami i akcentami. Głos można też zaprojektować z opisu słownego albo odtworzyć głos konkretnej osoby. Do odtworzenia potrzebne jest nagranie wzorcowe i nagranie ze zgodą tej osoby. Jeden projekt przechowa najwyżej 200 własnych głosów. Każdy z nich jest przechowywany przez rok.

Według tabeli w cenniku w darmowym planie Google używa przesłanych treści do ulepszania swoich produktów, w płatnym nie. Jeśli model ma czytać dane klientów albo odtwarzać głos pracownika, korzystaj z płatnego planu.

Dla programistów

Identyfikatory modeli to gemini-3.8-flash-tts i gemini-3.8-flash-lite-tts. Własne głosy tworzysz przez POST /v1beta/voices, a bibliotekę przeglądasz przez GET /v1beta/voices. Przewodnik wymienia zmiany, które mogą zepsuć kod napisany dla gemini-3.1-flash-tts-preview. Oto trzy z nich. Model czyta tekst dosłownie jako transkrypcję, więc wskazówki w rodzaju „szeptem” przenosisz do speech_metadata.style. W zapytaniu z kilkoma mówcami każda kwestia musi mieć pole speaker w speech_metadata. Zwykłe zapytanie zwraca domyślnie plik WAV z nagłówkiem, a nie surowe PCM (audio/l16). Jeśli dopisywałeś nagłówek sam, usuń ten krok albo ustaw response_format. Według sekcji ograniczeń jedno zapytanie obsłuży najwyżej dwóch mówców z gotowych głosów.

Klucze głosów zapisanych bez przechowywania (store=False) wygasają po 7 dniach.

Źródła
  1. Google, cennik Gemini API, dostęp 2026-09-23
  2. Google, notatki wydania Gemini API, wpis z 2026-09-22
  3. Google, przewodnik „Text-to-speech generation”
  4. Google, strona wycofywanych modeli Gemini API
  5. Google, kraje, w których działa Gemini API
  6. NBP, kurs USD, tabela 185/A/NBP/2026 z 2026-09-23

Widzisz błąd? Napisz, poprawiamy i dopisujemy notę o zmianie.

Łukasz Niesyto
Łukasz Niesyto

Wdraża systemy oparte na AI w firmach produkcyjnych i usługowych. Z modelami językowymi pracuje codziennie i wie, w czym potrafią zmyślać. Dlatego żaden tekst nie trafia tu bez jego przeczytania.

wszystkie teksty autora

Powiązane

23 września 2026

GPT-6 Sol i GPT-6 Luna w API OpenAI. Sol kosztuje połowę stawki GPT-5.6 Sol

Cenydevelopers.openai.com3 min
22 września 2026

Claude Opus 5.5 kosztuje 4 i 20 dolarów za milion tokenów. Liczymy w złotych i sprawdzamy, co psuje w kodzie

Cenyanthropic.com3 min