ElevenLabs wypuszcza Eleven v4. Głos AI śmieje się na komendę i mówi w ponad 90 językach
ElevenLabs udostępnił 28 września model Eleven v4 i jego szybszą odmianę do rozmów na żywo. Głos ma sam dobierać emocje do tekstu, słuchać wskazówek w nawiasach i mówić w ponad 90 językach tym samym brzmieniem.

ElevenLabs wypuścił 28 września Eleven v4, nowy model zamieniający tekst na mowę, oraz jego szybszą odmianę do rozmów na żywo. Dotyczy to osób, które nagrywają lektora do filmów, podcastów i reklam, a także firm budujących głosowych konsultantów. Oba modele działają już w aplikacjach ElevenLabs i w usługach dla programistów. Zapowiedź, którą podpisali Mati Staniszewski i Piotr Dąbkowski, jest na blogu ElevenLabs.
Głos, który gra, a nie tylko czyta
Starsze modele głosowe czytają tekst poprawnie, ale płasko. ElevenLabs podaje przykład zdania „Musisz zachować spokój”. Lekarz powie je łagodnie do przestraszonego pacjenta, a postać w grze wykrzyczy do swojego oddziału przed walką. Eleven v4 ma sam odczytać z tekstu ton, tempo i emocje, a przy kilku mówiących reagować na to, co padło przed chwilą.
Możesz też reżyserować nagranie wprost. W tekście wpisujesz w nawiasach kwadratowych wskazówki, na przykład [laughs], czyli śmiech, albo [said angrily in French accent], czyli złość z francuskim akcentem. Tak samo dodasz dźwięki tła, jak [light rain] dla lekkiego deszczu. Według firmy nowy model wykonuje takie polecenia dokładniej niż poprzednie. Pełną składnię znaczników opisuje dokumentacja ElevenLabs.
Jeden głos w ponad 90 językach
Oba modele obsługują ponad 90 języków. ElevenLabs deklaruje, że głos nagrany w jednym języku mówi płynnie w każdym innym z akcentem rodzimego użytkownika. Zachowuje przy tym barwę oryginału i nie wraca w trakcie nagrania do pierwotnego akcentu. Zapowiedź nie wymienia listy języków, więc o polskim nic w niej nie ma.
Szybkie klonowanie głosu potrzebuje teraz 10 sekund nagrania. Model lepiej trzyma też ten sam głos w długich projektach, na przykład w audiobooku, gdzie narrator nie może się zmieniać między rozdziałami. Do najwierniejszych kopii głosu v4 obsługuje też profesjonalne klonowanie.
Liczby z zapowiedzi
Dane podaje producent, a pomiary pochodzą z września 2026.
| Co | Wynik |
|---|---|
| Ranking Artificial Analysis (Voice Arena) | 1. miejsce |
| Ślepe testy, odsetek słuchaczy wybierających v4 | ok. 75% (65–81% zależnie od rywala) |
| Czas do pierwszego dźwięku, szybsza odmiana v4 | ok. 150 ms |
| Czas do pierwszego dźwięku, rywale w teście | 262–814 ms |
| Liczba języków | ponad 90 |
W ślepych testach v4 zmierzył się między innymi z dwoma modelami Google: Gemini 3.8 Flash TTS i Gemini 3.8 Flash-Lite TTS. O pierwszym z nich pisaliśmy przy okazji jego ceny za godzinę polskiego nagrania. Szybsza odmiana jest przeznaczona dla głosowych agentów, bo zaczyna mówić szybciej, niż trwa typowa pauza w rozmowie dwóch osób.
Jak wypróbować
Oba modele są dostępne w ElevenCreative, czyli w aplikacji do tworzenia nagrań, w ElevenAgents dla agentów głosowych i w usługach dla programistów. Do pierwszych prób wystarczy darmowe konto. W zapowiedzi nie ma cen ani informacji, ile nagrania zmieści darmowy plan. Według firmy v4 pewniej łączy kolejne fragmenty w dłuższe nagranie. Skorzysta na tym praca w ElevenLabs Studio i w aplikacji ElevenLabs Reader.
- Czy Eleven v4 mówi po polsku?ElevenLabs podaje, że model obsługuje ponad 90 języków, ale w zapowiedzi nie ma ich listy. O polskim źródło nie mówi.
- Ile nagrania potrzeba do sklonowania głosu w Eleven v4?Według ElevenLabs szybkie klonowanie głosu wystarcza teraz na podstawie 10 sekund nagrania.
- Czym różni się szybsza odmiana od zwykłego Eleven v4?Szybsza odmiana wcześniej zaczyna mówić, po około 150 ms według pomiarów producenta. Jest przeznaczony dla głosowych agentów, które rozmawiają z ludźmi na żywo.
- ElevenLabs, blog „Introducing Eleven v4, our most emotive model”, dostęp 2026-09-29
Ten tekst napisał model AI na podstawie źródeł wymienionych wyżej. Liczby, daty i nazwy automat porównał ze źródłem, ale przed publikacją nie czytał go człowiek. Jak powstają teksty.
Widzisz błąd? Napisz, poprawiamy i dopisujemy notę o zmianie.

Wdraża systemy oparte na AI w firmach produkcyjnych i usługowych. Z modelami językowymi pracuje codziennie i wie, w czym potrafią zmyślać. Dlatego każda liczba w tekstach ma tu źródło, a teksty, które sam przeczytał, są oznaczone jako sprawdzone.
wszystkie teksty autora