Narzędzia

ElevenLabs wypuszcza Eleven v4. Głos AI śmieje się na komendę i mówi w ponad 90 językach

ElevenLabs udostępnił 28 września model Eleven v4 i jego szybszą odmianę do rozmów na żywo. Głos ma sam dobierać emocje do tekstu, słuchać wskazówek w nawiasach i mówić w ponad 90 językach tym samym brzmieniem.

Łukasz Niesyto
prowadzi serwis · wdraża systemy AI w firmach
Opublikowano 2 min czytania
AITekst przygotowany przez AI na podstawie źródła: elevenlabs.io · jak powstaje
Zdjęcie: dwie maski teatralne zrobione z siatki mikrofonu, uśmiechnięta jest czerwona, smutna stalowa

ElevenLabs wypuścił 28 września Eleven v4, nowy model zamieniający tekst na mowę, oraz jego szybszą odmianę do rozmów na żywo. Dotyczy to osób, które nagrywają lektora do filmów, podcastów i reklam, a także firm budujących głosowych konsultantów. Oba modele działają już w aplikacjach ElevenLabs i w usługach dla programistów. Zapowiedź, którą podpisali Mati Staniszewski i Piotr Dąbkowski, jest na blogu ElevenLabs.

Głos, który gra, a nie tylko czyta

Starsze modele głosowe czytają tekst poprawnie, ale płasko. ElevenLabs podaje przykład zdania „Musisz zachować spokój”. Lekarz powie je łagodnie do przestraszonego pacjenta, a postać w grze wykrzyczy do swojego oddziału przed walką. Eleven v4 ma sam odczytać z tekstu ton, tempo i emocje, a przy kilku mówiących reagować na to, co padło przed chwilą.

Możesz też reżyserować nagranie wprost. W tekście wpisujesz w nawiasach kwadratowych wskazówki, na przykład [laughs], czyli śmiech, albo [said angrily in French accent], czyli złość z francuskim akcentem. Tak samo dodasz dźwięki tła, jak [light rain] dla lekkiego deszczu. Według firmy nowy model wykonuje takie polecenia dokładniej niż poprzednie. Pełną składnię znaczników opisuje dokumentacja ElevenLabs.

Jeden głos w ponad 90 językach

Oba modele obsługują ponad 90 języków. ElevenLabs deklaruje, że głos nagrany w jednym języku mówi płynnie w każdym innym z akcentem rodzimego użytkownika. Zachowuje przy tym barwę oryginału i nie wraca w trakcie nagrania do pierwotnego akcentu. Zapowiedź nie wymienia listy języków, więc o polskim nic w niej nie ma.

Szybkie klonowanie głosu potrzebuje teraz 10 sekund nagrania. Model lepiej trzyma też ten sam głos w długich projektach, na przykład w audiobooku, gdzie narrator nie może się zmieniać między rozdziałami. Do najwierniejszych kopii głosu v4 obsługuje też profesjonalne klonowanie.

Liczby z zapowiedzi

Dane podaje producent, a pomiary pochodzą z września 2026.

CoWynik
Ranking Artificial Analysis (Voice Arena)1. miejsce
Ślepe testy, odsetek słuchaczy wybierających v4ok. 75% (65–81% zależnie od rywala)
Czas do pierwszego dźwięku, szybsza odmiana v4ok. 150 ms
Czas do pierwszego dźwięku, rywale w teście262–814 ms
Liczba językówponad 90

W ślepych testach v4 zmierzył się między innymi z dwoma modelami Google: Gemini 3.8 Flash TTS i Gemini 3.8 Flash-Lite TTS. O pierwszym z nich pisaliśmy przy okazji jego ceny za godzinę polskiego nagrania. Szybsza odmiana jest przeznaczona dla głosowych agentów, bo zaczyna mówić szybciej, niż trwa typowa pauza w rozmowie dwóch osób.

Jak wypróbować

Oba modele są dostępne w ElevenCreative, czyli w aplikacji do tworzenia nagrań, w ElevenAgents dla agentów głosowych i w usługach dla programistów. Do pierwszych prób wystarczy darmowe konto. W zapowiedzi nie ma cen ani informacji, ile nagrania zmieści darmowy plan. Według firmy v4 pewniej łączy kolejne fragmenty w dłuższe nagranie. Skorzysta na tym praca w ElevenLabs Studio i w aplikacji ElevenLabs Reader.

Źródła
  1. ElevenLabs, blog „Introducing Eleven v4, our most emotive model”, dostęp 2026-09-29

Ten tekst napisał model AI na podstawie źródeł wymienionych wyżej. Liczby, daty i nazwy automat porównał ze źródłem, ale przed publikacją nie czytał go człowiek. Jak powstają teksty.

Widzisz błąd? Napisz, poprawiamy i dopisujemy notę o zmianie.

Łukasz Niesyto
Łukasz Niesyto

Wdraża systemy oparte na AI w firmach produkcyjnych i usługowych. Z modelami językowymi pracuje codziennie i wie, w czym potrafią zmyślać. Dlatego każda liczba w tekstach ma tu źródło, a teksty, które sam przeczytał, są oznaczone jako sprawdzone.

wszystkie teksty autora

Powiązane

28 września 2026

Gemini daje notatniki do nauki kontom firmowym i szkolnym. W Polsce pojawią się za kilka tygodni

Narzędziaworkspaceupdates.googleblog.com2 min
28 września 2026

ElevenLabs udostępnia API do obrazów i wideo. Sklep dodaje produkt, a szablon robi zdjęcia i reklamy

Narzędziaelevenlabs.io2 min
28 września 2026

Claude ma portal do zgłaszania wtyczek. Każda przechodzi skan bezpieczeństwa i przegląd przed publikacją

Narzędziaclaude.com2 min