Darmowy syntezator mowy bez limitu znaków działa w Twojej przeglądarce. Zamienia tekst na mowę na Twoim komputerze. Nie ma subskrypcji ani rejestracji.
Porównujemy cztery silniki: Kokoro, Piper, Kitten i eSpeak NG. Każdy ma inne zalety. Wybierz ten, który pasuje do Twojego sprzętu.
Dlaczego chmurowe generatory nakładają limity?
Serwisy w chmurze liczą za znaki albo minuty. Każde nagranie zużywa drogie serwery GPU. Koszt płaci użytkownik.
Darmowy plan ElevenLabs daje 10 000 kredytów miesięcznie. To około 10 minut mowy. Licencji komercyjnej nie ma. Daje ją dopiero plan Starter za 6 dolarów. Creator kosztuje 22 dolary, a Pro 99 dolarów miesięcznie.
Dlatego darmowe plany wystarczają na jeden film. Za jakość trzeba płacić co miesiąc. Więcej w artykule o darmowej alternatywie dla ElevenLabs.
Lokalny TTS w przeglądarce
Przeglądarki potrafią uruchamiać modele AI bez serwerów. Używają do tego dwóch technologii: WebAssembly (WASM) i WebGPU.
WebAssembly uruchamia kod w przeglądarce prawie tak szybko jak aplikacja. WebGPU daje dostęp do karty graficznej. Gdy karty brakuje, silnik działa dalej w trybie WASM.
- Brak kosztów serwerów.
- Brak limitu znaków.
- Brak wysyłania danych.
- Działanie offline po pobraniu modelu.
Kokoro TTS: najbardziej realistyczny głos
Kokoro TTS brzmi niemal jak człowiek. Ma 82 miliony parametrów. Obsługuje 8 języków i 54 głosy. Wśród nich są hiszpański, francuski, japoński i chiński. Polskiego głosu nie ma.
Model waży około 326 MB i pobiera się raz. Potem działa z pamięci podręcznej. Zalecamy WebGPU, ale silnik pójdzie też na samym procesorze.
Kokoro nadaje się do audiobooków, filmów i podcastów.
Piper TTS: dobry balans dla większości
Piper TTS działa na zwykłym procesorze. Nie potrzebuje karty graficznej. Pójdzie nawet na starym laptopie.
Polskie głosy to Gosia, Darkman, Mc_speech, Mls_6892 i Bass. Większość modeli waży około 60 MB. Bass waży około 109 MB. Piper jest domyślnym silnikiem naszej strony. Więcej w artykule o polskich głosach Piper.
Dla porównania: dawniej polskim hitem była Ivona. Dziś jej rolę przejmuje właśnie Piper. Więcej o dawnym syntezatorze mowy Ivona.
Kiedy użyć eSpeak NG albo Kitten?
eSpeak NG nie pobiera modeli. Działa od razu i obsługuje ponad 100 języków. Głos jest robotyczny, ale świetnie sprawdza się w czytnikach ekranu.
Kitten TTS to lekki silnik testowy. Model ma mniej niż 25 MB. Ma tylko angielskie głosy, więc po polsku nie zadziała.
Porównanie silników
| Cecha | Kokoro TTS | Piper TTS | Kitten TTS | eSpeak NG |
|---|---|---|---|---|
| Jakość głosu | Ultra-realistyczny | Naturalny, czysty | Lekki, płynny | Robotyczny |
| Wymagania | WebGPU zalecane, fallback WASM | Niskie, CPU | Bardzo niskie, CPU | Minimalne |
| Rozmiar modelu | ~326 MB | ~20-109 MB | poniżej 25 MB | Bez pobierania |
| Języki | 8, bez polskiego | Setki głosów, w tym polskie | Tylko angielski | Ponad 100 języków |
| Zastosowanie | Audiobooki, wideo | Lektor, komunikaty | Słabsze komputery | Dostępność |
Jak wygenerować mowę bez limitu
- Otwórz generator na stronie głównej.
- Wybierz silnik, na przykład Piper.
- Wybierz głos i tempo.
- Wklej tekst, nawet bardzo długi.
- Kliknij „Generuj i słuchaj” albo „Generuj i pobierz”.
Silnik dzieli długie teksty na fragmenty. Możesz wkleić cały rozdział książki. Licznika znaków nie ma.
Podsumowanie
Najlepszy darmowy syntezator mowy działa lokalnie. Twój tekst nie opuszcza komputera. Nie musisz zakładać konta ani podawać maila.
Wybierz Kokoro do jakości albo Piper do polskich głosów i szybkości. Generuj tyle, ile chcesz.
Napisy SRT i VTT
Generator tworzy także napisy. Po wygenerowaniu mowy kliknij "Pobierz SRT" albo "Pobierz VTT". Jedno zdanie to jedno cue. SRT pasuje do YouTube i programów wideo. VTT pasuje do stron i przeglądarek. Napisy powstają lokalnie.
Najczęstsze pytania (FAQ)
Czy naprawdę nie ma limitu znaków?
Tak. Synteza działa na Twoim urządzeniu. Nie ma licznika znaków ani minut. Możesz wkleić nawet cały rozdział książki.
Jak długo trwa pierwsze generowanie?
Tylko pierwszy raz przeglądarka pobiera model głosu. Modele ważą od 20 MB do 326 MB. Kolejne generowania są natychmiastowe.
Czy mogę użyć głosu komercyjnie?
Tak. Kokoro i Kitten mają licencję Apache-2.0, eSpeak NG GPLv3, a Piper licencję otwartą. Plik audio jest w 100% Twój.
Czy moje teksty są zapisywane?
Nie. Wszystko dzieje się lokalnie przez WebAssembly i WebGPU. Tekst nie jest wysyłany na żaden serwer.
Czy mogę pobrać napisy SRT i VTT?
Tak. Po wygenerowaniu mowy użyj przycisków "Pobierz SRT" albo "Pobierz VTT".