Бесплатный синтез речи без лимита символов работает прямо в браузере. Текст превращается в речь на вашем компьютере. Без подписки и без регистрации.
Мы сравниваем четыре движка: Kokoro, Piper, Kitten и eSpeak NG. У каждого свои сильные стороны. Выберите тот, что подходит вашему устройству.
Почему облако вводит лимиты
Облачные сервисы берут плату за символы или минуты. Каждая генерация использует дорогие GPU-серверы. Счёт приходит вам.
Бесплатный план ElevenLabs даёт 10 000 кредитов в месяц. Это около 10 минут речи. Коммерческой лицензии нет. Она появляется на плане Starter за 6 долларов. Creator стоит 22 доллара, Pro 99 долларов.
Поэтому бесплатного плана едва хватает на одно видео. За качество нужно платить каждый месяц. Читайте статью о бесплатном аналоге ElevenLabs.
Локальный TTS в браузере
Современные браузеры запускают модели ИИ без сервера. Они используют две технологии: WebAssembly (WASM) и WebGPU.
WebAssembly выполняет код почти со скоростью обычного приложения. WebGPU даёт доступ к видеокарте. Если её нет, движок работает в режиме WASM.
- Никаких затрат на серверы.
- Никакого лимита символов.
- Никакой передачи данных.
- Работает офлайн после загрузки модели.
Kokoro TTS: самый реалистичный голос
Kokoro звучит почти как человек. У модели 82 миллиона параметров. Она поддерживает 8 языков и 54 голоса, включая испанский, французский и китайский. Русского языка среди них нет.
Модель весит около 326 МБ и загружается один раз. Рекомендуется WebGPU, но она работает и на процессоре.
Kokoro хорош для аудиокниг, видео и подкастов.
Piper TTS: простой выбор для русского
Piper работает на обычном процессоре. Видеокарта не нужна. Он идёт даже на старом ноутбуке.
Русские голоса: Denis, Dmitri, Irina и Ruslan. Каждая модель весит около 60 МБ. Piper - движок по умолчанию на этом сайте. Подробнее в статье о русских голосах.
Когда использовать eSpeak NG или Kitten?
eSpeak NG не загружает модели. Он стартует сразу и поддерживает более 100 языков. Голос роботизированный, но хорошо подходит для экранных дикторов.
Kitten TTS - лёгкий экспериментальный движок. Модель меньше 25 МБ. У него только английские голоса.
Сравнение движков
| Характеристика | Kokoro | Piper | Kitten | eSpeak NG |
|---|---|---|---|---|
| Качество голоса | Ультра-реалистичное | Естественное | Лёгкое | Роботизированное |
| Требования | WebGPU рекомендуется, fallback WASM | CPU | CPU | Минимальные |
| Размер модели | ~326 МБ | ~60 МБ | меньше 25 МБ | Без загрузки |
| Языки | 8, без русского | Многие, с русским | Только английский | Более 100 |
Как создать речь без лимита
- Откройте генератор на главной странице.
- Выберите движок, например Piper.
- Выберите голос и темп.
- Вставьте текст, даже очень длинный.
- Нажмите «Создать и прослушать» или «Создать и скачать».
Движок сам делит длинные тексты на части. Можно вставить целую главу. Счётчика символов нет.
Итог
Лучший бесплатный синтез речи работает локально. Текст не покидает компьютер. Аккаунт и почта не нужны.
Выберите Kokoro для качества или Piper для русских голосов и скорости.
Субтитры SRT и VTT
Генератор создаёт и субтитры. После генерации речи нажмите "Скачать SRT" или "Скачать VTT". Одно предложение это один cue. SRT подходит для YouTube и видеоредакторов. VTT подходит для сайтов и браузеров. Субтитры создаются локально.
Частые вопросы (FAQ)
Неужели правда нет лимита символов?
Да. Синтез идёт на вашем устройстве. Счётчика символов и минут нет. Можно вставить целую главу книги.
Почему первая генерация идёт дольше?
Только в первый раз браузер загружает модель голоса. Модели весят от 20 до 326 МБ. Затем всё происходит мгновенно.
Можно использовать голос коммерчески?
Да. Kokoro и Kitten используют Apache-2.0, eSpeak NG - GPLv3, а Piper - открытую лицензию. Аудиофайл на 100% ваш.
Мой текст где-то сохраняется?
Нет. Всё работает локально через WebAssembly и WebGPU. Текст не отправляется на сервер.
Можно скачать субтитры SRT и VTT?
Да. После генерации речи нажмите "Скачать SRT" или "Скачать VTT".