Бесплатный синтез речи без лимита символов - Kokoro, Piper и eSpeak

Бесплатный синтез речи без лимита символов работает прямо в браузере. Текст превращается в речь на вашем компьютере. Без подписки и без регистрации.

Мы сравниваем четыре движка: Kokoro, Piper, Kitten и eSpeak NG. У каждого свои сильные стороны. Выберите тот, что подходит вашему устройству.

Почему облако вводит лимиты

Облачные сервисы берут плату за символы или минуты. Каждая генерация использует дорогие GPU-серверы. Счёт приходит вам.

Бесплатный план ElevenLabs даёт 10 000 кредитов в месяц. Это около 10 минут речи. Коммерческой лицензии нет. Она появляется на плане Starter за 6 долларов. Creator стоит 22 доллара, Pro 99 долларов.

Поэтому бесплатного плана едва хватает на одно видео. За качество нужно платить каждый месяц. Читайте статью о бесплатном аналоге ElevenLabs.

Локальный TTS в браузере

Современные браузеры запускают модели ИИ без сервера. Они используют две технологии: WebAssembly (WASM) и WebGPU.

WebAssembly выполняет код почти со скоростью обычного приложения. WebGPU даёт доступ к видеокарте. Если её нет, движок работает в режиме WASM.

Kokoro TTS: самый реалистичный голос

Kokoro звучит почти как человек. У модели 82 миллиона параметров. Она поддерживает 8 языков и 54 голоса, включая испанский, французский и китайский. Русского языка среди них нет.

Модель весит около 326 МБ и загружается один раз. Рекомендуется WebGPU, но она работает и на процессоре.

Kokoro хорош для аудиокниг, видео и подкастов.

Piper TTS: простой выбор для русского

Piper работает на обычном процессоре. Видеокарта не нужна. Он идёт даже на старом ноутбуке.

Русские голоса: Denis, Dmitri, Irina и Ruslan. Каждая модель весит около 60 МБ. Piper - движок по умолчанию на этом сайте. Подробнее в статье о русских голосах.

Когда использовать eSpeak NG или Kitten?

eSpeak NG не загружает модели. Он стартует сразу и поддерживает более 100 языков. Голос роботизированный, но хорошо подходит для экранных дикторов.

Kitten TTS - лёгкий экспериментальный движок. Модель меньше 25 МБ. У него только английские голоса.

Сравнение движков

ХарактеристикаKokoroPiperKitteneSpeak NG
Качество голосаУльтра-реалистичноеЕстественноеЛёгкоеРоботизированное
ТребованияWebGPU рекомендуется, fallback WASMCPUCPUМинимальные
Размер модели~326 МБ~60 МБменьше 25 МББез загрузки
Языки8, без русскогоМногие, с русскимТолько английскийБолее 100

Как создать речь без лимита

  1. Откройте генератор на главной странице.
  2. Выберите движок, например Piper.
  3. Выберите голос и темп.
  4. Вставьте текст, даже очень длинный.
  5. Нажмите «Создать и прослушать» или «Создать и скачать».

Движок сам делит длинные тексты на части. Можно вставить целую главу. Счётчика символов нет.

Итог

Лучший бесплатный синтез речи работает локально. Текст не покидает компьютер. Аккаунт и почта не нужны.

Выберите Kokoro для качества или Piper для русских голосов и скорости.

Субтитры SRT и VTT

Генератор создаёт и субтитры. После генерации речи нажмите "Скачать SRT" или "Скачать VTT". Одно предложение это один cue. SRT подходит для YouTube и видеоредакторов. VTT подходит для сайтов и браузеров. Субтитры создаются локально.

Частые вопросы (FAQ)

Неужели правда нет лимита символов?

Да. Синтез идёт на вашем устройстве. Счётчика символов и минут нет. Можно вставить целую главу книги.

Почему первая генерация идёт дольше?

Только в первый раз браузер загружает модель голоса. Модели весят от 20 до 326 МБ. Затем всё происходит мгновенно.

Можно использовать голос коммерчески?

Да. Kokoro и Kitten используют Apache-2.0, eSpeak NG - GPLv3, а Piper - открытую лицензию. Аудиофайл на 100% ваш.

Мой текст где-то сохраняется?

Нет. Всё работает локально через WebAssembly и WebGPU. Текст не отправляется на сервер.

Можно скачать субтитры SRT и VTT?

Да. После генерации речи нажмите "Скачать SRT" или "Скачать VTT".