Texto para voz grátis sem limite de caracteres - Kokoro, Piper e eSpeak

Texto para voz grátis sem limite de caracteres funciona direto no seu navegador. O texto vira voz no seu computador. Sem assinatura e sem cadastro.

Comparamos quatro motores: Kokoro, Piper, Kitten e eSpeak NG. Cada um tem seus pontos fortes. Escolha o que combina com o seu aparelho.

Por que a nuvem impõe limites

Os serviços na nuvem cobram por caractere ou por minuto. Cada geração usa servidores GPU caros. A conta chega para você.

O plano gratuito do ElevenLabs dá 10.000 créditos por mês. São cerca de 10 minutos de voz. A licença comercial não está incluída. Ela vem no plano Starter por 6 dólares. O Creator custa 22 dólares, o Pro 99 dólares.

Por isso o plano gratuito mal dá para um vídeo. Pela qualidade é preciso pagar todo mês. Veja o artigo sobre a alternativa grátis ao ElevenLabs.

O TTS local no navegador

Os navegadores modernos rodam modelos de IA sem servidor. Usam duas tecnologias: WebAssembly (WASM) e WebGPU.

O WebAssembly executa o código quase na velocidade de um app. O WebGPU dá acesso à placa de vídeo. Se ela faltar, o motor continua no modo WASM.

Kokoro TTS: a voz mais realista

Kokoro soa quase como um humano. O modelo tem 82 milhões de parâmetros. Ele suporta 8 idiomas e 54 vozes, incluindo espanhol, francês e chinês. Em português do Brasil oferece três vozes: pf_dora, pm_alex e pm_santa.

O modelo pesa cerca de 326 MB e é baixado uma vez. O WebGPU é recomendado, mas ele roda também na CPU.

Kokoro é ideal para audiolivros, vídeos e podcasts.

Piper TTS: a escolha simples para o português

Piper roda em um processador comum. Não precisa de placa de vídeo. Funciona até em um notebook antigo.

As vozes em português são Faber e Edresson, ambas com cerca de 60 MB. Piper é o motor padrão deste site. Veja o artigo sobre as vozes em português.

Quando usar o eSpeak NG ou o Kitten?

eSpeak NG não baixa modelos. Começa na hora e suporta mais de 100 idiomas. A voz é robótica, mas ótima para leitores de tela.

Kitten TTS é um motor leve e experimental. O modelo tem menos de 25 MB. Só tem vozes em inglês.

Comparação dos motores

CaracterísticaKokoroPiperKitteneSpeak NG
Qualidade da vozUltra-realistaNatural, limpaLeveRobótica
HardwareWebGPU recomendado, fallback WASMCPUCPUMínimo
Tamanho do modelo~326 MB~60 MBmenos de 25 MBSem download
Idiomas8, com portuguêsVários, com portuguêsSó inglêsMais de 100

Como gerar voz sem limite

  1. Abra o gerador na página inicial.
  2. Escolha um motor, por exemplo o Piper.
  3. Escolha a voz e a velocidade.
  4. Cole o texto, mesmo que seja muito longo.
  5. Clique em “Gerar e ouvir” ou “Gerar e baixar”.

O motor divide textos longos em partes. Você pode colar um capítulo inteiro. Não existe contador de caracteres.

Conclusão

A melhor síntese de voz grátis roda localmente. O texto não sai do computador. Você não precisa de conta nem e-mail.

Escolha o Kokoro pela qualidade, ou o Piper pelas vozes em português e pela rapidez.

Legendas SRT e VTT

O gerador também cria legendas. Depois de gerar a voz, clique em "Baixar SRT" ou "Baixar VTT". Uma frase é um cue. SRT serve para YouTube e editores de vídeo. VTT serve para sites e navegadores. As legendas são criadas localmente.

Perguntas frequentes (FAQ)

Existe mesmo um limite de caracteres?

Não. A síntese roda no seu aparelho. Não há contador de caracteres ou minutos. Você pode colar um capítulo inteiro.

Por que a primeira geração demora alguns segundos?

Só na primeira vez o navegador baixa o modelo da voz. Os modelos pesam de 20 a 326 MB. Depois tudo é instantâneo.

Posso usar a voz comercialmente?

Sim. Kokoro e Kitten usam Apache-2.0, o eSpeak NG GPLv3 e o Piper uma licença aberta. O arquivo de áudio é 100% seu.

Meu texto é armazenado?

Não. Tudo roda localmente com WebAssembly e WebGPU. O texto não é enviado a nenhum servidor.

Posso baixar legendas SRT e VTT?

Sim. Depois de gerar a voz, use os botões "Baixar SRT" ou "Baixar VTT".