Texto para voz grátis sem limite de caracteres funciona direto no seu navegador. O texto vira voz no seu computador. Sem assinatura e sem cadastro.
Comparamos quatro motores: Kokoro, Piper, Kitten e eSpeak NG. Cada um tem seus pontos fortes. Escolha o que combina com o seu aparelho.
Por que a nuvem impõe limites
Os serviços na nuvem cobram por caractere ou por minuto. Cada geração usa servidores GPU caros. A conta chega para você.
O plano gratuito do ElevenLabs dá 10.000 créditos por mês. São cerca de 10 minutos de voz. A licença comercial não está incluída. Ela vem no plano Starter por 6 dólares. O Creator custa 22 dólares, o Pro 99 dólares.
Por isso o plano gratuito mal dá para um vídeo. Pela qualidade é preciso pagar todo mês. Veja o artigo sobre a alternativa grátis ao ElevenLabs.
O TTS local no navegador
Os navegadores modernos rodam modelos de IA sem servidor. Usam duas tecnologias: WebAssembly (WASM) e WebGPU.
O WebAssembly executa o código quase na velocidade de um app. O WebGPU dá acesso à placa de vídeo. Se ela faltar, o motor continua no modo WASM.
- Sem custos de servidor.
- Sem limite de caracteres.
- Sem envio de dados.
- Funciona offline depois do download do modelo.
Kokoro TTS: a voz mais realista
Kokoro soa quase como um humano. O modelo tem 82 milhões de parâmetros. Ele suporta 8 idiomas e 54 vozes, incluindo espanhol, francês e chinês. Em português do Brasil oferece três vozes: pf_dora, pm_alex e pm_santa.
O modelo pesa cerca de 326 MB e é baixado uma vez. O WebGPU é recomendado, mas ele roda também na CPU.
Kokoro é ideal para audiolivros, vídeos e podcasts.
Piper TTS: a escolha simples para o português
Piper roda em um processador comum. Não precisa de placa de vídeo. Funciona até em um notebook antigo.
As vozes em português são Faber e Edresson, ambas com cerca de 60 MB. Piper é o motor padrão deste site. Veja o artigo sobre as vozes em português.
Quando usar o eSpeak NG ou o Kitten?
eSpeak NG não baixa modelos. Começa na hora e suporta mais de 100 idiomas. A voz é robótica, mas ótima para leitores de tela.
Kitten TTS é um motor leve e experimental. O modelo tem menos de 25 MB. Só tem vozes em inglês.
Comparação dos motores
| Característica | Kokoro | Piper | Kitten | eSpeak NG |
|---|---|---|---|---|
| Qualidade da voz | Ultra-realista | Natural, limpa | Leve | Robótica |
| Hardware | WebGPU recomendado, fallback WASM | CPU | CPU | Mínimo |
| Tamanho do modelo | ~326 MB | ~60 MB | menos de 25 MB | Sem download |
| Idiomas | 8, com português | Vários, com português | Só inglês | Mais de 100 |
Como gerar voz sem limite
- Abra o gerador na página inicial.
- Escolha um motor, por exemplo o Piper.
- Escolha a voz e a velocidade.
- Cole o texto, mesmo que seja muito longo.
- Clique em “Gerar e ouvir” ou “Gerar e baixar”.
O motor divide textos longos em partes. Você pode colar um capítulo inteiro. Não existe contador de caracteres.
Conclusão
A melhor síntese de voz grátis roda localmente. O texto não sai do computador. Você não precisa de conta nem e-mail.
Escolha o Kokoro pela qualidade, ou o Piper pelas vozes em português e pela rapidez.
Legendas SRT e VTT
O gerador também cria legendas. Depois de gerar a voz, clique em "Baixar SRT" ou "Baixar VTT". Uma frase é um cue. SRT serve para YouTube e editores de vídeo. VTT serve para sites e navegadores. As legendas são criadas localmente.
Perguntas frequentes (FAQ)
Existe mesmo um limite de caracteres?
Não. A síntese roda no seu aparelho. Não há contador de caracteres ou minutos. Você pode colar um capítulo inteiro.
Por que a primeira geração demora alguns segundos?
Só na primeira vez o navegador baixa o modelo da voz. Os modelos pesam de 20 a 326 MB. Depois tudo é instantâneo.
Posso usar a voz comercialmente?
Sim. Kokoro e Kitten usam Apache-2.0, o eSpeak NG GPLv3 e o Piper uma licença aberta. O arquivo de áudio é 100% seu.
Meu texto é armazenado?
Não. Tudo roda localmente com WebAssembly e WebGPU. O texto não é enviado a nenhum servidor.
Posso baixar legendas SRT e VTT?
Sim. Depois de gerar a voz, use os botões "Baixar SRT" ou "Baixar VTT".