Sintesi vocale gratis senza limite di caratteri - Kokoro, Piper ed eSpeak

La sintesi vocale gratis senza limite di caratteri gira direttamente nel tuo browser. Il testo diventa voce sul tuo computer. Senza abbonamento e senza registrazione.

Confrontiamo quattro motori: Kokoro, Piper, Kitten ed eSpeak NG. Ognuno ha i suoi punti di forza. Scegli quello adatto al tuo dispositivo.

Perché il cloud impone dei limiti

I servizi cloud fatturano a carattere o a minuto. Ogni generazione usa server GPU costosi. La fattura arriva a te.

Il piano gratuito di ElevenLabs offre 10.000 crediti al mese. Sono circa 10 minuti di voce. La licenza commerciale manca. Arriva con il piano Starter da 6 dollari. Creator costa 22 dollari, Pro 99 dollari.

Per questo il piano gratuito basta a malapena per un video. Per la qualità serve pagare ogni mese. Leggi l’articolo sull’alternativa gratis a ElevenLabs.

Il TTS locale nel browser

I browser moderni avviano modelli IA senza server. Usano due tecnologie: WebAssembly (WASM) e WebGPU.

WebAssembly esegue il codice quasi alla velocità di un’app. WebGPU dà accesso alla scheda grafica. Se manca, il motore continua in modalità WASM.

Kokoro TTS: la voce più realistica

Kokoro suona quasi come un umano. Il modello ha 82 milioni di parametri. Supporta 8 lingue e 54 voci, tra cui spagnolo, francese e cinese. In italiano offre due voci: if_sara e im_nicola.

Il modello pesa circa 326 MB e si scarica una volta. WebGPU è consigliato, ma funziona anche su CPU.

Kokoro è ideale per audiolibri, video e podcast.

Piper TTS: la scelta semplice per l’italiano

Piper gira su un processore normale. Non serve una scheda grafica. Funziona anche su un portatile vecchio.

Le voci italiane sono Paola e Riccardo. Paola pesa circa 61 MB, Riccardo circa 27 MB. Piper è il motore predefinito di questo sito. Vedi l’articolo sulle voci italiane.

Quando usare eSpeak NG o Kitten?

eSpeak NG non scarica modelli. Parte subito e supporta oltre 100 lingue. La voce è robotica, ma perfetta per gli screen reader.

Kitten TTS è un motore leggero e sperimentale. Il modello è sotto i 25 MB. Ha solo voci inglesi.

Confronto dei motori

CaratteristicaKokoroPiperKitteneSpeak NG
Qualità della voceUltra-realisticaNaturale, pulitaLeggeraRobotica
HardwareWebGPU consigliato, fallback WASMCPUCPUMinimo
Dimensione modello~326 MB~20-61 MBsotto 25 MBNessun download
Lingue8, con l’italianoMolte, con l’italianoSolo ingleseOltre 100

Come generare voce senza limiti

  1. Apri il generatore nella pagina principale.
  2. Scegli un motore, per esempio Piper.
  3. Scegli voce e velocità.
  4. Incolla il testo, anche molto lungo.
  5. Clicca su “Genera e ascolta” o “Genera e scarica”.

Il motore divide i testi lunghi in frammenti. Puoi incollare un intero capitolo. Non c’è un contatore di caratteri.

Conclusione

La migliore sintesi vocale gratis gira in locale. Il testo non lascia il computer. Non servono account né email.

Scegli Kokoro per la qualità, oppure Piper per le voci italiane e la velocità.

Sottotitoli SRT e VTT

Il generatore crea anche i sottotitoli. Dopo la generazione, clicca su "Scarica SRT" o "Scarica VTT". Una frase è un cue. SRT va bene per YouTube e i programmi video. VTT va bene per siti e browser. I sottotitoli sono creati in locale.

Domande frequenti (FAQ)

C’è davvero un limite di caratteri?

No. La sintesi gira sul tuo dispositivo. Non ci sono contatori di caratteri o minuti. Puoi incollare un intero capitolo.

Perché la prima generazione richiede qualche secondo?

Solo la prima volta il browser scarica il modello della voce. I modelli pesano da 20 a 326 MB. Poi tutto è immediato.

Posso usare la voce per uso commerciale?

Sì. Kokoro e Kitten usano Apache-2.0, eSpeak NG GPLv3 e Piper una licenza aperta. Il file audio è tuo al 100%.

Il mio testo viene salvato?

No. Tutto avviene in locale con WebAssembly e WebGPU. Il testo non viene inviato a nessun server.

Posso scaricare sottotitoli SRT e VTT?

Sì. Dopo la generazione, usa i pulsanti "Scarica SRT" o "Scarica VTT".