La synthèse vocale gratuite sans limite de caractères tourne directement dans ton navigateur. Le texte devient de la voix sur ton ordinateur. Sans abonnement et sans inscription.
Nous comparons quatre moteurs : Kokoro, Piper, Kitten et eSpeak NG. Chacun a ses atouts. Choisis celui qui correspond à ton matériel.
Pourquoi le cloud impose des limites
Les services cloud facturent au caractère ou à la minute. Chaque génération utilise des serveurs GPU coûteux. La facture arrive chez toi.
Le plan gratuit d’ElevenLabs donne 10 000 crédits par mois. Cela fait environ 10 minutes de voix. La licence commerciale manque. Elle arrive avec le plan Starter à 6 dollars. Creator coûte 22 dollars, Pro 99 dollars.
C’est pourquoi le plan gratuit suffit à peine pour une vidéo. Pour la qualité, il faut payer chaque mois. Voir notre article sur l’alternative gratuite à ElevenLabs.
Le TTS local dans le navigateur
Les navigateurs modernes lancent des modèles IA sans serveur. Ils utilisent deux technologies : WebAssembly (WASM) et WebGPU.
WebAssembly exécute le code presque à la vitesse d’une application. WebGPU donne accès à la carte graphique. Sans carte, le moteur continue en mode WASM.
- Aucun coût de serveur.
- Aucune limite de caractères.
- Aucun envoi de données.
- Fonctionne hors ligne après le téléchargement du modèle.
Kokoro TTS : la voix la plus réaliste
Kokoro sonne presque comme un humain. Le modèle compte 82 millions de paramètres. Il gère 8 langues et 54 voix, dont l’espagnol, le japonais et le chinois. En français, il propose une voix : ff_siwis.
Le modèle pèse environ 326 MB et se télécharge une fois. WebGPU est recommandé, mais il fonctionne aussi sur CPU.
Kokoro convient aux livres audio, aux vidéos et aux podcasts.
Piper TTS : le meilleur choix pour le français
Piper tourne sur un processeur classique. Aucune carte graphique n’est nécessaire. Il fonctionne même sur un vieux portable.
Les voix françaises sont Siwis, Tom, Gilles, Mls et Upmc. La plupart pèsent environ 60 MB. Piper est le moteur par défaut de ce site. Voir l’article sur les voix françaises.
Quand utiliser eSpeak NG ou Kitten ?
eSpeak NG ne télécharge aucun modèle. Il démarre tout de suite et gère plus de 100 langues. La voix est robotique, mais parfaite pour les lecteurs d’écran.
Kitten TTS est un moteur léger et expérimental. Son modèle fait moins de 25 MB. Il n’a que des voix anglaises.
Comparaison des moteurs
| Critère | Kokoro | Piper | Kitten | eSpeak NG |
|---|---|---|---|---|
| Qualité de la voix | Ultra-réaliste | Naturelle, claire | Légère | Robotique |
| Matériel | WebGPU recommandé, fallback WASM | CPU | CPU | Minimal |
| Taille du modèle | ~326 MB | ~20-109 MB | moins de 25 MB | Aucun téléchargement |
| Langues | 8, dont le français | Beaucoup, dont le français | Anglais uniquement | Plus de 100 |
Comment générer de la voix sans limite
- Ouvre le générateur sur la page d’accueil.
- Choisis un moteur, par exemple Piper.
- Choisis une voix et la vitesse.
- Colle ton texte, même très long.
- Clique sur « Générer et écouter » ou « Générer et télécharger ».
Le moteur découpe les longs textes en morceaux. Tu peux coller un chapitre entier. Il n’y a aucun compteur de caractères.
Conclusion
La meilleure synthèse vocale gratuite tourne en local. Ton texte ne quitte pas l’ordinateur. Tu n’as pas besoin de compte ni d’e-mail.
Prends Kokoro pour la qualité, ou Piper pour les voix françaises et la rapidité.
Sous-titres SRT et VTT
Le générateur crée aussi des sous-titres. Après la génération, clique sur "Télécharger SRT" ou "Télécharger VTT". Une phrase est un cue. Le SRT convient à YouTube et aux logiciels vidéo. Le VTT convient aux sites et aux navigateurs. Les sous-titres sont créés en local.
Questions fréquentes (FAQ)
Y a-t-il vraiment une limite de caractères ?
Non. La synthèse tourne sur ton appareil. Aucun compteur de caractères ni de minutes. Tu peux coller un chapitre entier.
Pourquoi la première génération prend-elle quelques secondes ?
Seule la première fois, le navigateur télécharge le modèle de voix. Les modèles pèsent de 20 à 326 MB. Ensuite tout est instantané.
Puis-je utiliser la voix à des fins commerciales ?
Oui. Kokoro et Kitten utilisent Apache-2.0, eSpeak NG GPLv3 et Piper une licence ouverte. Le fichier audio t’appartient.
Mon texte est-il enregistré ?
Non. Tout se passe en local via WebAssembly et WebGPU. Le texte n’est envoyé à aucun serveur.
Puis-je télécharger des sous-titres SRT et VTT ?
Oui. Après la génération, utilise les boutons "Télécharger SRT" ou "Télécharger VTT".