Kostenlose Text-zu-Sprache ohne Zeichenlimit - Kokoro, Piper und eSpeak

Kostenlose Text-zu-Sprache ohne Zeichenlimit läuft direkt in deinem Browser. Der Text wird auf deinem Computer in Sprache umgewandelt. Ohne Abo und ohne Anmeldung.

Wir vergleichen vier Engines: Kokoro, Piper, Kitten und eSpeak NG. Jede hat andere Stärken. Wähle die, die zu deinem Gerät passt.

Warum verlangen Cloud-Dienste Limits?

Cloud-Dienste rechnen nach Zeichen oder Minuten ab. Jede Aufnahme kostet teure GPU-Server. Die Rechnung zahlst du.

Der kostenlose Plan von ElevenLabs gibt 10 000 Credits pro Monat. Das sind etwa 10 Minuten Sprache. Eine kommerzielle Lizenz fehlt. Erst der Starter-Plan für 6 Dollar enthält sie. Creator kostet 22 Dollar, Pro 99 Dollar.

Deshalb reicht der kostenlose Plan kaum für ein Video. Für Qualität musst du monatlich zahlen. Mehr dazu im Artikel zur kostenlosen ElevenLabs Alternative.

Lokales TTS im Browser

Moderne Browser starten KI-Modelle ohne Server. Sie nutzen zwei Technologien: WebAssembly (WASM) und WebGPU.

WebAssembly führt Code fast so schnell wie eine normale App aus. WebGPU gibt Zugriff auf die Grafikkarte. Fehlt die Karte, läuft die Engine im WASM-Modus weiter.

Kokoro TTS: die realistischste Stimme

Kokoro TTS klingt fast wie ein Mensch. Das Modell hat 82 Millionen Parameter. Es unterstützt 8 Sprachen und 54 Stimmen, darunter Spanisch, Französisch und Chinesisch. Deutsch ist nicht dabei.

Das Modell ist etwa 326 MB groß und wird einmal geladen. Danach arbeitet es aus dem Cache. WebGPU ist empfehlenswert, aber es läuft auch auf der CPU.

Für Hörbücher, Videos und Podcasts ist Kokoro eine gute Wahl.

Piper TTS: der beste Kompromiss für Deutsch

Piper TTS läuft auf einem normalen Prozessor. Eine Grafikkarte ist nicht nötig. Es funktioniert auch auf einem älteren Laptop.

Deutsche Stimmen sind Thorsten, Kerstin, Karlsson, Ramona, Eva_k, Mls und Pavoque. Die meisten Modelle sind etwa 60 MB groß, Thorsten high etwa 109 MB. Piper ist die Standard-Engine dieser Seite. Mehr im Artikel zu deutschen KI-Stimmen.

Wann eSpeak NG oder Kitten?

eSpeak NG lädt keine Modelle. Es startet sofort und unterstützt über 100 Sprachen. Die Stimme klingt robotisch, eignet sich aber gut für Screenreader.

Kitten TTS ist eine leichte Test-Engine. Das Modell ist unter 25 MB groß. Es hat nur englische Stimmen, auf Deutsch funktioniert es nicht.

Vergleich der Engines

MerkmalKokoroPiperKitteneSpeak NG
StimmqualitätUltra-realistischNatürlich, klarLeichtRobotisch
HardwareWebGPU empfohlen, WASM-FallbackCPUCPUMinimal
Modellgröße~326 MB~20-109 MBunter 25 MBKein Download
Sprachen8, kein DeutschViele, mit DeutschNur EnglischÜber 100

So erzeugst du Sprache ohne Limit

  1. Öffne den Generator auf der Startseite.
  2. Wähle eine Engine, zum Beispiel Piper.
  3. Wähle Stimme und Tempo.
  4. Füge den Text ein, auch wenn er sehr lang ist.
  5. Klicke auf „Erzeugen & anhören” oder „Erzeugen & herunterladen”.

Die Engine teilt lange Texte in Abschnitte. Du kannst ein ganzes Kapitel einfügen. Einen Zeichenzähler gibt es nicht.

Fazit

Die beste kostenlose Text-zu-Sprache läuft lokal. Dein Text verlässt den Computer nicht. Du brauchst kein Konto und keine E-Mail.

Nimm Kokoro für maximale Qualität oder Piper für deutsche Stimmen und Tempo.

Untertitel als SRT und VTT

Der Generator erstellt auch Untertitel. Klicke nach der Sprachausgabe auf "SRT herunterladen" oder "VTT herunterladen". Ein Satz ist ein Cue. SRT passt zu YouTube und Videoschnitt. VTT passt zu Webseiten und Browsern. Untertitel entstehen lokal.

Häufige Fragen (FAQ)

Gibt es wirklich kein Zeichenlimit?

Ja. Die Synthese läuft auf deinem Gerät. Es gibt keinen Zähler für Zeichen oder Minuten. Du kannst sogar ein ganzes Buchkapitel einfügen.

Warum dauert die erste Erzeugung etwas?

Nur beim ersten Mal lädt der Browser das Stimmmodell. Modelle sind 20 bis 326 MB groß. Danach geht jede Erzeugung sofort.

Darf ich die Stimme kommerziell nutzen?

Ja. Kokoro und Kitten nutzen Apache-2.0, eSpeak NG GPLv3 und Piper eine offene Lizenz. Die Audiodatei gehört zu 100% dir.

Wird mein Text gespeichert?

Nein. Alles läuft lokal über WebAssembly und WebGPU. Der Text wird an keinen Server gesendet.

Kann ich SRT- und VTT-Untertitel herunterladen?

Ja. Klicke nach der Sprachausgabe auf "SRT herunterladen" oder "VTT herunterladen".