免费文字转语音,无字符限制 - Kokoro、Piper 和 eSpeak

免费文字转语音,无字符限制,直接在浏览器里运行。文字在你的电脑上变成语音。不用订阅,也不用注册。

我们对比四个引擎:Kokoro、Piper、Kitten 和 eSpeak NG。每个都有自己的优点。选一个适合你设备的。

为什么云端有各种限制

云服务按字符或按分钟收费。每次生成都要用昂贵的 GPU 服务器。账单最后由你承担。

ElevenLabs 免费版每月只有 10000 额度,大约 10 分钟语音,而且不含商用授权。商用授权要从每月 6 美元的 Starter 开始。Creator 是 22 美元,Pro 是 99 美元。

所以免费版只够做一条视频。想要质量就得每月付费。详见免费 ElevenLabs 替代方案。

浏览器里的本地 TTS

现代浏览器不用服务器就能运行 AI 模型。靠的是两项技术:WebAssembly(WASM)和 WebGPU。

WebAssembly 让代码几乎以原生速度运行。WebGPU 使用你的显卡。没有显卡时,引擎会自动切换到 WASM 模式。

Kokoro TTS:最真实的语音

Kokoro 听起来几乎像真人。模型有 8200 万个参数。它支持 8 种语言和 54 个声音,包括西班牙语、法语和日语。中文有 8 个声音,例如 zf_xiaoxiao。

模型约 326 MB,只需下载一次。建议使用 WebGPU,但也能在 CPU 上运行。

Kokoro 适合有声书、视频和播客。

Piper TTS:中文的实用选择

Piper 在普通处理器上运行,不需要显卡。老笔记本也能用。

中文声音有 Huayan、Chaowen 和 Xiao_ya。模型大多约 60 MB。Piper 是本网站的默认引擎。详见中文语音介绍。

什么时候用 eSpeak NG 或 Kitten?

eSpeak NG 不下载模型。它马上启动,支持 100 多种语言。声音偏机器,但很适合屏幕阅读器。

Kitten TTS 是轻量实验引擎。模型不到 25 MB。只有英语声音。

引擎对比

项目KokoroPiperKitteneSpeak NG
语音质量超真实自然清晰轻量机器音
硬件建议 WebGPU,可用 WASMCPUCPU极低
模型大小约 326 MB约 60 MB不到 25 MB无需下载
语言8 种,含中文多种,含中文仅英语100 多种

如何生成无限制语音

  1. 打开首页的生成器。
  2. 选择引擎,例如 Piper。
  3. 选择声音和语速。
  4. 粘贴文本,多长都可以。
  5. 点击“生成并试听”或“生成并下载”。

引擎会自动把长文本切成片段。你可以粘贴整章内容。没有字符计数器。

总结

最好的免费文字转语音在本地运行。文字不会离开电脑。也不需要账号或邮箱。

想要质量就选 Kokoro,想要中文声音和速度就选 Piper。

SRT 和 VTT 字幕

生成器也会生成字幕。生成语音后,点击“下载 SRT”或“下载 VTT”。一句话就是一个 cue。SRT 适合 YouTube 和视频软件。VTT 适合网页和浏览器。字幕在本地生成。

常见问题(FAQ)

真的没有字符限制吗?

是的。语音在你的设备上生成。没有字符或分钟计数器。你可以粘贴整章内容。

为什么第一次生成要等几秒?

只有第一次,浏览器需要下载声音模型。模型从 20 MB 到 326 MB。之后每次生成都是瞬间完成。

语音可以商用吗?

可以。Kokoro 和 Kitten 使用 Apache-2.0,eSpeak NG 使用 GPLv3,Piper 使用开源许可。音频文件完全属于你。

我的文字会被保存吗?

不会。一切都通过 WebAssembly 和 WebGPU 在本地运行。文字不会发送到任何服务器。

可以下载 SRT 和 VTT 字幕吗?

可以。生成语音后,点击“下载 SRT”或“下载 VTT”。