免费文字转语音,无字符限制,直接在浏览器里运行。文字在你的电脑上变成语音。不用订阅,也不用注册。
我们对比四个引擎:Kokoro、Piper、Kitten 和 eSpeak NG。每个都有自己的优点。选一个适合你设备的。
为什么云端有各种限制
云服务按字符或按分钟收费。每次生成都要用昂贵的 GPU 服务器。账单最后由你承担。
ElevenLabs 免费版每月只有 10000 额度,大约 10 分钟语音,而且不含商用授权。商用授权要从每月 6 美元的 Starter 开始。Creator 是 22 美元,Pro 是 99 美元。
所以免费版只够做一条视频。想要质量就得每月付费。详见免费 ElevenLabs 替代方案。
浏览器里的本地 TTS
现代浏览器不用服务器就能运行 AI 模型。靠的是两项技术:WebAssembly(WASM)和 WebGPU。
WebAssembly 让代码几乎以原生速度运行。WebGPU 使用你的显卡。没有显卡时,引擎会自动切换到 WASM 模式。
- 没有服务器成本。
- 没有字符限制。
- 不上传任何数据。
- 下载模型后可离线使用。
Kokoro TTS:最真实的语音
Kokoro 听起来几乎像真人。模型有 8200 万个参数。它支持 8 种语言和 54 个声音,包括西班牙语、法语和日语。中文有 8 个声音,例如 zf_xiaoxiao。
模型约 326 MB,只需下载一次。建议使用 WebGPU,但也能在 CPU 上运行。
Kokoro 适合有声书、视频和播客。
Piper TTS:中文的实用选择
Piper 在普通处理器上运行,不需要显卡。老笔记本也能用。
中文声音有 Huayan、Chaowen 和 Xiao_ya。模型大多约 60 MB。Piper 是本网站的默认引擎。详见中文语音介绍。
什么时候用 eSpeak NG 或 Kitten?
eSpeak NG 不下载模型。它马上启动,支持 100 多种语言。声音偏机器,但很适合屏幕阅读器。
Kitten TTS 是轻量实验引擎。模型不到 25 MB。只有英语声音。
引擎对比
| 项目 | Kokoro | Piper | Kitten | eSpeak NG |
|---|---|---|---|---|
| 语音质量 | 超真实 | 自然清晰 | 轻量 | 机器音 |
| 硬件 | 建议 WebGPU,可用 WASM | CPU | CPU | 极低 |
| 模型大小 | 约 326 MB | 约 60 MB | 不到 25 MB | 无需下载 |
| 语言 | 8 种,含中文 | 多种,含中文 | 仅英语 | 100 多种 |
如何生成无限制语音
- 打开首页的生成器。
- 选择引擎,例如 Piper。
- 选择声音和语速。
- 粘贴文本,多长都可以。
- 点击“生成并试听”或“生成并下载”。
引擎会自动把长文本切成片段。你可以粘贴整章内容。没有字符计数器。
总结
最好的免费文字转语音在本地运行。文字不会离开电脑。也不需要账号或邮箱。
想要质量就选 Kokoro,想要中文声音和速度就选 Piper。
SRT 和 VTT 字幕
生成器也会生成字幕。生成语音后,点击“下载 SRT”或“下载 VTT”。一句话就是一个 cue。SRT 适合 YouTube 和视频软件。VTT 适合网页和浏览器。字幕在本地生成。
常见问题(FAQ)
真的没有字符限制吗?
是的。语音在你的设备上生成。没有字符或分钟计数器。你可以粘贴整章内容。
为什么第一次生成要等几秒?
只有第一次,浏览器需要下载声音模型。模型从 20 MB 到 326 MB。之后每次生成都是瞬间完成。
语音可以商用吗?
可以。Kokoro 和 Kitten 使用 Apache-2.0,eSpeak NG 使用 GPLv3,Piper 使用开源许可。音频文件完全属于你。
我的文字会被保存吗?
不会。一切都通过 WebAssembly 和 WebGPU 在本地运行。文字不会发送到任何服务器。
可以下载 SRT 和 VTT 字幕吗?
可以。生成语音后,点击“下载 SRT”或“下载 VTT”。