这是一个跑在浏览器里的文字转语音工具,用的是 Web Speech API 里的 SpeechSynthesis 接口,不装插件、不注册、不联网上传文本。你输入或粘贴一段文字,选一个系统里已有的语音(比如 Windows 上的 Microsoft Huihui、macOS 上的 Tingting),调一下语速和音调,点播放就能出声。适合做短视频配音草稿、给长辈把长文转成音频听、检查自己写的英文句子读起来顺不顺。比如你写完一段 300 字的公众号开头,想听听语感,直接粘进来选中文语音、语速设 1.0,10 秒内就能听完整段。
| 对比维度 | 本工具 | 手工/替代做法 |
|---|---|---|
| 准备时间 | 打开网页即用,约 3 秒 | 装 Audacity + 录音,约 5-10 分钟 |
| 费用 | 0 元,无字数限制 | 商用 TTS 约 0.1-1 元/百字,录音棚 200 元/小时起 |
| 隐私 | 文本不出浏览器,断网可用 | 云端 TTS 需上传文本,受服务商条款约束 |
| 音质 | 系统合成音,16kHz-22kHz,机械感明显 | 真人录音 44.1kHz,自然但成本高 |
| 导出格式 | webm/opus(需录制),无直接 MP3 | 录音棚可直出 WAV/MP3,云端 TTS 多支持 MP3 |
SpeechSynthesis 的语音列表由操作系统提供,首次加载可能异步返回。Chrome 里可在控制台执行 speechSynthesis.getVoices().length 查看,通常 Windows 10 有 5-10 个、macOS 有 20 个以上。若为 0,刷新页面或等 1-2 秒再试;Linux 需装 speech-dispatcher 才有声音。
取决于系统装的语音包。常见覆盖中文(zh-CN、zh-TW、zh-HK)、英文(en-US、en-GB)、日文(ja-JP)、韩文(ko-KR)、法德西俄等。Windows 可在「设置→时间和语言→语音」里追加语音包,每个约 50-200MB,装完刷新页面即可在下拉框看到。
规范没有硬上限,但 Chrome 单次 utterance 超过约 32767 字符会静默失败,实际建议控制在 5000 字以内。更长文本可拆成多段,每段 1000-2000 字依次播放,中间加 300ms 延时,避免 speechSynthesis 队列被浏览器清空。
Web Speech API 本身不提供音频流,无法直接导出 MP3。可行做法是用 MediaRecorder 捕获系统输出(Chrome 需勾选「分享标签页音频」),录出来是 webm/opus 格式,再用工具转 MP3。或者改用服务端 TTS,但那样文本就离开本地了。
rate 参数是倍率,1.0 为正常,0.1 到 10 之间有效。实测中文 1.0 约每分钟 240 字,0.8 约 190 字,1.5 约 360 字。低于 0.5 会明显拖沓,高于 2.0 中文听不清声调,英文可到 2.5 仍可辨。
不会。SpeechSynthesis 是浏览器调用本地操作系统的 TTS 引擎,文本不经过 eitools.cn 的服务器,也不经过网络。你可以在开发者工具的 Network 面板确认:点播放时没有任何请求发出,断网状态下同样能朗读。
适用范围:短文本试听、配音草稿、无障碍朗读,单次建议 5000 字以内。精度说明:语音质量取决于操作系统 TTS 引擎,中文多音字(如「行」「重」)可能读错,需人工校对。隐私说明:全部计算在浏览器本地完成,文本不上传、不存储、不经过服务器,断网也能用。