← 返回首页

文字转语音

输入文字,在线朗读。使用浏览器原生语音合成,支持中文、英文、日文等多语种。

文字转语音 是什么?

这是一个跑在浏览器里的文字转语音工具,用的是 Web Speech API 里的 SpeechSynthesis 接口,不装插件、不注册、不联网上传文本。你输入或粘贴一段文字,选一个系统里已有的语音(比如 Windows 上的 Microsoft Huihui、macOS 上的 Tingting),调一下语速和音调,点播放就能出声。适合做短视频配音草稿、给长辈把长文转成音频听、检查自己写的英文句子读起来顺不顺。比如你写完一段 300 字的公众号开头,想听听语感,直接粘进来选中文语音、语速设 1.0,10 秒内就能听完整段。

使用步骤

  1. 在文本框里粘贴或输入要朗读的内容,例如「今天北京气温 26 度,适合出门跑步。」,建议单次不超过 5000 字,太长浏览器可能卡顿。
  2. 在语音下拉框里选一个系统语音,中文常见的有 Microsoft Huihui(Win)、Tingting(macOS),英文有 Google US English。
  3. 拖动语速滑块,默认 1.0,慢速可设 0.7,快速可设 1.5;音调默认 1.0,调低到 0.8 会显得更沉稳。
  4. 点「播放」按钮试听,浏览器会从光标位置或开头开始朗读,播放中可随时点「暂停」或「停止」。
  5. 满意后点「下载」或「录制」把音频保存为文件(部分浏览器需借助 MediaRecorder 录制,Chrome 支持较好)。

对比:用它还是手工做?

对比维度本工具手工/替代做法
准备时间打开网页即用,约 3 秒装 Audacity + 录音,约 5-10 分钟
费用0 元,无字数限制商用 TTS 约 0.1-1 元/百字,录音棚 200 元/小时起
隐私文本不出浏览器,断网可用云端 TTS 需上传文本,受服务商条款约束
音质系统合成音,16kHz-22kHz,机械感明显真人录音 44.1kHz,自然但成本高
导出格式webm/opus(需录制),无直接 MP3录音棚可直出 WAV/MP3,云端 TTS 多支持 MP3

常见问题

为什么语音列表是空的?

SpeechSynthesis 的语音列表由操作系统提供,首次加载可能异步返回。Chrome 里可在控制台执行 speechSynthesis.getVoices().length 查看,通常 Windows 10 有 5-10 个、macOS 有 20 个以上。若为 0,刷新页面或等 1-2 秒再试;Linux 需装 speech-dispatcher 才有声音。

支持哪些语言?

取决于系统装的语音包。常见覆盖中文(zh-CN、zh-TW、zh-HK)、英文(en-US、en-GB)、日文(ja-JP)、韩文(ko-KR)、法德西俄等。Windows 可在「设置→时间和语言→语音」里追加语音包,每个约 50-200MB,装完刷新页面即可在下拉框看到。

文字长度有限制吗?

规范没有硬上限,但 Chrome 单次 utterance 超过约 32767 字符会静默失败,实际建议控制在 5000 字以内。更长文本可拆成多段,每段 1000-2000 字依次播放,中间加 300ms 延时,避免 speechSynthesis 队列被浏览器清空。

能导出 MP3 吗?

Web Speech API 本身不提供音频流,无法直接导出 MP3。可行做法是用 MediaRecorder 捕获系统输出(Chrome 需勾选「分享标签页音频」),录出来是 webm/opus 格式,再用工具转 MP3。或者改用服务端 TTS,但那样文本就离开本地了。

语速数值怎么理解?

rate 参数是倍率,1.0 为正常,0.1 到 10 之间有效。实测中文 1.0 约每分钟 240 字,0.8 约 190 字,1.5 约 360 字。低于 0.5 会明显拖沓,高于 2.0 中文听不清声调,英文可到 2.5 仍可辨。

文本会上传到服务器吗?

不会。SpeechSynthesis 是浏览器调用本地操作系统的 TTS 引擎,文本不经过 eitools.cn 的服务器,也不经过网络。你可以在开发者工具的 Network 面板确认:点播放时没有任何请求发出,断网状态下同样能朗读。

适用范围:短文本试听、配音草稿、无障碍朗读,单次建议 5000 字以内。精度说明:语音质量取决于操作系统 TTS 引擎,中文多音字(如「行」「重」)可能读错,需人工校对。隐私说明:全部计算在浏览器本地完成,文本不上传、不存储、不经过服务器,断网也能用。

浙ICP备2026073450号