跳至内容
免费工具作者:Yaps

文字转语音,31 languages.

四种声音,31 种语言,一种模型只需下载一次即可在您的选项卡中运行。粘贴文本或删除文档;您加载的任何内容都不会上传,因为它无处可去。

在您的计算机上运行 · Yaps 应用程序使用相同的引擎

开始 声音 向上

语音每个声音都读懂每种语言。
31 语言,一种模型
120 / 600

放下要阅读的文档

PDF、EPUB、TXT、Markdown、HTML、RTF、DOCX — 在此设备上处理

声音由 Supertonic 3(© Supertone Inc.)根据 BigScience Open RAIL-M 许可证生成。它允许商业用途,但限制您生成的内容的某些用途,包括未经真人同意而冒充真人。 查看条款.

关于这个工具

浏览器内文本转语音的实际含义是什么

大多数文本转语音网站都是一种表单。您输入文字,您的文字就会传输到服务器,那里的模型会生成音频,然后返回一个文件。浏览器内文本转语音消除了中间步骤。该模型会发送给您一次,然后您的浏览器会运行它。

此页面使用 Supertonic 3,它与 Yaps 桌面应用程序附带的语音引擎相同。它大约为 145MB,在您第一次打开页面时以正常下载方式到达。您的浏览器会缓存它。此后的每个剪辑都是在您自己的处理器上制作的,这就是为什么没有队列、没有信用计数器、也没有帐户的原因。

浏览器有多种说话方式,但它们并不相同。内置的 Web Speech API 会借用您的操作系统所具有的任何声音,因此同一页面在 Mac 和旧 Android 手机上听起来会有所不同。云 API 听起来一致,但会读取您粘贴的所有内容。一个小型本地模型位于两者之间:到处都是一个声音,而文本保持不变。

私人文本转语音:无需上传、无需注册、无需 API 密钥

您粘贴到框中或从文档中加载的任何内容都不会离开您的机器。这不是您必须相信的承诺,而是页面的构建方式。没有端点等待接收您的文本。

大约十秒就可以查到。语音下载完毕后,请关闭 Wi-Fi,并生成剪辑。它仍然会说话,因为你的文字永远不会去任何地方。更好的是,在模型缓存后关闭连接。该工具一直在说话。

相同的结构消除了通常的摩擦。测试脚本时没有帐户、没有电子邮件地址、没有 API 密钥、没有免费套餐。我们不会为每个单词的推理付费,因此无需计量。

当文本不是由您分发时,这一点最为重要。 NDA 下的副本、临床脚本、内部培训材料、未公布的产品名称、手稿的一章。这些正是人们粘贴到免费工具中的东西,而不考虑它们落在哪里。

一种模型支持 31 种语言的文本转语音

选择一种语言,选择四种声音中的任何一种,它就会读取。西班牙语、德语、意大利语、波兰语、荷兰语、土耳其语、韩语、日语、阿拉伯语、印地语、越南语等二十种语言,全部来自同一个 145MB 文件。

对于这么小的模型来说这是不寻常的。大多数本地引擎都需要为每种语言配备一个音素器,这是一个将拼写转换为发音的独立组件,因此每种新语言都意味着要发布另一本词典。这就是为什么其他浏览器内工具只有英文版,或者英文版加上一些附加功能。 Supertonic 直接根据拼写计算出发音,因此一组权重就可以解决所有问题。

完整列表:英语、西班牙语、法语、德语、意大利语、葡萄牙语、荷兰语、波兰语、俄语、乌克兰语、捷克语、斯洛伐克语、斯洛文尼亚语、克罗地亚语、保加利亚语、罗马尼亚语、匈牙利语、希腊语、瑞典语、丹麦语、芬兰语、爱沙尼亚语、拉脱维亚语、立陶宛语、土耳其语、阿拉伯语、印地语、印度尼西亚语、越南语、韩语、日语。

31 种语言的质量各不相同。英语和较大的欧洲语言是最强的。设置语言选择器以匹配您的文本,因为阅读取决于它。

如何在浏览器中将文本转换为 WAV 文件

1. 将 PDF、EPUB、TXT、Markdown、HTML、RTF 或 DOCX 文件粘贴或输入到阅读器中。导入的文档在您的设备上进行解析。每次运行的限制为 600 个字符,大约是一个短段落或 20 秒的语音。

2. 选择文本的语言。这改变了拼写的阅读方式,因此它比看起来更重要。

3. 选择声音。这里有四个人:诺拉、卢娜、沃森和凯尔德。四个人都通晓全部 31 种语言。

4. 按讲话按钮。第一次访问时,首先下载 145MB 引擎,您将看到一个进度条。之后就不用等待了。

5. 按下载以 44.1kHz 保存 WAV 文件。

生成速度比实时速度更快,并且从第一个句子开始播放,而不是等待整个段落,因此您几乎可以立即听到声音。如果您想要不同的效果,请编辑文本并再次运行。运行之间不会保存任何内容,也不会在其他人的作业后面排队。

首次下载后离线文本转语音

一旦模型位于浏览器缓存中,该工具就不再需要互联网。加载页面,进入隧道或飞机,它仍然会产生音频。这是本地运行的副作用,而不是我们附加的功能。

费用为一次性下载 145MB。在连接良好的情况下,不到一分钟;在绑定移动数据方面,值得等待更好的数据。您的浏览器决定保留缓存的时间,因此如果您清除站点数据,它将再次获取。

它在 WebAssembly 上运行,因此不需要显卡,也不涉及扩展或安装。当前版本的 Chrome、Edge、Firefox 和 Safari 均可在桌面和手机上运行。较旧或内存较低的手机速度会较慢,因为 145MB 型号的手机在说话时必须占用内存。

与上传文本的文本转语音网站相比如何

主流免费网站宣传数百种声音和一百种语言。他们可以,因为数据中心正在做这项工作。交易是你的脚本被发送给他们,通常伴随着注册、每日字数上限、水印或繁忙时间的队列,以及你必须阅读的隐私政策,以了解文本之后会发生什么。

此页的形状相反。四种声音,一次 600 个字符,第一次访问时需要等待。作为交换:没有帐户,运行次数没有上限,没有任何东西可以将您的文字发送到任何地方,并且即使连接关闭,它也能继续工作。

与其他本地浏览器内工具相比,比较更直接。它们中的大多数都运行 Kokoro,这是一个较大的下载版本,并且以浏览器形式提供,通常只有英文版。 Supertonic 的大小大约是它的一半,可以以相同的权重读取 31 种语言。

用于商业用途的免费文本转语音以及许可证要求

您可以将音频用于商业用途。 Yaps 没有归属要求,文件中没有水印,也无需购买单独的许可证。

模型权重根据 BigScience Open RAIL M 许可证发布,该许可证允许商业用途,但对输出的处理附加条件。简而言之,重要的是:未经特定真人同意,不得使用它来模仿特定的真人;不要将合成语音冒充为某人的真实录音;不要用它来欺骗、骚扰或生成伤害他人的内容。这些限制随音频一起传播,因此它们适用于您将文件传递给的任何人。

全文链接自我们的条款,并且足够短,易于阅读。如果您正在制作旁白、解释、演示视频、文章的音频版本或产品的语音提示,这些都不会妨碍您。

该工具不能做什么,以及 Yaps 应用程序添加了什么

直接说吧:此页面读取您从本地 PDF、EPUB、TXT、Markdown、HTML、RTF 或 DOCX 文件输入、粘贴或导入的文本。它不会触及您正在查看的文章、电子邮件、另一个窗口中的文档或屏幕上其他位置的选择。网页无法达到这些目的,我们也不希望有这样的方法。

Yaps 桌面应用程序是发生变化的地方。在 Mac、Windows 或 Linux 计算机上突出显示任意位置的文本,按下快捷键,它就会以相同的声音大声朗读。它携带全套十种语音风格(而不是四种),没有 600 个字符的限制,一次处理长篇阅读一个段落,并添加了带有语音克隆的表达引擎。它也在设备上运行,因此隐私故事是相同的。

如果您需要的只是一个短片和一个 WAV 文件,请留在此处。它是免费的,并且不是试用版。

如何在浏览器中使用文本转语音

  1. 输入、粘贴或删除文件

    输入或粘贴最多 600 个字符,或拖放 PDF、EPUB、TXT、Markdown、HTML、RTF 或 DOCX 文件。导入的文本保留在您的设备上。

  2. 设置语言

    从 31 种可用语言中选择您的文本所使用的语言。这改变了拼写转换为发音的方式,因此它对结果的影响比看起来更大。

  3. 选择一个声音

    选择诺拉、卢娜、沃森或凯尔德。所有四个人都可以阅读每种受支持的语言。

  4. 生成语音

    按讲话按钮。首次访问 145MB 语音引擎下载和缓存;之后该生成立即开始并从第一句开始播放。

  5. 下载 WAV

    按下载将音频保存为 44.1kHz WAV 文件。没有水印,您可以在模型许可条件下将其用于商业用途。

问题

我的文字上传到任何地方了吗?

不会。语音模型会下载到您的浏览器,并且音频会在您自己的计算机上生成。没有合成服务器可供您发送文本。您可以在语音缓存后断开与互联网的连接并生成剪辑来确认这一点。

我需要帐户或 API 密钥吗?

不需要。无需注册、没有电子邮件地址、没有 API 密钥,也没有信用余额。由于合成在您的设备上运行,因此我们无需恢复每个字的成本,因此无需进行门控。

浏览器内的文本转语音功能可以离线使用吗?

是的,第一次访问之后。 145MB 语音引擎必须下载一次,然后您的浏览器会将其缓存。从那时起,页面将在完全没有连接的情况下产生音频。如果您清除站点数据,模型将再次下载。

为什么第一次加载是 145MB 下载?

因为模型本身会来到您身边,而不是留在服务器上。 145MB 对于多语言语音模型来说很小,而且是一次性的。大多数浏览器内替代程序都运行 Kokoro,这是一个较大的下载,并且通常在浏览器中仅提供英语。

支持哪些语言?

31:英语、西班牙语、法语、德语、意大利语、葡萄牙语、荷兰语、波兰语、俄语、乌克兰语、捷克语、斯洛伐克语、斯洛文尼亚语、克罗地亚语、保加利亚语、罗马尼亚语、匈牙利语、希腊语、瑞典语、丹麦语、芬兰语、爱沙尼亚语、拉脱维亚语、立陶宛语、土耳其语、阿拉伯语、印地语、印度尼西亚语、越南语、韩语和日语。他们都使用相同的模型和四种声音中的任何一种。

我得到什么格式的文件?

44.1kHz 的 WAV 文件。如果您需要较小的文件,您可以在任何编辑器中将其转换为 MP3。音频中没有水印,也没有品牌。

为什么有 600 个字符的限制?

为了品质和耐心。该模型在短通道中更可靠,而长时间的单次运行在运行时不会给您任何反馈。如果您需要长篇阅读,Yaps 桌面应用程序会一次处理一个段落,没有上限。

我可以将音频用于商业用途吗?

是的。模型权重使用 BigScience Open RAIL M 许可证,该许可证允许商业使用,但对输出有限制:未经同意不得模仿特定的真人,不得将生成的语音当作真实录音,不得欺骗或有害使用。完整条款可从我们的条款页面链接。

它适用于哪些浏览器?

桌面和手机上的 Chrome、Edge、Firefox 和 Safari 的当前版本。它在 WebAssembly 上运行,因此不需要显卡和扩展。较旧或内存较低的手机生成速度会更慢,因为模型必须保留在内存中。

它可以为我阅读网页、PDF 或文档吗?

您可以拖放本地 PDF、EPUB、TXT、Markdown、HTML、RTF 或 DOCX 文件,页面会在您的设备上提取其文本。它无法访问在其他应用程序中打开的网页、电子邮件或文档; Yaps 桌面应用程序使用键盘快捷键从任何应用程序读取突出显示的文本。

这些声音与 Yaps 应用程序的声音相同吗?

相同的发动机和相同的重量。此页面提供四种语音风格,应用程序提供十种,消除了字符限制,并添加了带有语音克隆的表达引擎。

这与基于 Kokoro 的浏览器 TTS 工具相比如何?

两者都在浏览器本地运行,因此隐私位置是相同的。区别在于覆盖范围和大小:Supertonic 3 可以从大约 145MB 中读取 31 种语言,而 Kokoro 的浏览器版本通常需要更大的下载量并且仅提供英语,因为它们需要每种语言的发音词典。

开始大喊大叫Mac · Windows · Linux · 安卓

阅读 anything,不仅仅是这个盒子。

通过一个快捷方式,在任何应用程序中突出显示文本并收听它。

下载 Mac 版

需要 macOS 13.0+(推荐Apple Silicon)iOS 即将推出