在浏览器里,把文字变成语音

MOSS-TTS-Nano 是一个只有 1 亿参数的端侧语音模型,完全在你的浏览器中通过 WebAssembly 运行,输入文字即可朗读为自然语音。

73hi 的 AI 工具都运行在浏览器本地——无需上传、没有服务器排队、数据不会离开你的设备。本页使用 MOSS-TTS-Nano-100M 在 WebAssembly 上合成语音。

内置多个音色(中文、英文、日文),也可以上传一段参考音频来做音色克隆。模型权重从魔搭(ModelScope)下载并在本地运行。

语速通过对波形重采样实现,所以语速越快,音调也会略微升高,就像磁带快放一样。

请先加载模型,再输入文字并点击生成。

生成的语音会显示在这里。

模型文件

模型权重位于 MOSS-TTS-Nano-100M-ONNXMOSS-Audio-Tokenizer-Nano-ONNX。 工具所拉取的每个文件(下列每一行)都直接链接到魔搭,下载被拦截时可手动获取。

    模型权重较大(约 600 MB),通过魔搭(ModelScope)分发。 首次使用需联网下载,之后浏览器会缓存。若网络无法访问魔搭,可手动下载上面的模型文件后从本地加载。

    所有处理都在你的浏览器本地完成,没有任何数据上传到服务器。