CloneTTS 是一款基于原生架构打造的轻量级文字转语音(TTS)引擎,无需联网即可实现高质量语音合成。该应用支持离线提取发音人模型,操作零门槛,用户可快速克隆个性化音色,并兼容双擎系统实现全局听书功能。界面简洁、功能全面,且完全免费,适合对语音朗读有高自由度需求的用户使用。

1、安装并启动 CloneTTS,点击界面右上角“?”菜单,选择“添加音色”。

2、阅读并同意隐私合规声明后继续操作。

3、在“新建克隆音色”页面中,上传或选择一段作为参照的音频素材。

4、调整音色特征参数与反注设置,完成后点击“保存并启用”。

5、创建成功后,可在“音色管理库”中查看和管理所有已保存的音色。

针对个别字词发音错误或特殊读音需求,可进入“发音规则”界面,点击右上角“?”选择“新添规则”,支持通过纯文本或正则表达式进行发音替换。

系统级纠错大词库:若需批量修正多音字误读问题,可在“高级设置”中启用“系统级纠错大词库”,手动导入第三方提供的 system_dict.json 文件以增强发音准确性。
高阶断句正则配置:此功能控制长句朗读时的停顿节奏(如逗号、句号处的间隔)。用户可自定义断句规则,若配置异常,亦可一键点击“恢复系统默认”重置为初始状态。
方式一:设为系统默认 TTS 引擎 进入手机“设置”,搜索“文字转语音”或“TTS 设置”,将默认引擎切换为 CloneTTS。此后,在“开源阅读”等支持系统 TTS 的应用中点击朗读,即可直接使用 CloneTTS 音色,并享受无级变速体验。
方式二:启用本地 HTTP API 服务 在 CloneTTS 的“高级设置”中开启“本地 HTTP API 服务”,获取接口地址(例如:http://127.0.0.1:8080/api/tts?text={{speakText}}),将其填入 Legado 等外部阅读软件的网络发音配置项中,即可实现低延迟、免中断的语音输出。
核心请求地址:GET http://127.0.0.1:8080/api/tts
参数说明:
调用示例: GET http://127.0.0.1:8080/api/tts?voice=d73ca9c9-c132-4a5b-9f85-825fbaa07162&speed=1.2&text=你好,这是一段测试语音。
在“开源阅读”(Legado)中配置 URL 变量的标准写法为: http://127.0.0.1:8080/api/tts?voice=您的音色ID&speed={{speakSpeed / 10.0}}&text={{speakText}}
更便捷的做法是:在“开源阅读”的朗读引擎设置中,点击右上角菜单选择“网络导入”,输入聚合接口地址: http://127.0.0.1:8080/api/legado/all 系统将自动拉取 CloneTTS 中所有已配置音色,实现即配即用。
多音色灵活调用:通过 API 支持外部应用(如开源阅读、MultiTTS)按 voice 参数指定不同发音人,适用于角色对话等场景;App 内还支持长按多选音色,实现顺序交替朗读。
稳定性与性能优化:重构底层调度机制,有效避免系统 TTS 与 HTTP API 同时运行导致的内存冲突和崩溃问题,显著提升启动速度与运行流畅度。
扩展性增强:HTTP API 新增 voice 与 speed 参数,便于外部软件精准控制发音人及语速。
音色迁移更智能:提供“追加合并”与“彻底覆盖”两种导入模式,并自动适配跨设备路径差异,解决因绝对路径不兼容导致的音频文件丢失问题。
精细化音色编辑:在音色编辑界面新增对推理步数(num_steps)的调节选项,用户可根据需求平衡语音质量与生成效率。
? 修复后台保存配置时因进程被系统终止而导致参数丢失的问题。 ? 解决“追加合并”导入后因缓存未刷新,导致新音色未及时显示的显示异常。 ? 在向第三方软件分发网络源配置时,引入哈希后缀机制,避免因 ID 重复造成批量导入仅生效一个音色的问题。