支持零样本和少样本的文本到语音48k star的配音工具:GPT-SoVITS-WebUI
支持零样本和少样本的文本到语音48k star的配音工具:GPT-SoVITS-WebUI
官网:RVC-Boss/GPT-SoVITS: 1 min voice data can also be used to train a good TTS model! (few shot voice cloning)
用户手册:GPT-SoVITS指南
功能
-
零样本文本到语音 (TTS): 输入 5 秒的声音样本, 即刻体验文本到语音转换.
-
少样本 TTS: 仅需 1 分钟的训练数据即可微调模型, 提升声音相似度和真实感.
-
跨语言支持: 支持与训练数据集不同语言的推理, 目前支持英语、日语、韩语、粤语和中文.
-
WebUI 工具: 集成工具包括声音伴奏分离、自动训练集分割、中文自动语音识别(ASR)和文本标注, 协助初学者创建训练数据集和 GPT/SoVITS 模型.
可以直接在这里体验一下:AI Hobbyist TTS
只需要上传一段3-10秒的wav录音,即可进行声音的克隆。
安装
官方提供了一些非常易操作的软件包,方便用户直接使用。
咱们还是使用常规的安装方法
安装lib库
sudo apt install ffmpeg
sudo apt install libsox-dev
下载源码
https://github.com/RVC-Boss/GPT-SoVITS
cd GPT-SoVITS
安装python库
pip install -r extra-req.txt --no-deps
pip install -r requirements.txt
下载预训练模型
从huggingface下载:https://huggingface.co/lj1995/GPT-SoVITS
启动推理
python GPT_SoVITS/inference_webui.py <language(optional)>
# 或
python webui.py
具体细节还需要再学习实践一下。