欢迎光临
我们一直在努力

Zero-shotTTS音色克隆:resemble-ai/chatterbox的本地部署以及简单的gradio webui

官方github仓库

简介

Chatterbox是一个强大的TTS模型,支持语气调节和音色克隆等功能,是开源SoTA模型

先决条件:

建议的Python版本:3.11

有一台硬件性能不弱的电脑

强烈建议电脑带有NVIDIA独立显卡(显存>=4GB)cuda>=12.4

nvidia-smi

运行上面的命令可以检查cuda版本,同时去NVIDIA网站看一下自己的显卡CC兼容性,至少要>=5.1,用torch新版本最好要7.5以上

安装Python:

python3.11.10下载

记得一定在安装过程中勾选add Python to path!

安装依赖:

官方在github中的安装方式:

pip install chatterbox-tts

对国内用户,需要使用镜像加速:(这里以清华源为例)

pip install chatterbox-tts -i https://pypi.tuna.tsinghua.edu.cn/simple

chatterbox的依赖非常多,用pip其实比较慢,我个人喜好用uv安装,会快很多:

在你想要创建文件的位置打开命令行:

pip install uv -i https://pypi.tuna.tsinghua.edu.cn/simple #安装uv
uv venv #创建venv环境
set UV_INDEX_URL=https://pypi.tuna.tsinghua.edu.cn/simple #设置uv镜像
uv pip install chatterbox-tts

运行chatterbox

chatterbox-turbo(仅英语,性能开销较少):

import torchaudio as ta
import torch
from chatterbox.tts_turbo import ChatterboxTurboTTS

# Load the Turbo model
model = ChatterboxTurboTTS.from_pretrained(device=\”cuda\”)

# Generate with Paralinguistic Tags
text = \”Hi there, Sarah here from MochaFone calling you back [chuckle], have you got one minute to chat about the billing issue?\”

# Generate audio (requires a reference clip for voice cloning)
wav = model.generate(text, audio_prompt_path=\”your_10s_ref_clip.wav\”)

ta.save(\”test-turbo.wav\”, wav, model.sr)

Chatterbox和Chatterbox-Multilingual(前者仅英语,

赞(0)
未经允许不得转载:171主机测评 » Zero-shotTTS音色克隆:resemble-ai/chatterbox的本地部署以及简单的gradio webui
分享到: 更多 (0)

评论 抢沙发

  • 昵称 (必填)
  • 邮箱 (必填)
  • 网址