
FireRedTTS3 是小红书 FireRed 团队开源的新一代语音生成与编辑模型,基于“语义丰富的连续语音表示”,把语音合成和编辑统一到一个系统里。简单说,它就像一个“能克隆声音、能按描述造声音、还能像改文档一样改语音”的全能语音工具,特别适合需要高质量、多语言、可控语音的应用场景。

主要特点 多语言 + 多方言支持很强 支持24种语言(包括中文、英语、日语、韩语、阿拉伯语、西班牙语、俄语、泰语、越南语等),以及21种中文方言(如四川话、上海话、粤语、闽南话、河南话、湖南话等)。 只需提供几秒钟参考音频,就能让模型用“那个人的声音”说出对应语言/方言的内容,音色相似度高,发音也较准。在公开评测(Seed-TTS-eval、MiniMax-MLS-Test)上,平均错误率和说话人相似度都表现领先。 声音设计(Voice Design) 不需要参考音频,直接用自然语言描述想要的声音,例如:“一个年轻女性的温柔嗓音,语速稍慢,带一点俏皮”。模型会先生成一份声音属性规划,再合成出全新的声音。 语音编辑(Speech Editing) 语义编辑:像改文字一样,对已有语音做插入、删除、替换(比如把“猫”改成“狗”)。 声学编辑:调整语速、音高、音量(有特定指令格式)。 编辑后其他部分基本保持原样,音色不漂移。 应用领域 配音与内容创作:短视频、有声书、动画、广告等需要多语言/方言克隆或定制音色的场景。 智能客服与虚拟助手:生成自然、带情感或特定口音的对话语音。 教育与本地化:多语言/方言学习材料、地方特色内容制作。 语音后期处理:快速修改已有录音(改错词、调语速等),省去重新录制的麻烦。 个性化语音产品:定制专属AI语音、角色扮演、游戏角色配音等。 使用教程:(建议N卡,显存8G起,支持50系显卡) 包含主程序压缩包和模型(pretrained_models文件夹),下载解压主程序后,将模型(pretrained_models文件夹)移动到主程序目录下即可。 建议8G显存起,如果生成的文字内容较长,建议显存12G起 包含“语音克隆”、“音色设计”和“语音编辑”三个功能,根据需要切换对应的选项卡 语音克隆:上传参考音频,输入参考文本和需要合成的文本,选择目标语言,合成即可。 音色设计:输入音色描述(比如一个年轻温柔的女声)和待合成的文本,合成即可。 语音编辑:上传参考音频,输入编辑指令(比如,把我很好替换为你很好),编辑即可。 软件目录结构: 📂 deepface 📂 pretrained_models/ │ ├── 📂 campp/ │ ├── 📂 fireredtts3_base/ │ ├── 📂 fireredtts3_instruct/ │ … 📂 fireredtts3 📂 examples 一键启动.exe ……
下载地址:点此下载



