Skip to content
FireRedTTS3

FireRedTTS3

小红书开源的 LLM-DiT 语音大模型,支持 24 语种及 21 种方言克隆、文字描述生音与语音局部编辑

使用魔当PC客户端下载

应用特点

开源文本转语音TTS

截图预览

FireRedTTS3 screenshot 1
FireRedTTS3 screenshot 2

系统要求

建议16GB以上内存。硬盘空间28GB以上。
macOS 15及以上版本,仅支持M系列芯片。
Windows10/11 64位,NVIDIA显卡,8GB以上显存。
注意:NVIDIA显卡,请安装较新版本的驱动。

应用介绍

1. 核心功能与产品特点

  • 支持 24 种语言全列表:中文 (Chinese)、粤语 (Cantonese)、英语 (English)、日语 (Japanese)、韩语 (Korean)、法语 (French)、德语 (German)、俄语 (Russian)、西班牙语 (Spanish)、葡萄牙语 (Portuguese)、意大利语 (Italian)、阿拉伯语 (Arabic)、印地语 (Hindi)、泰语 (Thai)、越南语 (Vietnamese)、印尼语 (Indonesian)、土耳其语 (Turkish)、波兰语 (Polish)、荷兰语 (Dutch)、捷克语 (Czech)、希腊语 (Greek)、罗马尼亚语 (Romanian)、乌克兰语 (Ukrainian)、芬兰语 (Finnish)。
  • 21 种中国方言:安徽、福建、甘肃、贵州、河北、河南、湖北、湖南、江西、辽宁、闽南、宁夏、陕西、山东、上海、山西、四川、天津、温州、吴语、云南。
  • 自然语言 Voice Design:无需参考音频,直接输入文字描述(如“语气温柔的年轻女声”)即可凭空生成音色。
  • 零样本语音克隆:几秒音频即可精准复刻目标音色。
  • 自由语音编辑:支持改词/增词/删词等语义修改,以及对语速、音高、音量的精细控制。

⚠️ 关于多人对话功能的变更v3 官方原生删除了 v2 中的多人对话功能。因为 v3 架构调整为专注单音色精度控制,若需实现多角色配音,需要由上层软件将对话拆分为单句独立生成后再进行音频拼接。

2. 与 v2 版本的差异

  • 架构与定位:v2 采用双 Transformer 流式架构,主打低延迟与原生多人对话;v3 升级为 LLM-DiT(扩散自回归)连续语音架构,主打高精度克隆、语音编辑与 Voice Design,删除了多人对话机制
  • 语言与方言拓展:v3 将语言扩展至 24 种,并新增了 21 种中国方言的零样本克隆能力。

3. 开发团队、底层技术与应用场景

  • 团队:由小红书 (Xiaohongshu) Super Intelligence (FireRed) 团队开发。
  • 技术:基于 LLM-DiT 与连续语音表示,结合 RedAE Tokenizer 与语义编码器降低自回归生成中的累积误差。
  • 场景:适用于游戏配音、影视修音、虚拟人声音设计、多方言有声书制作。