Skip to content
Breeze TTS 2

Breeze TTS 2

一款支持中英双语、超低延迟流式输出的语音合成模型,通过文本指令设计声音、精准克隆人声并自由操控说话情绪与语气

使用魔当PC客户端下载

应用特点

开源文本转语音TTS

截图预览

Breeze TTS 2 screenshot 1

系统要求

最低16GB内存。预留足够硬盘空间,建议21GB以上。
macOS 15及以上版本,仅支持M系列芯片。
Windows 10/11:显卡NVIDIA,8GB以上显存。
注意:NVIDIA显卡,请安装较新版本的驱动。

应用介绍

授权提示:本项目代码遵循 Apache-2.0 协议,模型权重基于 BreezeBlue 非商业许可协议。仅供个人学习与学术研究使用,严禁用于任何形式的商业用途。

1. 核心功能与产品特点

breeze-tts 是开源语音合成模型 Breeze TTS 2 的官方 PyTorch 推理代码库。简单来说,它能够把文字转化为非常真实、自然的说话声音,同时支持中文和英文

普通用户可以通过以下方式玩转声音:

  • 文字凭空“设计”声音(Voice Design):无需提供任何录音,只需写一段自然语言描述(例如:“一位声音清亮、语调温和的年轻女性”),系统就能直接为你创造出一个全新的独特性声音。
  • 声音精准克隆(Voice Clone):只需上传一段几秒钟的真人说话音频和对应文字,就能复刻该说话人的声音特征和发音习惯。
  • 情绪与语调控制(Voice Direction):在克隆声音的同时,还能通过文字指令指挥说话人的语气和节奏(例如:“用急促、兴奋的语调说话”)。
  • 插入真人生体动作(Vocal Events):支持在文本中直接加入动作标记(如中文里的 [笑][叹气][咳嗽][清嗓子]),让合成的声音拥有真实的呼吸感与情绪起伏。

2. 开发团队与应用场景

  • 开发团队:由 AI 语音团队 BreezeBlue(RESONIA, INC.)开发并开源。
  • 应用场景
  • 实时语音交互:如 AI 语音助手、实时翻译、智能客服、游戏 NPC 实时对白。
  • 内容创作:如有声书朗读、自媒体视频配音、播客合成。

3. 底层技术与性能表现

  • 底层技术:代码基于 PyTorch 框架构建,其核心音频分词器(Audio Tokenizer)使用了阿里 Qwen 团队开源的 Qwen3-TTS 组件。
  • 低延迟流式输出:支持实时流式生成(RTF 达 0.32,即比实时播放快 3.1 倍)。在经过显卡预热后,从输入文字到输出第一个音频包(TTFA)的延迟可低至 40 毫秒以内(NVIDIA H100 优化状态下)。