授权提示:本项目代码遵循 Apache-2.0 协议,模型权重基于 BreezeBlue 非商业许可协议。仅供个人学习与学术研究使用,严禁用于任何形式的商业用途。
1. 核心功能与产品特点
breeze-tts 是开源语音合成模型 Breeze TTS 2 的官方 PyTorch 推理代码库。简单来说,它能够把文字转化为非常真实、自然的说话声音,同时支持中文和英文。
普通用户可以通过以下方式玩转声音:
- 文字凭空“设计”声音(Voice Design):无需提供任何录音,只需写一段自然语言描述(例如:“一位声音清亮、语调温和的年轻女性”),系统就能直接为你创造出一个全新的独特性声音。
- 声音精准克隆(Voice Clone):只需上传一段几秒钟的真人说话音频和对应文字,就能复刻该说话人的声音特征和发音习惯。
- 情绪与语调控制(Voice Direction):在克隆声音的同时,还能通过文字指令指挥说话人的语气和节奏(例如:“用急促、兴奋的语调说话”)。
- 插入真人生体动作(Vocal Events):支持在文本中直接加入动作标记(如中文里的
[笑]、[叹气]、[咳嗽]、[清嗓子]),让合成的声音拥有真实的呼吸感与情绪起伏。
2. 开发团队与应用场景
- 开发团队:由 AI 语音团队 BreezeBlue(RESONIA, INC.)开发并开源。
- 应用场景:
- 实时语音交互:如 AI 语音助手、实时翻译、智能客服、游戏 NPC 实时对白。
- 内容创作:如有声书朗读、自媒体视频配音、播客合成。
3. 底层技术与性能表现
- 底层技术:代码基于 PyTorch 框架构建,其核心音频分词器(Audio Tokenizer)使用了阿里 Qwen 团队开源的 Qwen3-TTS 组件。
- 低延迟流式输出:支持实时流式生成(RTF 达 0.32,即比实时播放快 3.1 倍)。在经过显卡预热后,从输入文字到输出第一个音频包(TTFA)的延迟可低至 40 毫秒以内(NVIDIA H100 优化状态下)。