支持 31 种语言的高表现力开源语音生成模型,主打超稳定声音克隆与秒级精准停顿控制
建议16GB以上内存。硬盘空间23GB以上。
macOS 15及以上版本,仅支持M系列芯片。
Windows10/11 64位,NVIDIA显卡,16GB以上显存。
注意:NVIDIA显卡,请安装较新版本的驱动。注意:默认仅下载 Local Transformer v1.5 模型。若想使用 MOSS TTS v1.5 模型,选择 MOSS TTS v1.5 运行即可,将自动额外下载约 22GB 的模型文件。
1. 产品定位与开发团队 MOSS-TTS-v1.5 是由 MOSI.AI 与 OpenMOSS 团队 联合开发的一款开源语音与声音生成大模型。作为该系列的最新迭代版本,它专为高保真度、高表现力以及复杂的真实应用场景而设计,旨在提供更自然、更可控的智能语音合成体验。
2. 核心功能与特点(普通用户视角) 对于大众用户和创作者而言,MOSS-TTS-v1.5 带来了以下极具实用性的功能:
[pause 3.2s] 的标记,让 AI 在说话时进行精确到秒的停顿,使得朗读节奏像真人一样自然。3. 应用场景 该模型可广泛应用于以下场景:
4. 底层技术原理 在技术架构上,MOSS-TTS-v1.5 基于 Causal Transformer(因果变换器) 架构。它内置了先进的 MOSS-Audio-Tokenizer(音频标记器),能够将复杂的音频信号压缩为高效的语义-声学统一表征。模型采用了自回归(Autoregressive)生成机制与多尺度残差矢量量化(RVQ)技术,从而在底层保证了高音质的音频解码与极强的长上下文建模能力。