Skip to content
audio.cpp WebUI

audio.cpp WebUI

支持数十种 AI 音频模型,通过快速、高效的界面,让用户轻松完成语音生成、识别、转换和音乐创作

使用魔当PC客户端下载

应用特点

开源文本转语音TTS

系统要求

最低8GB内存。预留足够硬盘空间,建议13GB以上。
macOS 15及以上版本,支持Intel和M系列芯片。
Windows 10/11,可用Intel, AMD CPU,推荐用NVIDIA GPU。
注意:NVIDIA显卡,请安装较新版本的驱动。

应用介绍

模型授权说明: audio.cpp WebUI 支持大量来自不同开发团队的 AI 音频模型,不同模型具有不同的授权协议。部分模型支持商业使用,部分模型可能仅限研究或非商业用途。在下载和使用模型前,请确认对应模型的授权要求,尤其是在商业项目、企业部署场景中。

完整模型列表、模型来源以及授权要求,请查看:《audio.cpp 模型许可与商用说明》

项目介绍

audio.cpp WebUI 由 kigner 开发和维护,基于 audio.cpp 项目扩展而来。

audio.cpp WebUI 是一个支持多种 AI 音频模型的本地 AI 音频平台,目前已经支持超过数十种模型,并且持续增加新的模型支持。它通过统一的 Web 界面,让用户可以在自己的电脑上运行不同类型的 AI 音频任务,包括语音生成、语音识别、声音转换和音乐创作。相比传统 AI 音频工具需要为每个模型单独配置复杂环境,audio.cpp WebUI 将多个模型整合到同一个平台中,用户可以更方便地选择、管理和运行不同 AI 能力。但部分模型采用量化版本,生成质量可能与原始模型存在差异,同时相比部分官方应用,本应用在功能完整性和交互体验方面可能有所简化。

丰富的模型生态

  • 文本转语音(TTS)
  • 语音识别(ASR)
  • 声音转换(Voice Conversion)
  • 说话人分析(Speaker Diarization)
  • 音乐生成(Music Generation)
  • 音频处理相关模型

部分具有代表性的模型包括:

VibeVoice, GLM-TTS, MOSS-TTS-Local (v1.5), Qwen3-TTS, Qwen3-ASR, VibeVoice ASR, HeartMuLa, ACE-Step 1.5

不同模型适用于不同场景,用户可以根据需求选择合适的模型。

(注:每个模型具有独立许可证,请以模型官方授权信息为准。)

更快的本地 AI 音频体验

audio.cpp WebUI 注重本地运行效率,通过优化的底层推理架构,让 AI 音频模型能够更加快速地加载和运行。

相比部分依赖复杂 Python 环境的传统方案,它具有:

  • 更轻量的运行环境;
  • 更高效的本地推理性能;
  • 更好的 CPU/GPU 利用效率;
  • 更适合个人电脑和工作站部署。

用户可以直接利用自己的硬件运行 AI 音频任务,无需上传音频数据到云端。

简单易用的 AI 音频工具

通过 WebUI,用户可以:

  • 浏览和管理不同模型;
  • 下载需要的模型;
  • 调整生成参数;
  • 直接运行 AI 音频任务。

即使没有 AI 开发经验,也可以通过图形界面体验先进的音频人工智能技术。

适用场景

audio.cpp WebUI 可用于:

  • AI 视频配音
  • 有声内容制作
  • 播客制作
  • 游戏角色语音生成
  • 本地 AI 助手
  • 音频研究与实验
  • 企业内部 AI 音频部署