最低8GB内存。预留足够硬盘空间,建议13GB以上。
macOS 15及以上版本,支持Intel和M系列芯片。
Windows 10/11,可用Intel, AMD CPU,推荐用NVIDIA GPU。
注意:NVIDIA显卡,请安装较新版本的驱动。模型授权说明: audio.cpp WebUI 支持大量来自不同开发团队的 AI 音频模型,不同模型具有不同的授权协议。部分模型支持商业使用,部分模型可能仅限研究或非商业用途。在下载和使用模型前,请确认对应模型的授权要求,尤其是在商业项目、企业部署场景中。
完整模型列表、模型来源以及授权要求,请查看:《audio.cpp 模型许可与商用说明》
audio.cpp WebUI 由 kigner 开发和维护,基于 audio.cpp 项目扩展而来。
audio.cpp WebUI 是一个支持多种 AI 音频模型的本地 AI 音频平台,目前已经支持超过数十种模型,并且持续增加新的模型支持。它通过统一的 Web 界面,让用户可以在自己的电脑上运行不同类型的 AI 音频任务,包括语音生成、语音识别、声音转换和音乐创作。相比传统 AI 音频工具需要为每个模型单独配置复杂环境,audio.cpp WebUI 将多个模型整合到同一个平台中,用户可以更方便地选择、管理和运行不同 AI 能力。但部分模型采用量化版本,生成质量可能与原始模型存在差异,同时相比部分官方应用,本应用在功能完整性和交互体验方面可能有所简化。
部分具有代表性的模型包括:
VibeVoice, GLM-TTS, MOSS-TTS-Local (v1.5), Qwen3-TTS, Qwen3-ASR, VibeVoice ASR, HeartMuLa, ACE-Step 1.5
不同模型适用于不同场景,用户可以根据需求选择合适的模型。
(注:每个模型具有独立许可证,请以模型官方授权信息为准。)
audio.cpp WebUI 注重本地运行效率,通过优化的底层推理架构,让 AI 音频模型能够更加快速地加载和运行。
相比部分依赖复杂 Python 环境的传统方案,它具有:
用户可以直接利用自己的硬件运行 AI 音频任务,无需上传音频数据到云端。
通过 WebUI,用户可以:
即使没有 AI 开发经验,也可以通过图形界面体验先进的音频人工智能技术。
audio.cpp WebUI 可用于: