Skip to content
YuE2

YuE2

双阶段开源音乐生成模型,可先生成可编辑乐谱再渲染完整歌曲,长曲生成速度快

使用魔当PC客户端下载

应用特点

开源音乐

系统要求

建议16GB以上内存。硬盘空间32GB以上。
Windows10/11 64位,NVIDIA显卡,8GB以上显存。
注意:NVIDIA显卡,请安装较新版本的驱动。

应用介绍

授权要求

YuE2模型权重采用CC‑BY‑NC‑4.0协议(需署名,禁止商业用途),项目代码使用Apache 2.0协议。

项目基础信息

YuE2由香港科技大学HKUST与Multimodal‑Art‑Projection(M‑A‑P)团队开发,是开源全曲音乐生成模型。

  • 适用场景:音乐人创作、短视频配乐、歌词转歌曲、AI翻唱、音乐研究实验;
  • 底层技术:采用符号规划 + 声学流匹配双阶段架构。第一步生成可编辑ABC乐谱(旋律、和弦);第二步基于流匹配模型渲染48kHz立体声人声与伴奏。

核心功能(普通用户视角)

  1. 歌词+风格提示词生成完整歌曲,自带人声演唱与伴奏,支持多语种;
  2. 可编辑ABC乐谱:生成音频前可直接修改旋律、和弦,再渲染音频;
  3. 参考音频风格迁移,实现AI翻唱;
  4. 自由设置主歌、副歌段落结构,调整曲风。

优点(附带依据)

  1. 具备乐谱中间层,音乐结构可控、支持人工编辑 依据:双阶段流程先输出ABC文本乐谱,用户可手动修改和弦、旋律,再渲染音频;支持智能Agent迭代修改乐谱做二次创作,区别于直接生成波形的端到端音乐模型。
  2. 开源模型评测表现优秀,在WildSongBench上达到Suno v5相近水平 依据:官方WildSongBench评测,YuE2 best-of-8得分6.9632,超过Suno v6,接近Suno v5;是当前开源音乐模型第一梯队(评测为作者自测试集)。
  3. 支持一次性生成完整长歌曲,RTX4090显卡可71秒生成3.6分钟歌曲 依据:官方基准测试,RTX4090环境,完整规划+渲染3.6分钟歌曲耗时71秒,原生支持长音频生成,无需分段拼接。
  4. 输出48kHz立体声,人声与伴奏分离建模,支持多语种多曲风生成 依据:模型输出48kHz立体声;支持中英日韩粤等语言,流行、嘻哈、爵士等多种曲风;支持基于参考伴奏做AI翻唱。

缺点(附带依据)

  1. 官方原生主要支持Linux+N卡环境,Windows原生部署难度大 依据:官方推荐环境为Linux系统+英伟达显卡,Windows无原生支持,Windows用户需要借助WSL或第三方打包版本运行。
  2. 提示词明确要求生成音乐时,偶有弱化旋律、偏向环境音效的问题 依据:社区实测反馈,部分提示词场景下模型会偏离乐器旋律,生成偏环境氛围音;提示词对风格、音色描述的精细度要求很高,容易出现提示词不遵守的现象。
  3. 完整推理推荐24GB显存显卡,低配显卡推理会受限,量化版本会损失音质 依据:官方推荐24GB显存GPU(RTX4090)跑原始BF16权重;显存不足必须使用量化模型,量化会带来音质损失。
  4. 评测WildSongBench属于团队自建数据集,缺少第三方独立验证 依据:该基准数据集由M-A-P团队构建,评测结果为作者自报,外部独立评测较少,泛化性能有待更多实测验证。
  5. 复杂曲风场景下,歌词与人声对齐依然会出错 依据:社区实测,快节奏、复杂编曲时,演唱歌词容易出现抢拍、拖拍、咬字错位。