授权要求
YuE2模型权重采用CC‑BY‑NC‑4.0协议(需署名,禁止商业用途),项目代码使用Apache 2.0协议。
项目基础信息
YuE2由香港科技大学HKUST与Multimodal‑Art‑Projection(M‑A‑P)团队开发,是开源全曲音乐生成模型。
- 适用场景:音乐人创作、短视频配乐、歌词转歌曲、AI翻唱、音乐研究实验;
- 底层技术:采用符号规划 + 声学流匹配双阶段架构。第一步生成可编辑ABC乐谱(旋律、和弦);第二步基于流匹配模型渲染48kHz立体声人声与伴奏。
核心功能(普通用户视角)
- 歌词+风格提示词生成完整歌曲,自带人声演唱与伴奏,支持多语种;
- 可编辑ABC乐谱:生成音频前可直接修改旋律、和弦,再渲染音频;
- 参考音频风格迁移,实现AI翻唱;
- 自由设置主歌、副歌段落结构,调整曲风。
优点(附带依据)
- 具备乐谱中间层,音乐结构可控、支持人工编辑
依据:双阶段流程先输出ABC文本乐谱,用户可手动修改和弦、旋律,再渲染音频;支持智能Agent迭代修改乐谱做二次创作,区别于直接生成波形的端到端音乐模型。
- 开源模型评测表现优秀,在WildSongBench上达到Suno v5相近水平
依据:官方WildSongBench评测,YuE2 best-of-8得分6.9632,超过Suno v6,接近Suno v5;是当前开源音乐模型第一梯队(评测为作者自测试集)。
- 支持一次性生成完整长歌曲,RTX4090显卡可71秒生成3.6分钟歌曲
依据:官方基准测试,RTX4090环境,完整规划+渲染3.6分钟歌曲耗时71秒,原生支持长音频生成,无需分段拼接。
- 输出48kHz立体声,人声与伴奏分离建模,支持多语种多曲风生成
依据:模型输出48kHz立体声;支持中英日韩粤等语言,流行、嘻哈、爵士等多种曲风;支持基于参考伴奏做AI翻唱。
缺点(附带依据)
- 官方原生主要支持Linux+N卡环境,Windows原生部署难度大
依据:官方推荐环境为Linux系统+英伟达显卡,Windows无原生支持,Windows用户需要借助WSL或第三方打包版本运行。
- 提示词明确要求生成音乐时,偶有弱化旋律、偏向环境音效的问题
依据:社区实测反馈,部分提示词场景下模型会偏离乐器旋律,生成偏环境氛围音;提示词对风格、音色描述的精细度要求很高,容易出现提示词不遵守的现象。
- 完整推理推荐24GB显存显卡,低配显卡推理会受限,量化版本会损失音质
依据:官方推荐24GB显存GPU(RTX4090)跑原始BF16权重;显存不足必须使用量化模型,量化会带来音质损失。
- 评测WildSongBench属于团队自建数据集,缺少第三方独立验证
依据:该基准数据集由M-A-P团队构建,评测结果为作者自报,外部独立评测较少,泛化性能有待更多实测验证。
- 复杂曲风场景下,歌词与人声对齐依然会出错
依据:社区实测,快节奏、复杂编曲时,演唱歌词容易出现抢拍、拖拍、咬字错位。