YuE2音乐生成模型发布:符号规划先作曲后演奏,质量评分超越Suno v5

AI 画家正在创作中

YuE2音乐生成系统于9月正式发布,首次在一个统一模型中实现了符号音乐规划与音频生成的端到端集成。在WildSongBench基准测试(192个提示词)上,YuE2 best-of-8配置取得6.9632分,超越Suno v5的6.8721分,成为目前音乐生成质量评估中的最高分。这一系统采用"先作曲后演奏"的两阶段架构:先通过符号规划生成可编辑的乐谱(包含旋律、节奏与和弦信息),再将乐谱转化为包含人声与伴奏的完整音频输出。

符号规划如何提升生成质量

传统音频端到端生成模型直接从文本提示词产出波形,缺乏中间可编辑的音乐结构表示。YuE2引入符号规划作为中间层,模型首先生成ABC格式的乐谱文本,该乐谱以符号形式表达旋律走向、节奏型态和和弦进行,然后由第二阶段的音频合成模块将符号转化为完整歌曲。这一架构的核心优势在于音乐结构的可解释性和可编辑性:用户可以检查和修改中间乐谱来精确调整音乐走向,而无需依赖对生成模型的反复重试。

YuE2还在AudioBox PQ指标上表现突出,同时在文本到音乐的语义对齐(textalignment)维度上维持了高质量。与纯端到端生成方案相比,符号规划层为模型提供了一个结构化的"草稿"阶段,减少了音频生成中的随机性和风格偏移,尤其在长时程音乐结构(如完整歌曲的verse-chorus-bridge结构)的连贯性上优势明显。

多模态音乐编辑能力

YuE2系统集成了多项配套工具:SheetSage2负责音频到乐谱的转录(逆向解析),MERT2提供音乐表示学习支持,用户可以在符号层面对已生成的歌曲进行旋律、歌词、节奏和编曲的独立修改。"Cover&Editing"功能允许用户听一首歌后探索其旋律、节奏与和弦的符号表示,并在这些层面进行独立编辑——例如保持旋律不变只替换歌词,或保持和弦进行只改变节奏模式。

系统还提供了Genre Explorer功能,展示跨风格和跨语言的生成样本。YuE2的模型权重和WildSongBench基准测试已在Hugging Face上公开发布,供研究社区评估和复现。模型架构方面,YuE2采用3B参数的VAE变体用于符号到音频的生成,整个系统包含符号规划器、音频合成器和转录器三个独立但端到端可训练的模块。

YuE2的发布对AI音乐生成市场的格局具有直接影响。Suno和Udio目前是消费级AI音乐生成的主导产品,YuE2在质量指标上的超越表明符号规划路线在音乐结构控制上具有结构性优势。对于需要精确控制音乐结构的商业场景(如影视配乐、广告音乐、游戏原声),可编辑的符号中间表示比纯端到端生成具有明显的实用价值。YuE2团队计划在后续版本中扩展多语言歌词生成和实时交互式编辑能力。