YuE2 技术报告:SongBench 6.96 碾压公开基线,Suno v5 该慌吗?
YuE2 技术报告SongBench 6.96 碾压公开基线Suno v5 该慌吗【免费下载链接】Yue2项目地址: https://ai.gitcode.com/hf_mirrors/Comfy-Org/Yue2就在中文社区的技术报告解读集中出现的前一天报告正文已于 9 月 27 日挂上 arXiv10 月 8 日社区解读开始发酵香港科技大学与 M-A-P 团队放出了 YuE2 的 56 页完整技术报告。最抓眼球的一句话是在 WildSongBench 上YuE2 的 SongBench 全局平均分达到 6.96best-of-8是全部受测系统中最高的观测均值专家听感评测则显示其音频质量与商用系统 Suno v5 相当。一时间开源碾压 Suno的叙事铺满评论区。但把报告读透之后会发现6.96 这个数字的成立有一整套前提评测集是 192 条真实用户提示的 WildSongBench6.96 是8 个候选中择优的采样口径而碾压的对象严格来说是 8 个公开基线——在面对 Suno v5 时专家偏好其实打成了 40.4% 对 39.9% 的平手。本文从报告原文出发拆解 6.96 分的来路、专家评测的设计细节以及分数口径之外那些容易被标题忽略的局限。一、6.96 分怎么来的一条从乐谱到 48kHz 立体声的生成链路先理解 YuE2 的技术骨架因为 SongBench 分数背后是一个与主流端到端音频生成截然不同的架构。YuE2 用一个约 3.58B 参数的 AR–NAR Mixture-of-TransformersMoT28 层、隐宽 2048、上下文 24,576 位置把生成过程显式分解为三层符号作曲规划s先用 ABC 文本乐谱写出旋律、和弦、调性、拍号、速度与曲式结构——这是人可读、可改的中间产物语义音乐 tokenc把乐谱展开为 25Hz、375 bit/s 的 MERT2 语义 token 序列32,768 项码本每 40ms 一个 token连续声学隐变量z在乐谱与语义 token 条件下通过双向 flow matching 预测 25Hz×64 维的声学 latent最终由独立训练的 Oobleck VAE 解码为 48kHz 立体声波形。生成概率被因式分解为p(score, semantic | text) × p(acoustic | text, score, semantic)自回归流负责先作曲再填细节非自回归流负责按谱演奏。训练数据约 34.6 万小时音乐全程 bf16、64 张 H800。这套设计的直接后果是同一个 checkpoint 能同时做创作、按谱编辑与零样本翻唱因为三者只差乐谱从哪来——创作是模型自己写谱编辑是用户改谱后重渲染翻唱则先用 SheetSage2 把参考录音转成乐谱再换风格渲染。本仓库作为 ComfyUI 生态的重打包版恰好把这条链路的三个关键权重都带了进来ComfyUI/ └── models/ ├── audio_encoders/ │ └── sheetsage2_bf16.safetensors └── checkpoints/ ├── yue2_3b_bf16.safetensors └── yue2_3b_int8_convrot.safetensors其中audio_encoders/sheetsage2_bf16.safetensors正是全曲主旋律转录器 SheetSage2报告称其在 15 组全曲转录对比指标中领跑 12 组RWC-Pop 人声旋律 F1 从 62.71 提升到 82.51checkpoints/yue2_3b_int8_convrot.safetensors则是为消费级显卡准备的 int8 量化变体——社区实测 24GB 显存即可本地跑通这也是本地 71 秒生成一首 3.6 分钟歌曲类教程能成立的基础。二、6.96 的完整口径192 条提示、两候选与 best-of-8回到分数本身。SongBench 是报告引入的七维歌曲质量评测Musicality、Melody、Arrangement、Structure、Instrumental、Mixing、Vocal全局平均分Global Avg取七维均值。所有系统统一跑在 WildSongBench 上192 条在野真实用户请求覆盖 15 个流派桶其中 94 条中文、98 条英文提示歌词与风格描述经各系统原生接口喂入。比较协议的关键是候选预算标准对比中每个系统对每条提示生成 2 个候选取 ASR 四次转写中音素错误率PER较低的那个。在此口径下YuE2SongBench 全局平均 6.7316Musicality 5.90758 个公开基线全部低于它YuE1 4.9165、SongBloom 4.2350、LeVo 2 6.3247、ACE-Step 1.5 6.0118、HeartMuLa 6.2483、DiffRhythm 2 5.2428、Muse 6.0349、MiniMax Music 3 6.2830。所以全面碾压公开基线这个表述在 6.7316 口径下就是成立的而且是用 3.58B 参数打出的——报告中 8 个公开基线里 6 个参数比它多例如 HeartMuLa 为 5.43B。而标题里的6.96 是 best-of-8 口径对每条提示生成 8 个候选先剔除在 SongBench Musicality、Q3O、PER 三维上被支配的候选再保留 Musicality 最高值 0.10 以内的然后依次按 Q3O 与 PER 择优。在此口径下 YuE2 达到6.9632SongBench Global Avg与 6.2666Musicality是包括商用系统在内所有受测系统中最高的观测均值——Suno v5 为 6.8721Mureka 9 为 6.9377。值得指出的是best-of-8 同时也带来了采样成本上的不对等商用接口通常每次请求只返回 2 首歌而 best-of-8 意味着 8 倍生成预算外加一次按指标排序的选择。换句话说6.96 是8 选 1 择优后的上限观测值6.7316 才是与商用接口同预算口径下的默认表现。在同一张表里两候选口径下 Mureka 96.9377与 Suno v56.8721仍排在 YuE2 之前这一点与碾压一切的传播口径存在温差。三、专家评测与 Suno v5对齐的细节与前提自动指标之外报告把专家听感评测当作感知质量的首要证据其流程设计相当严谨线上经 X、GitHub、Hugging Face 招募了 289 场参与837 组保留评价另有 62 名具有音乐学院训练背景或音频 AI 研究经验的付费标注者来自中央、上海、星海等音乐学院合计 4,439 组保留成对评价系统身份隐藏、A/B 顺序随机、每首歌至少聆听 30 秒且每批 32 题埋入 5 个一致性检查同音频必须判平、反转顺序必须保持原偏好。在这个协议下针对六个商用基线Suno v4.5 / v5 / v5.5 / v6 / v6 Wild、Mureka 9YuE2best-of-8vs Suno v4.557.3% 对 30.5%明显胜出vs Suno v540.4% 对 39.9%——几乎打平这正是对齐 Suno v5表述的来源vs Suno v631.6% 对 59.3%——反而落后尽管自动指标上 Bo8 的 SongBench Avg 更高音频质量是突出强项对六个商用基线的平局调整后平均偏好达到58.9%CR1 95% 置信区间 55.6%–62.2%p 1.70×10⁻⁶即在纯声音保真度与混音上专家对 YuE2 的偏好全面占优。换言之Suno v5 慌了这种情绪化标题需要降级为更准确的技术表述在一个需要逐题聆听、30 秒起评、一致性校验的盲听协议下一个 3.58B 的开源模型在整体质量上与 Suno v5 打成平手在音频质量维度上系统性占优——这是开源音乐生成第一次在成品感上站到商用第一梯队但距离碾压还有 v6 这道坎。报告还顺手回答了符号规划到底有没有用用同一 checkpoint、同一提示、同一采样预算做消融专家在整体质量上偏好先写旋律和弦乐谱再渲染的比例为49.3%远高于无规划生成的 34.6%p0.0070音乐性维度为 45.0% 对 29.4%而把语义 token 预测与声学生成合并进统一 MoT、而非分离的 LMDiT整体质量偏好为 53.4% 对 35.6%p0.0084。乐谱不只是可解释的附加品它本身就在提升听感。四、报告之外分数口径与评测集的三点冷静读技术报告不能只读摘要。以下三点是理解 6.96 乃至整个评测体系必须带上的上下文。第一分数口径会说话。6.96 最高观测均值与6.7316 两候选口径是同一个模型的两个数字传播时前者被反复引用、后者被略过。此外报告在二维指数可视化中给出了更细腻的定位质量指数SongBench: SongEval 按 2:1 加权上 YuE2 Bo8 为 88.34但Mureka 9 的质量指数最高90对齐指数上Suno v5 最高90YuE2 Bo8 为 83.89。在 0.6–0.8 的权重区间内做敏感性分析时Musicality 合成指数最高的是 YuE2 Bo8而全局平均合成指数最高的是 Mureka 9——不同维度上谁是第一取决于你更看重哪个指标。第二评测集与基线存在不对称。WildSongBench 是 192 条提示的小样本评测流派覆盖 15 桶中英比例为 94:98所有公开基线中HeartMuLa 被报告以 † 标注——它明确在训练后处理中使用了 SongEval 与 AudioBox 来过滤 SFT 数据并构造 DPO 偏好对属于用评测指标训练模型的情况。报告如实披露了这一点并把分数保留在排名里但读者横向比较时仍应意识到各家基线对评测指标的暴露程度并不相同。同理SongEval 维度上 HeartMuLa4.5519高于 YuE2 Bo84.2960歌词准确率PER最低的是 MiniMax Music 30.0627而非 YuE20.0844——碾压在个别维度并不成立。第三工程落地与许可边界同样重要。本仓库重打包自 m-a-p 的 YuE2-3B 与 SheetSage2README 明确标注 license 为cc-by-nc-4.0非商业许可这与开源对标 Suno的社区叙事之间存在一条需要创作者自己把握的红线。功能层面README 提供了两条官方工作流——YuE2 Music Cover零样本翻唱与 YuE2 Text to Music文字成曲对应报告里两个硬核结论翻唱评测用 948 首 SHS100K 未见作品完整乐谱条件下的 CLEWS mAP 0.647 与 Discogs-VINet mAP 0.288 双双压过 SongEcho0.419/0.122与 ACE-Step 1.5乐谱编辑则做到和声编辑达成率 79.54%、旋律 84.17%、节奏 73.43%同时未编辑内容保留度维持在 90.16%–94.34%——只换和声不动旋律这类白盒操作有数据背书而不是宣传话术。回到标题的问题Suno v5 该慌吗更准确的说法是——当开源模型第一次在同一盲听协议、同一候选预算约等于下与 v5 打成平手、并在音频质量上占优时商用闭源阵营的护城河已经从音质转移到了版本迭代速度与生态封闭性。YuE2 用一份 56 页的报告证明了一件事把作曲显式写成可编辑的乐谱不是牺牲音质换取可控性而是两条路同时走通。至于 v6 之后 Suno 的回应以及 YuE2 团队在 MERT2、SheetSage2 上的后续迭代才是这场竞赛真正的下一回合。【免费下载链接】Yue2项目地址: https://ai.gitcode.com/hf_mirrors/Comfy-Org/Yue2创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考