Agogic:0.8B 的音乐模型打败了 27B——因为换了一种记谱法
一个 0.8B 参数的小模型,在音乐生成质量上打败了同一个家族的 27B 大模型。
不是靠更多数据、不是靠更长训练、不是靠更巧的架构。只是换了一种把音乐编码成 token 的方式。
这是 Agogic 论文的核心发现,它直接挑战了当前 AI 圈最大的信仰之一:大就是好。
一个被跳过的变量
文本转音乐(text-to-music)的模型流水线很长:选骨干模型、准备数据、设计训练配方、选解码策略——最后还有一步,把音乐变成 token。最后这一步通常是个默认选择,没人认真测过它的影响。
Agogic 的做法很简单:把其他所有变量钉死,只换 tokenization。
- 骨干模型:Qwen3.5,从 0.8B 到 27B
- 数据:同一套
- 训练预算:相同
- 解码:相同
- 唯一变量:音乐被编码成 token 的方式
他们测了七种 tokenization,结果干净得让人意外。
表示,不是模型大小,才是瓶颈
核心数字:
- PMT(论文发布的新表示,10ms 精度计时、逐音符力度、多轨道纹理,609 个符号):0.8B 模型 FMD = 159
- 节拍网格(REMI 及其后代,当前主流):0.8B 模型 FMD = 272-286
FMD(Fréchet Music Distance)越低越好。PMT 比节拍网格低 1.7-1.8 倍,在某些协议下低 2.8 倍。
翻译成人话:一个 0.8B 的小模型,用 PMT 表示,打败了同一个家族 27B 的模型用节拍网格表示。
把骨干模型从 0.8B 放大到 27B(34 倍),FMD 几乎不动。但换一种 tokenization,FMD 直接砍半。
论文的原话是:"表示,不是模型大小,才是分布保真度的瓶颈变量。"
为什么节拍网格输了
当前主流的音乐 tokenization 分两派,各有妥协:
节拍网格派(REMI 及其后代):把每个音符的起始时间对齐到节拍格点上。好处是结构稳定,坏处是量化丢掉了微时序(micro-timing)和逐音符的力度变化——而恰恰是这些东西区分了"演奏"和"机械谱"。
文本-ABC 派:用文本格式的乐谱(如 ABC notation),信息更完整但和 LLM 的自然语言预训练对齐差。
PMT 走了第三条路:演奏分辨率(performance-resolution)。10 毫秒精度的计时、逐音符的力度、多轨道纹理。它不记录"谱子长什么样",它记录"这场演奏具体是怎么弹的"。
这个区分很关键:同一首曲子,不同演奏家的演绎差别巨大。节拍网格丢掉了这些差别,PMT 保留了它们。
不是运气,是类别效应
为了排除"只是 PMT 这个词表运气好"的可能,论文做了三个验证:
1. 换一个更小的骨干模型。 用一个 26M 参数的从零训练的模型,PMT 依然领先。效应不是大模型专有的。
2. 换一个不同的演奏分辨率 tokenizer。 效应依然存在。所以这不是 PMT 独有的优势,是"演奏分辨率"这一类表示的优势。
3. 不是更细格点的副作用。 把 PMT 生成的起始时间对齐到节拍网格的分辨率,PMT 仍然领先 67-129 FMD。不是"分辨率更高所以更好",是表示方式本身更好。
一个让人不安的副产物:印记效应
论文还发现了一个让人不安的现象,叫"印记诊断"(imprinting diagnostic):
已发表的文本转 MIDI 系统,在两个完全不相关的领域上,生成的和弦-时间分布几乎不变——72% vs 71%。
翻译成人话:你给它什么提示词,它基本不在乎,它生成的是自己训练分布里的东西。
这和当前文本转音乐系统"看起来能听提示词"的表象形成了尖锐矛盾。模型看起来在听,实际上在复读自己见过的东西。这个发现和 WorldCup Arena 里"模型其实在做同一件事"的结论遥相呼应——当前 LLM 的"理解"可能比我们以为的要浅。
一个轻量补丁
好消息是,论文发现了一个轻量的补丁:解码时约束(decode-time constraint)。
不加这个约束,乐器 F1 = 0.28,正确调性 = 0.16。加上之后,乐器 F1 = 0.60(翻倍多),正确调性 = 0.35(翻倍多)。而且不损失分布质量。
这意味着"听提示词"和"分布保真"是可分离的两个问题——你可以单独修一个,不碰另一个。
这意味着什么
Agogic 的结论是一个跨领域通用的工程原则:在砸钱放大模型之前,先检查你卡在了哪个变量上。
当前 AI 圈最大的信仰是"scale is all you need"——只要模型够大、数据够多,一切问题都能解决。Agogic 给出了一个反例:在音乐生成这个任务上,瓶颈不在模型大小,在表示方式。放大模型 34 倍几乎没用,换一种表示直接砍半误差。
这个教训适用于任何"有多个变量的系统":先做受控消融,找到瓶颈变量,再决定砸钱方向。盲目放大模型,可能只是在最贵的那个变量上做无用功。
论文还发布了完整的测试框架、25+ 个检查点、两个语料库(86.6k 对齐的 caption/MIDI/ABC/audio,和 6.25M captioned——音乐领域最大的标注语料)。这意味着以后任何新的音乐表示方案都可以被"测量,而非声称"。
这可能是这篇论文最大的贡献:它把"表示选择"从一个信仰问题变成了一个可测量的问题。
论文链接: https://arxiv.org/abs/2608.03999
代码与数据: 论文声明发布测试框架、25+ 检查点、两个语料库
讨论回复
加载中...正在加载回复...
推荐
智谱 GLM-5 已上线
我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。