跳转到主要内容

MiniMax的Music3:几分钟内将歌词变成完整歌曲

如果你能哼唱一段旋律,写下几句歌词,然后在几分钟内得到一首完整的歌曲,那会怎样?这就是MiniMax最新创作Music3音乐生成模型的承诺。最近推出的这款AI工具,将你的文字和简单描述转化为完整的曲目,最长可达五分钟——无需乐器,无需录音室,没问题。

输出是32kHz、16位立体声WAV文件,对于从零开始生成的东西来说,听起来相当令人印象深刻。但真正的魔力在于它内部的工作方式。

两个模型的故事

Music3不仅仅是一个大型神经网络做所有事情。相反,它是一个巧妙的组合,每个部分都有自己的工作。把它想象成一个乐队:一个成员负责大局,另一个填充细节。

第一个是全局LLM,一个庞大的80亿参数模型,预测歌曲的整体结构——主歌、副歌、桥段等等。它就像作曲家,勾勒出整个作品,决定能量何时上升和下降。这个模型实际上是从Qwen3-8B初始化的,一个知名的语言模型,但已被改编为以音乐术语思考。

第二个是局部LLM,一个小得多的6亿参数模型。它的工作是预测剩余的声学细节,使歌曲感觉生动的精细声音——微妙的吉他弹奏、歌手声音中的呼吸、钹的撞击声。如果全局LLM是建筑师,局部LLM是室内设计师,确保每个角落都感觉合适。

它们一起以分层自回归的方式工作。全局LLM逐帧预测第一个码本,设定语义和结构基础。然后局部LLM逐层填充其余部分,直到歌曲完成。

保持连贯性

AI音乐生成中最大的挑战之一是保持长作品的连贯性。许多模型开始强劲,但中途失去线索,导致混乱的断音。MiniMax声称Music3完美处理了这一点,从开始到结束保持音乐主题、节奏、人声身份和编曲进展的稳定。

这意味着你得到的歌曲实际上感觉像一首歌——有适当的前奏、主歌、易记的副歌,也许还有桥段,以及令人满意的尾声。不再有随机噪音或突然转变。官方公告甚至强调,该模型可以在整个五分钟的持续时间内保持这些元素,这绝非易事。

自己尝试

如果你好奇想听听Music3能做什么,团队已经在GitHub上发布了模型页面,并附有示例歌曲供你聆听。你可以自己判断它是否名副其实。

这次发布是AI音乐生成更广泛趋势的一部分,Suno和Udio等公司也在推动边界。但MiniMax的方法——使用大模型处理结构,小模型处理细节——似乎特别高效。这是在质量和计算成本之间取得平衡的聪明方式。

这对音乐意味着什么

对于音乐家来说,这可能改变游戏规则。想象一下,能够快速生成演示曲目与乐队成员分享,或尝试不同编曲而无需在录音室花费数小时。对于爱好者来说,这是一种有趣的方式,将他们的歌词想法变为现实,即使他们不会演奏乐器。

当然,关于版权和原创性存在疑问,但那是另一天的对话。目前,Music3是使音乐创作更易接近的迷人一步。

所以,如果你曾经有首歌在脑海中挥之不去,但无法表达出来,也许这是你的机会。写下那些歌词,描述你想要的氛围,让Music3完成其余工作。谁知道呢?你可能会创作出下一个热门歌曲——或者至少是下次公路旅行的易记曲调。

关键点

  • MiniMax-Music3 从歌词和描述生成最长5分钟的完整歌曲。
  • 双模型架构:80亿全局LLM处理结构,6亿局部LLM填充声学细节。
  • 输出:32kHz、16位立体声WAV文件。
  • 连贯性:在长曲目中保持主题、节奏和编曲。
  • 可用性:模型页面和示例在GitHub上。