MiniMax Music3:几分钟内将歌词转化为完整歌曲
MiniMax 刚刚推出了一款新的 AI 模型,可能会改变你对音乐创作的看法。这款名为 Music3 的模型,只需简单的歌词和对你想要氛围的简短描述,就能生成一首完整的歌曲——最长可达五分钟。无需乐器,无需录音室,只需几个词和大量的 AI 魔法。
输出是 32kHz、16 位立体声 WAV 文件,对于从零开始生成的内容来说,听起来相当专业。但真正有趣的是其背后的技术。
两个模型的故事
Music3 并非一个处理所有事情的大型神经网络。相反,它是一个二人组——两个模型各司其职,和谐共作。可以把它想象成一个乐队,一个成员负责大局,另一个负责细节。
第一个是拥有 80 亿参数的全局语言模型。它是架构师,规划歌曲的长期结构和语义。它逐帧预测第一个码本,基本上决定了歌曲从头到尾的流程。有趣的是,它从 Qwen3-8B 开始,这是一个最初为文本设计的模型,但已被改编为以音乐方式思考。
第二个模型要小得多——只有 6 亿参数——但同样重要。这个局部模型接管每一帧中剩余的声学码本,分层添加精细的音频细节,使歌曲听起来丰富而生动。
所以,一个大脑处理骨架,一个灵活的助手填充血肉。这种分工似乎效果显著。
保持连贯性
AI 音乐生成中最大的挑战之一是在长时间内保持连贯性。许多模型开始很强,但在一分钟左右后失去线索。据 MiniMax 称,Music3 的表现令人印象深刻。它能在整首曲目中保持音乐主题、节奏、人声身份和编曲进展。
它也不会跳过任何结构元素。你会得到前奏、主歌、预副歌、副歌、桥段、器乐间奏和尾声——所有精心制作的歌曲应有的部分。

亲自尝试
MiniMax 已在 GitHub 上发布了模型页面,并附有示例歌曲供你试听。所以如果你好奇这个 AI 能做什么,不必只听他们的一面之词——去听听看,看看它是否击中正确的音符。
关键要点
- Music3 从歌词和描述生成最长 5 分钟的完整歌曲,输出 32kHz 立体声 WAV。
- 双模型架构:一个 8B 全局 LLM 处理结构,而一个 0.6B 局部 LLM 填充声学细节。
- 长形式连贯性:保持主题、节奏、人声身份和编曲贯穿始终。
- 完整歌曲结构:包括前奏、主歌、副歌、桥段等。
- 可在 GitHub 上获取,并提供示例曲目供试听。