跳转到主要内容

MiniMax Music3:将歌词转化为长达5分钟的完整歌曲

MiniMax Music3:将歌词转化为长达5分钟的完整歌曲

想象一下,输入几行歌词,描述你想要的感觉——也许是一首梦幻的合成器流行民谣,或是一首欢快的独立摇滚曲目——然后点击“生成”。片刻之间,你就能得到一首完整的歌曲,长达五分钟,包含人声、乐器和完整的编曲。这正是MiniMax新推出的Music3模型所承诺的。

工作原理:两个模型的协作

Music3的核心是巧妙的劳动分工。它不是用一个庞大的模型尝试做所有事情,而是使用两个专门的模型,像作曲家和编曲者一样协同工作。

第一个称为全局LLM,是大型模型——80亿参数。它负责歌曲的整体结构和长期流畅性。可以把它想象成建筑师,决定主歌在哪里,副歌何时出现,以及桥段如何构建张力。它从Qwen3-8B(一个强大的语言模型)初始化,并适应理解音乐语义。

第二个是局部LLM,小得多——仅6亿参数。但不要被它的规模所迷惑。它处理精细的声学细节,填充使歌曲生动起来的细微差别:人声中微妙的颤音、镲片的闪烁、低音线的温暖。它们共同创造出结构合理且音色丰富的曲目。

你得到什么:工作室质量的WAV

输出是32kHz、16位立体声WAV文件——基本上是CD质量的音频。这对于想在项目中使用AI生成音乐而不担心低保真伪影的音乐家和内容创作者来说意义重大。

但真正的魔力在于模型在长时间内保持连贯性的能力。MiniMax声称Music3可以在整个曲目中保持音乐主题、节奏、人声身份和编曲进展。不再有开头强劲但中途崩溃的歌曲。模型处理所有标准部分——前奏、主歌、预副歌、副歌、桥段、器乐间奏和尾声——而不会错过节拍。

为什么这很重要

对于独立艺术家来说,这可能改变游戏规则。卡在和弦进行上?需要向制作人推销的演示?Music3可以在几秒钟内生成完整的编曲,为你提供坚实的基础。对于内容创作者,这意味着免版税的音乐,根据你的特定需求定制,无论是播客开场还是视频背景音乐。

当然,也有疑问。AI生成的音乐会取代人类创造力吗?可能不会。但它肯定可以增强它,为探索和灵感提供新工具。随着技术的改进,人类和机器制作音乐之间的界限只会更加模糊。

开始使用

MiniMax已经在GitHub上发布了模型页面,并附有可以试听的示例歌曲。所以如果你好奇,就去看看吧。谁知道呢?你下一首最喜欢的歌可能是你在AI的帮助下创作的。


关键点

  • MiniMax Music3 从歌词和描述生成长达5分钟的完整歌曲。
  • 使用分层自回归架构,包含两个模型:8B参数的全局LLM用于结构,0.6B参数的局部LLM用于声学细节。
  • 输出32kHz、16位立体声WAV文件,具有高保真度。
  • 在整个曲目中保持音乐主题、节奏、人声身份和编曲
  • 可在GitHub上获取,并提供示例歌曲供试听。

Image