MiniMax发布音乐生成模型MiniMax-Music3:AI可创作最长5分钟完整歌曲
8月14日,AI公司MiniMax今日正式推出音乐生成模型MiniMax-Music3,该模型能够根据用户提供的歌词和音乐描述,生成长达5分钟的完整歌曲,输出格式为32kHz、16-bit立体声WAV文件。
在技术架构上,MiniMax-Music3采用分层自回归架构,由两个核心组件协同工作:
- Global LLM(全局语言模型):参数规模为8B,逐帧预测第一个RVQ码本,负责建模歌曲的长程语义与结构变化,如音乐主题、节奏和编曲推进。该模型基于Qwen3-8B初始化,先适配音乐语义词元的嵌入层和输出层,再与Local LLM联合建模全部RVQ码本。
- Local LLM(局部语言模型):参数规模为0.6B,预测每一帧中其余的声学码本,负责恢复细粒度的声学信息,使音乐听感更加丰富真实。
官方表示,MiniMax-Music3能够在长音频中保持音乐主题、节奏、歌声身份和编曲推进的一致性,覆盖前奏、主歌、预副歌、副歌、桥段、器乐间奏和尾奏等完整歌曲结构,向“由用户定义与协同创作的AI音乐创作伙伴”的目标又迈进一步。
值得注意的是,MiniMax已在2026年7月宣布其AI视频生成服务将在未来几个月内并入MiniMax Lab(由前DeepMind科学家领衔的研究团队),但音乐模型MiniMax-Music3的归属目前尚未明确。业界认为,随着AI音乐生成技术的不断成熟,版权与伦理问题将成为该领域下一步亟待解决的关键挑战。