
YuE2-3B 音乐生成模型:符号规划与智能编辑能力解析
YuE2-3B 是 m-a-p 开源的音乐生成模型,约 30 亿参数,支持歌词驱动生成完整歌曲,覆盖多语言演唱。本文解析其符号规划与智能编辑思路,并给出显存要求、ComfyUI 音频节点接入与 LoRA 微调等实践建议,为旋律构思与编曲调整提供参考。
查看原文 →内容为平台聚合整理,原文与最新动态以来源页面为准。
扫码进学习交流群
加专属老师微信图文介绍
项目定位
m-a-p/YuE2-3B 是开源社区 m-a-p(Multimodal Art Projection)发布的文本到歌曲生成模型,属于 YuE 系列的第二代版本,参数规模约 30 亿。模型在 ModelScope 上提供权重下载,当前下载量约 1064 次。它接收歌词与风格描述作为输入,输出包含人声与伴奏的完整歌曲音频,定位偏向音乐生成研究与创作辅助场景。
核心功能亮点
- 歌词驱动生成:以分行歌词为主要输入,配合流派、乐器、情绪等风格标签控制生成方向。
- 面向完整歌曲:目标输出并非短片段,而是带前奏、主歌、副歌结构的整首作品。
- 多语言演唱:覆盖英语、普通话、日语、韩语、粤语等演唱语言。
- 架构易衔接:采用语言模型式的 token 预测思路,便于与现有推理、微调工具链对接。
适用场景
- 音乐创作前期的 demo 试听与编曲思路验证。
- AI 音频生成相关课程、讲座中的案例演示。
- 短视频、播客等内容的主题曲与配乐试制。
- 作为 LoRA 微调、风格迁移等实验的基座模型。
上手提示
- 推理需按官方说明组合相应的子模型(人声与伴奏路径),建议以 ModelScope 模型页的部署文档为准。
- 3B 规模对显存有一定要求,建议使用 16GB 以上显存的 GPU,并视情况启用半精度加载。
- 可借助 ComfyUI 中的音频节点封装调用,接入既有的音频处理工作流;也可直接运行命令行推理脚本。
- 歌词分段与结构标记有助于模型理解歌曲结构,风格标签写得越具体,生成结果越可控。
- 生成存在随机性,建议固定随机种子做多轮对比,再筛选满意版本进入后续混音环节。
作者/来源:M-A-P
常见问题
YuE2-3B 是开源社区 m-a-p 发布的文本到歌曲生成模型,参数规模约 30 亿,属于 YuE 系列第二代。它以分行歌词和风格描述为输入,输出包含人声与伴奏的完整歌曲音频,常见用途是创作前期的 demo 试听、编曲思路验证,以及音频生成课程中的案例演示。
3B 规模对显存有一定要求,建议使用 16GB 以上显存的 GPU,并可视情况启用半精度加载以降低占用。推理时需按模型页提供的部署文档组合人声与伴奏路径的子模型。
目前覆盖英语、普通话、日语、韩语、粤语等演唱语言。生成时可结合流派、乐器、情绪等风格标签控制方向,标签写得越具体,结果越可控。
可以借助 ComfyUI 中的音频节点封装调用,接入既有的音频处理工作流,也可以直接运行命令行推理脚本。歌词分段与结构标记有助于模型理解歌曲结构,便于获得更稳定的输出。
生成本身存在随机性,建议固定随机种子做多轮对比,再筛选满意版本进入混音环节。同时可把歌词按主歌、副歌分行标注,并补充明确的风格描述,减少结果偏差。该模型也可作为 LoRA 微调、风格迁移等实验的基座。