天谱乐大模型发布4.7,让AI音乐更懂“二次创作”
2026/07/23 13:00AI云资讯17546
7月18日,2026 WAIC世界人工智能大会期间,趣丸科技正式发布天谱乐大模型V4.7,并将其接入旗下对话式音乐创作智能体Tunee,同时通过天谱乐OpenAPI向开发者和企业用户开放。
相比单纯提高音质或延长歌曲时长,V4.7此次更新的重点,是让AI生成的音乐变得更容易控制,也更适合继续修改。
它意味着,AI音乐的竞争正在进入新的阶段:在“能不能生成一首歌”之后,行业开始回答另一个问题——用户能否把这首歌持续改到满意。

一首歌生成之后,创作才真正开始
围绕二次创作,天谱乐V4.7重点升级了Remix改写和翻唱Cover能力。
用户可以上传已有的音乐素材,在保留核心旋律或音乐动机的基础上,对作品的曲风、编排和演唱方式进行重新设计。
例如,一段原本偏抒情的旋律,可以被重新改编为电子、摇滚或轻爵士风格;一首已有歌曲可以更换歌词和演唱音色,同时尽可能保持原有旋律的辨识度;创作者也可以通过提示词,调整乐器音色、和声、人声以及伴唱等元素。
这种能力的关键,在于既要允许模型自由发挥,又要避免它脱离创作者原意。
尤其在翻唱场景中,新歌词与原歌曲的字数、段落长度往往并不一致。如果模型只机械地复刻原曲,歌词与旋律很容易错位;如果赋予模型过多自由,它又可能逐渐偏离原来的核心旋律。
天谱乐团队将V4.7在这一场景中的能力称为“快速回归动机”:模型可以根据新的歌词和结构进行适当改写,同时在关键位置重新收束到主旋律,维持整首作品的辨识度。
V4.7还针对参考音频泄露进行了优化。模型在学习原歌曲旋律和结构时,会尽量减少对原始人声和音色的直接复制,使生成结果拥有更独立、干净的声音表现。
对于普通用户,这些升级意味着创作不再需要频繁“推倒重来”。对于音乐人、短视频创作者以及广告和影视从业者,AI生成的结果也更接近可以继续加工的创作素材。
从“会写歌”,走向“听得懂修改意见”
除二次创作外,天谱乐V4.7也继续提升了常规歌曲生成能力。
据天谱乐团队介绍,新版本对旋律动机、乐句气口和歌曲动态进行了优化,试图减少AI音乐中常见的机械重复感。模型在鼓、贝斯、和声与人声之间的空间分离度也有所提升,尤其在慢节奏和放松类曲风中,能够呈现更细腻的情绪和编排层次。
更重要的一项变化发生在提示词响应上。
过去,用户即使在提示词中明确提出“减少鼓点”“增加伴唱”或“突出某种乐器”,模型也不一定能够稳定执行。V4.7重新调整了训练数据的标签体系,提高对乐器音色、和声、人声等信息的识别和响应能力。
这使AI音乐模型开始更像一个能够理解修改意见的创作搭档。
用户提出的要求越具体,模型越需要准确地区分一首歌中的旋律、节奏、音色和演唱方式,并判断哪些部分需要保留,哪些部分可以重新生成。
从实际使用体验看,这类技术升级最终指向的是一种“确定性”:用户输入相同的创作要求时,模型更容易给出符合预期的结果,减少反复生成和筛选的成本。
在生成性能方面,天谱乐称V4.7整体性能提升约20%,流式生成首包响应时间20秒左右,输出为48kHz双声道音频。
四代架构,分别补齐上一代的短板
从2024年至今,天谱乐先后探索了四代音乐生成架构。不同架构之间存在时间重叠,一些路线曾经并行研发。
第一代架构采用语言模型与离散音乐表征,解决的核心问题是让模型根据一句话,生成一段拥有旋律、节奏和基本段落的音乐。这也是国内率先推出自研音乐大模型的厂商。可以将这一阶段理解为:AI开始学会“写出一段歌”。
第二代架构采用掩码自回归模型与连续声学表征,重点转向完整歌曲结构,包括主歌、副歌以及不同段落之间的前后呼应。到了这一阶段,AI需要学会“把歌写完整”。
第三代架构使用扩散模型与连续音频表征,将重点放在音质、人声、器乐细节和局部修改能力上,并大幅提升生成速度。同时,天谱乐团队推出了全球首个多模态音乐生成大模型,支持文本、图片和视频等多种输入方式生成音乐。这一阶段,模型开始解决“怎样让歌更好听”。
第四代架构则采用分层渐进式方案,将音乐生成拆分为音乐性、语义和声学三个层次,再由粗到细依次完成。模型先确定歌曲的主题动机和整体结构,再生成具体内容,最后补充人声、音色与器乐细节。用创作流程来理解,就是先确定一首歌要表达什么、怎样展开,再完成编曲和演唱,而非在同一个阶段同时处理所有信息。
这种分层方式牺牲了一部分纯扩散模型的极致速度,却换来了更清晰的歌曲结构、更稳定的提示词响应,以及更适合二次创作的控制能力。
V4.7是第四代架构上的第七个版本。它延续的核心方向,是让音乐模型既拥有创作空间,又能够遵循用户意图。
AI音乐的下一场竞争:从生成结果到创作工作流
据第三方测试结果显示,天谱乐V4.7在60组中英文测试样本中,与Suno V5.5、Mureka V9和MiniMax V2.6进行了对比。
在Meta Audiobox Aesthetics与SongEval两套评估体系下,V4.7在内容享受度、作品记忆点和声音清晰度等指标中获得较高分数,其余音乐性、连贯性和自然度指标也处于第一梯队。
不过,对AI音乐模型而言,客观评分只能反映一部分能力。
从行业发展来看,音乐生成模型已经完成了从短音频、纯音乐到完整歌曲和人声演唱的快速跨越。模型之间的差距,也开始从“第一次生成是否惊艳”,逐渐转向对创作过程的理解。
当生成一首歌的门槛不断降低,创作者会提出更多要求:能否保留其中最喜欢的旋律?能否只修改某一种乐器?能否换一种人声,却不破坏原来的情绪?能否让同一份素材快速适配短视频、广告、游戏和影视等不同场景?这些问题很难通过单次生成解决。
2024年天谱乐首次对外发布时,趣丸科技副总裁贾朔曾提出,AI音乐工具需要真正嵌入内容创作者的工作流,解决创作过程中的实际问题。
两年之后,V4.7可以被视为对这一问题的进一步回答。
一键成曲让更多人第一次拥有了创作音乐的机会。但真正的创作通常包含选择、修改、推翻和重来。
当AI开始理解这些过程,它提供的也不再只是一首偶然生成的歌曲,而是一种可以被持续使用的音乐创作能力。
相关文章
- 它石智航AWE 3.5具身基座大模型正式发布,打造改变世界的物理AI
- 全栈算力破局落地难题,超云携全新大模型推理方案亮相 WAIC2026
- AI记忆头部公司获亿元Pre-A轮融资,要改写大模型训练范式
- 科大讯飞联合主办WAIC法律大模型分论坛 星火晓法超级智能体首次发布
- WAIC 2026|M50 Inside终端集中亮相,端侧大模型迈入规模化商用新进程
- 3B参数跑赢千亿大模型!Om AI联汇携全球首个端侧原生VLX模型系列亮相WAIC
- 物理世界大模型率先落地能源行业,洞察时空携手皖能集团产业研究院打造“安徽能源智能体”
- 努比亚智能体大模型率先通过备案 为AI手机筑牢安全根基
- “首发,前沿大模型突破渗透测试新范式”——绿盟智能渗透测试系统2.0正式发布
- OpenAI发布GPT-Live-1大模型,智能语音模式全面升级
- 国内首个!飞渡科技工业级空间智能大模型“峥嵘“通过国家网信办备案 空间智能产业迎来合规商用里程碑
- 视频生成大模型搞不定几何一致,如视让每一帧符合物理世界的逻辑
- 人人都有大模型,千匠网络押注的是落地能力
- AI大模型产业应用创变营顺利举办,智数集团携东莞软协共探AI产业落地路径
- 全球前三!中国电信网络大模型及智能体 斩获GSMA多项国际权威认证
- 大模型重塑视觉 AI,商汤获Gartner认定为全球前沿技术创新者
AI企业
更多>>AI硬件
更多>>AI产业
更多>>AI技术
更多>>- 全球最强开源模型 Kimi K3 发布,参数规模 3 万亿,真的是强!
- 范式变革!东软发布AI原生软件工程白皮书,重构软件产业底层逻辑
- KAT-Coder-Pro V2.5正式发布:从“写代码”迈向“做工程”,Agentic能力全面升级
- 自变量机器人王昊:训练世界模型需付出“时间税”,解决模态对齐是当务之急
- 腾讯发布CodeBuddy Security,用AI Agent实现更高效的代码审计
- Twinkle x昇腾,率先实现Deepseek-V4系列模型高效训练
- 高德发布鸿蒙首个生成式 UI 开源框架 AGenUI,告别传统 UI 开发模式
- 发布即适配| 天数智芯全力支持腾讯混元Hy3 preview 开源落地,共推国内大模型产业普惠









