资源扒谱Andrew Carlins•阅读约 7 分钟

Gemini 或 Claude 能把一首歌变成乐谱吗?

以前大家让 ChatGPT 把录音变成乐谱,现在又开始这样问 Gemini 和 Claude。这两个 AI 助手拿到音频到底能做什么、做不到什么?想要准确的乐谱,又该用什么工具?

Google Gemini 或 Anthropic Claude 能不能把一首歌变成乐谱,AI 助手拿音频能做什么,以及换什么办法能做到

本文属于我们的扒谱工具选择指南系列。

光靠它们自己不行。Gemini 和 Claude 都没法听一段录音就写出准确的乐谱,也都没法把印刷乐谱一个音不差地读出来。现在这两个模型都比单纯的文字聊天机器人强多了:Gemini 能接收音频和图片,Claude 能接收图片和文字,你能交给它们的东西早就不止是文字。但它们调教的方向是理解,比如把说话转成文字、描述一张图、围绕文字做推理。记谱要的是信号处理,这方面它们没练过。让其中任何一个扒一首歌,你会拿到一个流畅又自信的回答,里面满是从来没人弹过的音。

这也不代表它们在音乐上毫无用处。涉及文字的那一半,两个都很强:讲乐理,聊你贴进来的谱子,建议一个和弦进行,写一条单声部旋律的草稿,排一份练习计划。你要做的是分清这活儿哪一半是语言(它们帮得上),哪一半是从音频到乐谱(得用专门的工具),然后各用各的。

Gemini 和 Claude 在音乐上能做什么

两个模型早就不只会处理文字了。Gemini 是原生多模态的:你上传一个音频文件,它能把里面的话转成文字、总结录音内容、分辨是谁在说话,还能回答跟说话内容有关的问题。它也接收图片。Claude 接收文字和图片,你给它照片或文档,它都能读。所以给哪个看一张乐谱图片,它都能看完再回应。文件它们收得下,难的是把文件变成准确的记谱,这需要专门练过的本事。

在文字和乐理的范围里,两个都帮得上忙:

  • 讲乐理。 问它一个和弦进行为什么这样解决,三全音替代是什么,或者小调音阶怎么配和声,你会得到清楚、大体可靠的解释。
  • 讨论你以文字形式贴进来的谱子。 给它 ABC 记谱、和弦谱,或者用文字描述的一段音乐,它能说出用了哪些和弦,讲讲这段音乐是怎么回事,还能建议怎么改。
  • 建议和弦进行。 描述一种情绪或者给一个调,它会拿出几种和弦进行、重配和声的方案,或者一条可以试试的低音线。
  • 写一条单声部旋律的草稿。 你用文字描述一段曲调,它能用 ABC 这类文本记谱写出来,你再粘贴进打谱软件。

这几件事有个共同点:起点都是文字或描述,有用的产出也是文字。模型是在对音乐符号做推理,并没有把声音或印刷的谱页转成准确的音符。一旦任务变成“这是一段录音,给我乐谱”,两个都应付不来。

它们为什么扒不了录音

把音频变成记谱是个信号处理问题,而且很难。你得测出每个音的音高,找准每个音从哪一刻开始、到哪一刻停,把重叠的音分开(和弦里或整首混音里的复音),把时间量化成读得懂的节奏,最后才能配上正确的调号和拍号,写到谱表上。每一步都需要一个专门用音频训练过的模型。Gemini 听音频的本事是冲着语音练的,关心的是说了什么词、谁在说、什么意思,并不负责把同时响起的音高和起音拆开。Claude 压根不接收音频文件,要让它“听”一首歌,只能先另外转录一遍。

读印刷乐谱是同一个坑换了个样子。研究人员直接拿这项任务做基准测试,发现模型认谱面符号的准确率非常高,可大多数时候还是把它们转成了错的音符。它们会退回到均匀的四分音符和音阶式的走句,因为它们猜的时候依赖的是文字规律,而不是眼前真正的音乐。所以就算模型把谱页“看”得清清楚楚,它报出来的音高和节奏也会偏离谱上写的东西。

你要是非让它们扒,两个都会做语言模型拿不准时会做的事:给出一个流畅、自信、看着像乐谱的回答,里面满是没人弹过的音。这种输出读起来很权威,错处不容易发现,比干脆给不出答案还麻烦。想全面了解真正的扒谱要经过哪些环节,可以看我们的讲解文章《AI 扒谱是怎么工作的》,里面把每个阶段都走了一遍。通用模型为什么偏偏栽在重叠的音上,《单音扒谱和复音扒谱》里有讲。

该用什么

从音频到乐谱这一步,就用专门为这件事做的工具。用 Songscription 的流程很简单:上传一个音频文件,或者粘贴一个视频链接,模型会检测出音符,给你可以编辑的乐谱,同时附上 MIDI、MusicXML、Guitar Pro 格式的指法谱,还有一个可以放慢来核对结果的交互式钢琴卷帘。不用手动一个个输入音符,导出之前还能在浏览器里把错音改掉。

第一遍扒完以后,这几个功能就用得上了。它会自动把钢琴声部分成左右两只手,也就是高音谱表和低音谱表,不会把所有音混成一条。它能从整首混音里单独分出一件乐器,所以编配复杂的歌最好一次扒一件乐器。你可以在内置编辑器里移调到任何调;编配模式能把一首很密的曲子简化成更容易弹的版本,也能为原曲里没有的乐器写一条单声部旋律。Gemini 和 Claude 给你的是一段关于这首歌的文字,这个工具给你的是一个能照着弹、还能接着改的文件。

准确度也要有个合理的预期。干净的独奏素材,比如单独一台钢琴、一把吉他或一条人声,扒出来比很多乐器同时叠在一起的整支乐队混音准得多。自动扒谱能很快帮你完成大部分工作,结果你还是得过一遍,把扒错的地方改掉。要做细致的排版,就导出 MusicXML,在 MuseScore 这类打谱软件里收尾。有的歌扒得很干净,有的歌怎么扒都别扭,原因是另一个话题,《AI 扒谱准确度为什么时高时低》里专门讲过。

Gemini 和 Claude 还能帮上忙的地方

乐谱到手以后,两个模型又有用了,因为这时候的活儿回到了文字和推理上。面前已经有乐谱、和弦谱,或者从 MIDI 里得出的和弦,它们哪个都能:

  • 讲一个难懂的和弦。 把和弦符号贴进去,问它由哪些音组成、起什么作用、上面配什么音阶。
  • 出指法的主意。 描述一段音乐和你弹的乐器,让它给个合理的指法或手的位置试试。
  • 做练习计划。 告诉它是哪首曲子、你的水平、你有多少时间,它会排出一套有条理的练法。
  • 把你心里已有的旋律写成文本记谱。 你已经能描述或唱出这段曲调的话,它会用 ABC 写出来,你拖进打谱软件就行。

扒谱模型把声音变成音符;拿到这些音符以后,Gemini 和 Claude 帮你弄懂它们、练熟它们。两样搭着用,先把录音变成乐谱,再借它们学着把曲子弹下来。AI 关于一首曲子能告诉你什么、不能告诉你什么,可以看《AI 能不能告诉你一首歌怎么弹》;OpenAI 的模型能不能做同样的事,可以看《ChatGPT 能不能做乐谱》。

常见问题

Gemini 能读乐谱吗?

只能读个大概。Gemini 能接收图片,你给它一张乐谱照片或一份 PDF,它能笼统地描述一下,说出是什么调,或者看出某一段音很密。它靠不住的地方在于把谱上的音一个一个读下来,再把正确的音高和节奏交给你。专门测这项任务的基准测试显示,模型就算认符号认得很准,真正转成音符时大多数还是会错,常常退回成一串均匀的四分音符和像音阶一样的走句。它对印刷乐谱的解读,当作粗略的概括看就好,别当成准确的扒谱结果。

Claude 能把一首歌扒成谱吗?

从录音扒不了。Claude 处理的是文字和图片,你把谱子以文字形式贴给它,比如 ABC 记谱或和弦谱,它能跟你讨论;它也能讲和声,还能照你的文字描述写出一条简单的单声部旋律。可你给它一个音频文件,它变不出准确的乐谱。把声音变成音符属于信号处理问题,要做音高检测,判断每个音从哪一刻起,还要把同时发声的音分开。这些是专门的扒谱工具做的事,聊天模型不做。

Gemini 或 Claude 能从音频做出 MIDI 文件吗?

从录音做不了。MIDI 文件需要先从音频里把音符检测出来,这两个模型都不做这一步,所以让它们听一首歌再输出 MIDI,得到的数据看着很笃定,其实是错的。你用文字描述一段旋律的话,模型也许能写出一小段文本记谱,你再拿去转成 MIDI。要从一段真实录音得到真正的 MIDI,就得用专门的音频转 MIDI 工具,它会检测音符,直接导出文件。

把一首歌变成乐谱,最好的办法是什么?

用专门做扒谱的 AI 工具。导入音频文件或链接,它会输出可以编辑的乐谱、MIDI 和钢琴卷帘,之后你再手动把结果修一遍。自动扒谱很快就能帮你完成大部分工作,干净的独奏素材扒出来也比整支乐队混在一起的录音准。要做最终排版的话,导出 MusicXML,在打谱软件里收尾。

想把录音变成乐谱,就从音频转乐谱开始:上传这首歌或者粘贴链接,先在浏览器里编辑结果,再导出。

关于作者

Andrew Carlins

作者

Andrew Carlins

Songscription 联合创始人兼 CEO

Andrew 在斯坦福和几位同样玩音乐的朋友一起创办了 Songscription,因为他们受够了想弹的歌总找不到谱。他从小弹钢琴,也吹过上低音萨克斯,还演过音乐剧。虽然好几年没登台了,他觉得自己的状态还没降半音。他在这里写扒谱的事,讲怎么把一首歌从录音里扒下来,变成纸上的谱子。

了解我们的团队

还有这些同一话题的文章,可以接着读。