资源扒谱Andrew Carlins•阅读约 6 分钟

为什么 AI 扒谱的准确度时高时低

上传一段干净的钢琴独奏录音,扒出来的谱会非常准;换成乐队现场录音,结果可能就差得挺远。差距来自两方面:录音本身,还有 AI 模型是怎么做出来的。

为什么 AI 扒谱的准确度会随录音和模型变化,以及怎样拿到最干净的结果

上传一段干净的钢琴独奏录音,扒出来的谱会非常准。同一个工具换成一段乐队现场录音,结果可能就差得挺远。差这么多并不说明工具坏了,这是两方面共同作用的结果,完全可以预料:一是录音本身听起来是什么样,二是具体这个 AI 模型是怎么做出来的。

录音好扒还是难扒,取决于一些音乐上的因素;同一段音频换个工具出来就不一样,是因为模型之间有差别。想先了解基本情况,可以看看我们这篇对 AI 扒谱的准确度该有什么预期,本文就接着那篇往下讲。

影响 AI 扒谱准确度的音乐因素

有些录音 AI 就是更容易听明白。下面这几个因素能说明为什么有的音频扒出来更干净,扒得不理想时又能怎么办。想一步步做好准备、拿到尽量好的结果,可以配合这篇扒出准确乐谱的指南一起看。

非标准定弦和音律

大多数 AI 扒谱工具是拿标准西方音律的音乐训练出来的。录音要是用了别的,比如吉他整体降了一个全音,或者来自某种音与音之间距离本来就不一样的音乐传统,模型听到的声音可能找不到正好对应的音,只好归到它认识的最接近的那个音上。如果你经常用非标准定弦,上传前先把音频移调到标准定弦的音高,扒完再调整结果,这样通常最干净。

速度变化和不稳的节奏

AI 靠录音底下那层拍子来判断每个音落在什么时间点上。演奏者弹得比较随性,或者一段里自然地时快时慢,模型要琢磨的东西就多了。大多数时候它都处理得好。节奏弹性很大的录音,扒完在编辑器里稍微过一遍,一般就够了。

处理很重的音色和话筒串音

吉他失真开得很重,或者合成器叠了一堆效果,原本的声音上盖了太多东西,AI 就更难听出底下的音高。结果好坏要看具体是哪段录音。更麻烦的情况是一支话筒同时收进了好几件乐器。手上有单独的音轨或分轨,就上传那些,起点总会比整段混好的录音干净。

为什么 AI 模型本身也有影响

同一段录音交给两个不同的扒谱工具,出来的结果经常不一样。上面这些因素每个模型都会碰上,但各家工具应付得好不好,差别不小。原因在两点:模型是拿什么学的,以及它是不是专门针对某些乐器设计的。

模型拿什么训练

AI 扒谱工具是靠大量现成的音乐学出来的。训练用的音乐越广、越多样,模型碰到没见过的素材时通常处理得越好。用多种风格、多种录音条件训练出来的工具,适应面就宽。只拿很窄一类音乐训练的,在那个范围里表现不错,出了范围就差一些。

有的工具说自己是通用型的。这通常指最常见的几种风格它都能处理得像样,并不代表每种乐器、每种曲风都照顾得一样好。用一个熟悉你手上这类音乐的工具,结果往往最好。

是不是为特定乐器做的

专攻某一种乐器的工具,在这种乐器上通常明显更好。专门围绕钢琴做的模型,学透了钢琴是什么声音、音和音怎么叠在一起、延音怎么变化,还有那些让钢琴扒谱准起来的小细节。覆盖很多乐器的通用工具,得把这份注意力分摊到它会的所有东西上。想仔细看看几款主流工具怎么比,可以从这篇几款 AI 扒谱软件的对比看起。

不管用哪个 AI 扒谱工具,都能扒得更准

好工具本来就是照着真实录音来做的,大多数时候上传完马上就能拿到不错的结果。想要尽量干净的结果,下面几个简单的习惯每次都管用。

**用你能拿到的最好的录音。**无损音频给模型的信息比压缩文件多。如果压缩文件扒出来要改的地方比平时多,先找回原始音源再重新导出,多花这一步通常值得。MP3 转乐谱指南讲了压缩音频实际能扒到什么程度。

**有想要那件乐器的单独音轨,就传单独音轨。**一段钢琴独奏,扒出来总会比埋在整支乐队录音里的同一段钢琴干净。只有整段混音的话,可以先用分离分轨的工具把这件乐器单独提出来。就算提得不完美,单独的这条音轨通常也比整段混音好扒。

**选为你的乐器设计的工具,别用什么都扒的那种。**专攻钢琴的工具扒键盘声部更好,吉他工具是为有品乐器做的。工具和你要扒的东西对上了,扒完要清理的地方往往就少。

**把结果当成品之前,在钢琴卷帘里快速检查一遍。**扒得再好,自己过一遍也能很快找出需要小改的地方。这篇修正 AI 扒谱错误的指南讲了该看哪些地方、怎么改。

Songscription 怎么应对这些问题

Songscription 用的是多乐器 AI,各种真实录音都能扒出准确、拿来就能用的乐谱,钢琴和旋律乐器扒得尤其好。上传一段录音,马上就能拿到一份质量不错的底稿,直接在上面接着做就行。

模型是用各种条件下的真实录音训练的,所以房间声、中等程度的背景噪音,还有真实音乐里常见的那些音频瑕疵,都应付得了。Songscription 也能扒吉他、贝斯和鼓,同一次录音里的好几件乐器都能在这里扒完,不用换工具。钢琴和旋律乐器扒出来通常最干净;吉他和贝斯也扒得很好,不过看录音情况,偶尔需要改几处。

想改的时候,就用钢琴卷帘编辑器。在这里可以检查扒出来的结果、跟原始录音对照着听,改动都在同一个地方做。很多乐手本来就习惯扒完快速改一遍,全在一个视图里,改起来很顺手。

最后说几句

AI 扒谱把一件难事变成了几分钟就能搞定的活儿,不用再花几个小时。干净的独奏录音和热闹的现场录音扒出来差多少,取决于几个具体、可以预料的因素。知道是哪些因素,拿到结果时就明白自己看到的是什么,也知道一开始该怎么准备,才能扒得最干净。

大多数录音交给好工具,一上来就能把大部分活儿干完。输入更干净、选一个适合你乐器的工具、再快速检查一遍,通常就能把第一版结果变成完全能直接用的乐谱。

常见问题

为什么 AI 扒谱的准确度时高时低?

这种差别是两方面共同作用的结果,完全可以预料:一是录音听起来是什么样,二是具体这个 AI 模型是怎么做出来的。干净的钢琴独奏录音扒出来非常准,热闹的乐队现场录音结果可能差得挺远。非标准定弦、节奏不稳、音色处理很重、话筒串音,都会让录音更难扒。

同一段录音,为什么换个工具扒出来就不一样?

关键在于模型是拿什么学的,以及它是不是专门针对某些乐器设计的。用多种风格、多种录音条件训练出来的模型适应面宽;只拿很窄一类音乐训练的,在那个范围里表现不错,出了范围就差一些。专攻某一种乐器的工具,在这种乐器上通常明显比通用工具好。

怎样让 AI 扒谱工具扒得更准?

先用你手上最好的录音,无损文件给模型的信息比压缩文件多。有想要那件乐器的单独音轨,就传单独音轨,独奏声部扒出来会比埋在整支乐队录音里的同一个声部干净。选为你的乐器设计的工具,把结果当成品之前,再在钢琴卷帘里快速检查一遍。

关于作者

Andrew Carlins

作者

Andrew Carlins

Songscription 联合创始人兼 CEO

Andrew 在斯坦福和几位同样玩音乐的朋友一起创办了 Songscription,因为他们受够了想弹的歌总找不到谱。他从小弹钢琴,也吹过上低音萨克斯,还演过音乐剧。虽然好几年没登台了,他觉得自己的状态还没降半音。他在这里写扒谱的事,讲怎么把一首歌从录音里扒下来,变成纸上的谱子。

了解我们的团队

还有这些同一话题的文章,可以接着读。