这篇收在我们的记谱术语指南里。
扒谱工具处理音频的方式各不一样,最大的分别在于一次只能跟一个音,还是能同时跟好几个音。这就是单音扒谱和复音扒谱的区别。想知道一个工具实际能干什么,看这一点比看宣传文案里的准确率数字管用得多,拿它扒你真正想扒的曲子之前也该先弄清楚。
什么是单音扒谱?
单音扒谱是把同一时刻只有一个音的音频转成乐谱。“单音”(monophonic)指的是单声部:任何时刻都只听得到一个音高。
因为只有一个音高,单音扒谱是两种扒谱里简单的那一种。信号里只有一个频率占主导,算法追踪音高变化时很有把握,要绕开的干扰也很少。
单音音频举例
长笛独奏是最典型的例子。大多数管乐器本来就一次只能发一个音,无伴奏的人声旋律(阿卡贝拉独唱、传统民歌)也属于这一类。
能弹和弦的乐器上,单弦旋律同样算单音。吉他手只在高音 E 弦上弹旋律,别的弦都不碰,出来的就是单音音频,扒谱工具处理起来很轻松。单独一条贝斯线也一样,不管是电贝斯、低音提琴还是合成器弹的。
单音音频为什么好扒
单音音频给算法的信号更干净。没有互相抢的频率,也没有重叠的泛音,软件顺着时间追踪基频时,拿不准的地方比复音音频少得多。
信号处理也就那么几步:找出占主导的频率,跟着它随时间的变化走,再把这些数值换成音名和节奏。所以最早的扒谱软件都只做单音输入。对单声部音频,基础的频率分析就够用;换成和弦和多层声部,它就完全应付不了。
什么是复音扒谱?
复音音乐指同一时刻响着不止一个音的音频。比如钢琴手弹着和弦,左手还按住一个低音;又比如吉他手扫着弦,高音弦上同时响着旋律。只要某一刻有不止一个音高在响,就是复音。
复音扒谱就是把这种音频转成乐谱,并且把每个在响的声部都抓出来,不只抓最响的那个。单音扒谱跟的是一根线,复音扒谱得同时理清好几根缠在一起的线,再准确地排到谱上:可能是同一件乐器的谱里两个声部互相绕着走,也可能是钢琴两只手上各自独立的旋律线和低音线。
复音音频举例
钢琴曲是最常见的复音难题。哪怕只是一个简单的三和弦,工具也得在同一瞬间认出好几个音高,再把它们放到谱表上正确的位置。
吉他独奏也很快就会碰到复音。空弦配上按弦的音,或者一边扫和弦一边挑出旋律,就有了好几个独立的声部,每个都得分开追踪。复音算不上什么特殊情况,大家平时弹的多半就是它。
复音扒谱为什么难
难就难在泛音重叠,老模型在这上面处理得很差。几个音一起响的时候,各自的基频和泛音混成一条波形,早期软件没什么办法判断哪个频率属于哪个音。
一个钢琴和弦里,每个音都会带出一串泛音,低音的高次泛音可能正好落在同时响着的高音的基频上。这样缠在一起的声音,早期算法很难可靠地拆开。专门用复音素材训练的现代 AI 模型改变了这一点。像 Songscription 的钢琴扒谱这样的工具,就是围绕这个问题做的,它们的模型学会分开各个声部、认出和弦排列,不会直接取那个占主导的频率了事。不是每段录音都能扒得毫无差错,但现在的模型和老办法扒出来的东西,差距很大。
单音扒谱和复音扒谱的主要区别
实际的区别,说到底是信号有多复杂,以及算法得拿它做什么。
- 单音扒谱顺着时间追踪一个占主导的频率。算法的目标很明确,这里的音高检测已经是比较成熟的问题,真出错时,通常错在节奏上,音本身很少错。
- 复音扒谱得同时跟住好几个重叠的频率,还要把基音和它们的泛音区分开。
- 来源不同。 单音音频来自管乐独奏、无伴奏人声,或者单独的单弦旋律。乐手平时弹的大部分东西都属于复音:钢琴和弦、吉他扫弦,以及任何同时有不止一个声部在响的音乐。
- 结果不同。 单音扒谱得到的是一条旋律线。复音扒谱要处理多个声部、和弦排列、声部进行,还有各个独立声部之间复杂的节奏。
为什么多数乐手需要复音扒谱
真实的音乐很少是单音的。就算是吉他独奏,你按新音的时候空弦也还在响;钢琴只要按下第二个键就成了复音,而钢琴手平时弹的多半都是这样。单音工具只能抓到其中一部分。
音乐越密,越考验工具的复音能力。初学者也许会练简单的单音旋律,可水平往上走以后,要弹的是和弦进行、对位和多层编配,单音工具本来就不是为这些做的。你最想扒的那些曲子,多半都得靠复音支持。
AI 怎么处理复音和单音音频
单音旋律好办,算法顺着时间追踪一个占主导的频率,用相当直接的音高检测就行。好几个音同时响时,模型得认出并分开互相重叠的频率模式,用复音音乐训练过的神经网络在这件事上帮了大忙。
复音扒谱能往前走,靠的就是转向深度学习。老的信号处理方法碰到重叠的音高就过不去了;现代神经网络能学会认出和弦模式和乐器组合,那些方法做不到。根本的难点仍然是泛音重叠。每个音都带着一串泛音,声音的厚度和音色就是从这儿来的;几件乐器一起演奏时,这些泛音列互相重叠、干扰,很难说清哪个频率属于哪个声源。
实际准确度是什么样
可靠的复音扒谱给出干净的乐谱:和弦排列正确,凭空多出来的音很少,低音、旋律和和声分成不同的声部,节奏也对得上。常见的出错方式也在意料之中:密集段落里漏掉低音,强泛音被当成重复的音,装饰性的花音被误认成长音。
编配复杂、音频质量差的时候,效果就会下降。干净的钢琴独奏录音,训练得好的模型能扒得不错;乐器互相串音的密集现场混音,同一个模型扒出来就得多花功夫修。有的工具把扒谱结果和钢琴卷帘编辑器或乐谱视图放在一起,比如 Songscription 的音频转乐谱流程,检查修改时就不用在几个软件之间来回切。
挑复音扒谱工具要看什么
号称支持复音的工具,实际效果并不一样,决定用哪个之前最好自己查清楚。
先用自己的音频试
别看宣传页说支持复音就信。不少工具打着 AI 高准确率的旗号,其实一次只跟一个音。上传一个简单的钢琴和弦或者一小段扫弦,看看扒出来的是什么。真能处理复音的工具,会在同一个时间点上给出好几个音,不会每一刻只给最强的那个频率。
查清模型实际支持哪些乐器
复音效果跟乐器关系很大。钢琴模型很强的工具,换到吉他或铜管上,效果可能明显差一截。不同乐器的泛音特征和演奏技法差别很大,每种都得单独训练。明确说出自己擅长哪些乐器的工具,比号称什么都能扒的更值得选。如果你主要弹一件乐器,专门用它训练的模型通常比什么都做的通用模型强。
导出格式灵活
扒完以后,最好能导出几种格式:演奏看乐谱,在 DAW 里用 MIDI,在打谱软件里用 MusicXML。它们各有各的用处,只能导出一种格式的工具,后面的活就会处处卡手。想细看怎么用导出的 MIDI,可以读我们的音频转 MIDI 指南。
写在最后
大部分音乐都是复音的,大部分乐手也需要能处理复音的工具。单音扒谱有它的用处(一条独奏旋律、一段单独的贝斯),但在人们真正想记下来的音乐里,它只占很窄的一块。
复音支持扎实的模型,扒单音音频毫不费力;只做单音的工具,永远扒不出你右手下的那个和弦。拿不准的时候,就拿你打算扒的最难的东西去测,别拿最简单的:测和弦,不测音阶。
常见问题
单音扒谱和复音扒谱有什么区别?
单音扒谱把同一时刻只有一个音的音频转成乐谱,做法是顺着时间追踪一个占主导的频率。复音扒谱处理的是同时响着不止一个音的音频,所以得把每个正在发声的声部都抓出来,不能只抓最响的那个。单音的来源有管乐独奏和无伴奏人声;大家平时弹的多半属于复音,比如钢琴和弦、吉他扫弦。
为什么复音扒谱比单音扒谱难?
难在泛音重叠,信号不好拆开。几个音一起响的时候,各自的基频和泛音混成一条波形,低音的高次泛音还可能正好落在同时响着的高音的基频上。现代 AI 模型专门用复音素材训练过,对付这个问题比老式信号处理方法强得多,不过也不是每段录音都能扒得毫无差错。
怎么判断一个扒谱工具是不是真能处理复音?
用你自己的音频测一下,别光信宣传页。上传一个简单的钢琴和弦或一小段扫弦,看看扒出来的结果。真能处理复音的工具,会在同一个时间点上给出好几个音,不会每一刻只给最强的那个频率。另外也要查查模型实际支持哪些乐器,复音效果跟乐器关系很大。
