AI 扒谱准不准,大部分在你点上传之前就定了。模型能扒出什么,取决于你给它什么。录音和设置阶段稳稳做好几件事,扒出来的谱就能直接用;做不好,就得返工大改。
影响结果的几个关键因素,大致按从大到小排是:录音环境、文件格式、乐器选择,以及导出前的检查。
先把音频录干净
Songscription 处理不完美的音频也没问题。上传现场录音、手机录的,或者各方面都不太理想的音频,照样能扒出能用的谱。下面这些步骤不是前提条件,只是让过程更顺、结果更干净的办法。送进去的信号越好,出来以后要收拾的就越少。想先心里有个数,可以看看不同乐器的 AI 扒谱准确度,里面讲了实际能做到多准;准确度为什么会有差别则解释了结果干不干净取决于哪些因素。
录音环境对扒谱准确度的影响,比其他任何因素都大。同一个模型,在安静房间里录的干净信号,扒出来总比在吵闹或混响很大的地方录的音频好,哪怕后面那段演奏得很好。
管好房间
尽量找最安静的地方录。空调、车流、电脑风扇的声音,在扒谱模型那里都会被当成信号。坚硬的表面会产生混响,把音符起始的地方糊掉,算法就更难判断一个音在哪里结束、下一个音从哪里开始。房间里有地毯、窗帘和书架,这个问题就会小很多,不用专门做声学处理。
话筒摆位和电平
录原声乐器,话筒要离声源近一点。插电乐器就对着音箱录,别隔着整个房间录。话筒越近,直达声占的比例越高,房间声就越少。
录的时候盯着输入电平表,峰值要离削波远一些。削波会带来数字失真,产生本来没有的泛音。模型分不清这些杂音和真正的音符,它们就会出现在结果里。正式录一整遍之前,先录一小段试试。
选对文件格式
Songscription 支持上传 MP3、WAV 和 M4A。也可以直接粘贴 YouTube、Instagram 或 TikTok 链接,拿参考录音来扒的时候很方便。
能选的话,就用 WAV。无损文件保留了完整的频率细节,模型要靠这些细节分辨相邻的音高,准确跟住音符的衰减。有损格式会丢掉一部分信息,事后也没法找回来。
高码率的 MP3 多数情况下够用。码率低了可能就开始出问题,所以上传前导出或转换文件时,宁可文件大一点,也要保证音质。如果手上只有压缩过的文件,我们这篇 MP3 转乐谱指南详细讲了这种情况下能扒到什么程度。
选对乐器类型
Songscription 每种乐器都有专门的扒谱模型,不共用一个通用引擎。选错乐器类型,是结果不好最常见、也最容易避免的原因之一。针对钢琴优化的模型,和针对吉他或人声优化的模型,处理同一个音频文件的方式根本不一样。
目前 Songscription 支持钢琴、吉他、贝斯、人声等好几种乐器。上传前确认一下,设置和录音里实际的乐器对得上。录音里不止一件乐器的话,就选你最想扒的那一件。模型是用完整混音训练的,通常只要乐器设置选对,它就能盯住那件乐器,你不用先把它单独分离出来。
了解 Songscription 擅长什么
钢琴在 Songscription 上开发得最久,不管录音质量和曲风怎样,结果通常都最可靠。扒钢琴的话,一般来说结果要收拾的地方是所有乐器里最少的。
小提琴、长笛、小号、萨克斯这类单旋律乐器表现也很好,尤其是话筒贴近录的时候。吉他、贝斯和人声,只要原始音频干净,扒得都挺可靠,结果通常准到可以当扎实的工作草稿,只需要改一点点。
鼓要单独说一下。把鼓扒成常规的谱子本来就难,Songscription 在这方面做得不错,能扒出能用的鼓谱。只是检查的时候,要比旋律乐器多花一点工夫。
选择导出格式
Songscription 有好几种导出格式。我们的建议是:要打印乐谱就选 PDF;要把音符导进 DAW,或者想要一个用途更广的文件,就选 MIDI;要在打谱软件里继续编辑,就选 MusicXML;要指法谱就选 Guitar Pro。当然,哪个最适合你的下一步,就选哪个。
导出前检查一遍
没有哪个扒谱模型每次都能给出完美的结果。检查时不用把每个可能的错都找出来改掉,抓住会影响读谱或演奏的那些就够了。
用钢琴卷帘来检查最省事。它把扒出来的音符和原始音频的波形并排显示,两者可以同时播放,哪里对不上一下子就听出来了。不该有的音符可以直接在钢琴卷帘里删掉,导出前所有事都在一个地方做完。建议你一段一段地过。
直接用完整混音
很多人会以为,扒一首制作好的歌之前得先把它拆成分轨。用 Songscription 一般不需要。模型训练时就学会了在其他乐器同时响着的时候,把你选的那件乐器挑出来。所以大多数完整混音,直接上传原曲,选好乐器,分离的事交给模型就行。要是你想扒的乐器被厚重的编曲埋住了,换一个干净点的段落,或者换一个更清楚的录音,比任何预处理都管用。
特别需要准确的时候
大多数扒谱任务容错空间都挺大,但有些场合容不得错。如果你是给学生准备教材、发布主旋律谱,或者要把谱子交给别的乐手演奏,对准确度的要求就比随手记个想法留着自己看要高得多。
这种时候更要用内置的钢琴卷帘仔细过一遍:把扒出来的谱和原始音频对着放,导出前把对不上的地方都找出来。给学生准备教材的老师最用得上这套流程,我们在为学生把歌扒成乐谱这篇指南里从头到尾讲了一遍。自动的乐谱难度调整工具在这里也用得上,它会调整难度和记谱的密度,让谱子适合要读它的那位乐手。
检查到底是什么
需要检查,不代表工具表现差。职业的扒谱师也会修改自己的谱子。AI 扒谱自动完成的是把音符记下来的大部分活儿:识别音高、量化节奏、排版乐谱。剩下的交给检查这一步,时间就是靠这样分工省下来的。源文件准备好,检查有针对性,总能得到能用的结果;哪一样跳过了,活儿往往就被推到后面,到那时候改错更难,也更慢。
写在最后
AI 扒谱已经做得很厉害了,但出来的东西好不好,还是要看送进去的东西好不好。不管你扒的是什么、扒完打算拿来做什么,都按这个顺序来:录干净的音频,用合适的文件格式,上传前选对乐器类型,导出前简单检查一遍。
录之前看一眼电平,挑一段目标乐器听得清楚的音频,导出前花几分钟核对结果。前面多花这点心思,后面就能少改很多。
常见问题
怎样让 AI 扒谱更准?
结果好坏,大部分在点上传之前就定了。尽量找最安静的地方录,录音环境对准确度的影响比其他任何因素都大。然后用无损格式,选对乐器类型,导出前花一点时间检查一遍。送进去的信号越好,出来以后要收拾的就越少。
用什么文件格式扒谱效果最好?
能选的话就用 WAV。无损文件保留了频率细节,模型要靠这些细节分辨相邻的音高、跟住音符的衰减。高码率的 MP3 多数情况下够用,码率低了就可能开始出问题,所以宁可文件大一点,也要保证音质。有损格式丢掉的信息,事后没办法找回来。
扒谱之前需要先把歌拆成分轨吗?
一般不用。模型训练时就学会了在其他乐器同时响着的情况下,把你选的那件乐器挑出来。所以大多数完整混音,直接上传原曲,选好乐器,分离的事交给模型就行。要是你想扒的乐器被厚重的编曲埋住了,换一个干净点的段落,或者换一个更清楚的录音,比任何预处理都管用。
