資源採譜Andrew Carlins•閱讀時間:9 分鐘

單音與複音轉譜的差別

轉譜工具有一項基本差別:一次只能追蹤一個音,還是能辨識同時發聲的多個音。比起宣傳頁上的準確率,這個差別更能說明工具實際能處理什麼音樂。前者是單音轉譜,後者是複音轉譜。

單音與複音轉譜的差別:複音較難處理的原因,以及挑選工具時要檢查的項目

本文是音樂記譜術語指南的一部分。

不同的音樂轉譜工具,處理音訊的方式不一樣。有的只能一次追蹤一個音,有的能辨識同時發聲的多個音。單音轉譜與複音轉譜的這項差別,比宣傳文案上的準確率更能說明工具實際能做什麼。

一段音樂同時有幾個音在響,會影響轉譜的難度。複音裡的頻率互相重疊,早期方法很難分清楚,AI 則改變了辨識的方式。挑選工具時,除了弄懂這些差別,也得看看它能不能處理你真正想記下的音樂。

什麼是單音轉譜?

單音轉譜把同一時間只有一個音的音訊,轉成樂譜。「單音」(monophonic)指的是單一聲部,也就是同一時間只出現一個音高的音樂。

一次只處理一個音高,讓單音轉譜相對簡單。訊號裡只有一個主要頻率時,演算法辨識音高變化比較有把握,要處理的干擾也少。

哪些音訊屬於單音?

長笛獨奏是典型例子。大部分管樂器一次只發出一個音高;沒有伴奏的人聲旋律,例如無伴奏獨唱、傳統民謠旋律,也屬於這一類。

即使樂器本身能演奏和弦,只在一條弦上彈旋律,也算單音。吉他手只彈高音 E 弦、不碰其他弦,產生的就是轉譜工具容易處理的單音音訊。單獨的低音旋律線也一樣,無論是電貝斯、低音大提琴,還是合成器演奏的。

為什麼單音比較容易轉譜?

單音音訊的訊號比較單純。少了其他音高的干擾,也沒有不同音符的泛音互相重疊,軟體持續追蹤基音頻率時,需要判斷的模糊情況比複音少得多。

處理步驟也比較簡單:找出主要頻率、追蹤它隨時間的變化,再換成音名和節奏。早期轉譜軟體因此多半從單音開始。基本的頻率分析足以處理單一聲部,遇到和弦或多個聲部疊在一起,就沒那麼容易了。

什麼是複音轉譜?

複音(polyphonic)指的是同一時間有多個音發聲的音訊。例如鋼琴手彈和弦,左手同時按住一個低音;或是吉他手刷弦時,高音弦上的旋律還在響。只要同一刻有不只一個音高在響,就屬於複音。

複音轉譜要把這些音訊寫成樂譜,記下每個正在發聲的聲部,不能只留下最響的那個。單音轉譜只要追蹤一條旋律,複音轉譜則得同時分清幾條重疊的旋律,準確記下各自的音符。它們可能是在同一個樂器聲部裡交錯的兩條旋律,也可能是鋼琴左右手分別演奏的旋律與低音線條。

哪些音訊屬於複音?

鋼琴是最常見的複音轉譜難題。即使只是一個簡單的三和弦,工具也得在同一瞬間辨識幾個音高,放到譜表上的正確位置。

吉他獨奏也很容易出現複音。空弦和按弦的音一起發聲,或是一邊刷和弦、一邊挑出旋律,就有多個獨立聲部需要分別追蹤。這些都是日常演奏裡常見的情況,複音佔了音樂人實際演奏內容的大部分。

為什麼複音轉譜比較難?

泛音重疊之後,訊號很難分開,早期模型不太能處理。幾個音同時響起,基音和泛音會混在同一個波形裡,早期軟體很難判斷每個頻率到底屬於哪個音。

鋼琴和弦裡,每個音都帶著一串泛音。低音的高次泛音,還可能正好落在同時發聲的另一個高音的基音頻率上。早期演算法很難穩定地分清這些重疊的頻率。

現在的 AI 模型是專門用複音音樂訓練的,能處理的範圍因此擴大。Songscription 的鋼琴轉譜就是針對這個問題。這類模型學習分辨各個聲部和和弦配置,辨識時不會一律只追蹤最明顯的頻率。不是每段錄音都能得到毫無錯誤的結果,但目前模型的表現已經比早期方法好很多。

單音與複音轉譜的主要差別

實際使用時,兩者的差別在於訊號有多複雜,以及演算法得怎麼處理。

  • 單音轉譜持續追蹤單一主要頻率。演算法有明確的辨識目標,這類音高辨識技術也比較成熟。出錯時通常是節奏不準,比較少是音高記錯。
  • 複音轉譜得同時追蹤幾個重疊的頻率,分清楚哪些是基音、哪些是泛音。
  • **適用的音訊不同。**管樂獨奏、無伴奏人聲,或單獨一條弦上的旋律,屬於單音。複音則涵蓋大部分常見演奏,包括鋼琴和弦、吉他刷弦,以及任何同時有多個聲部發聲的音樂。
  • **產生的樂譜不同。**單音轉譜記下一條旋律線;複音轉譜還得處理多個聲部、和弦配置、聲部連接,以及各個獨立聲部的複雜節奏。

為什麼多數音樂人需要複音轉譜?

實際演奏的音樂很少是單音。吉他獨奏裡,你按弦彈出新音時,空弦可能還在響;鋼琴只要同時按下第二個琴鍵,就已經是複音,而鋼琴演奏大多都有這種情況。只能處理單音的工具,記下的只是其中一部分。

音樂越密集,越考驗工具處理複音的能力。有些人剛開始學琴時,練的是簡單的單音旋律;進一步練和弦進行、對位和多層次編曲時,單音工具就處理不了。如果你要記下的音樂有和弦或多個聲部,工具就得能處理複音。

AI 怎麼處理單音與複音音訊?

辨識單音旋律時,演算法只要持續追蹤一個主要頻率,音高偵測的做法相對直接。幾個音一起發聲,模型就得從重疊的頻率模式裡辨識、分開各個音。用複音音樂訓練的神經網路,對這項工作幫助很大。

深度學習讓複音轉譜往前走了一步。早期訊號處理方法遇到重疊的音高,常常就辨識不下去;現在的神經網路則能學會辨認和弦模式與樂器組合,做到早期方法難以做到的事。

難處仍然是泛音重疊。每個音都帶著一串泛音,這些泛音形成它的音色,也讓聲音更豐富。樂器一起演奏時,各自的泛音列重疊、互相干擾,很難判斷每個頻率來自哪個聲源。

實際使用時,怎樣算辨識準確?

可靠的複音轉譜,會產生清楚的樂譜,和弦配置正確,很少多出原本沒有的音符。低音、旋律和和聲要記成不同聲部,各聲部的節奏也要彼此對得上。

常見錯誤有幾種:密集段落裡漏掉低音、因為很強的泛音而多記了重複音符,或把裝飾性的快速音群誤判成持續的長音。

配器一複雜,或音訊品質不好,準確度就會下降。訓練充分的模型,通常能把乾淨的鋼琴獨奏錄音辨識得不錯;換成聲音密集、各樂器收音互相干擾的現場混音,同一個模型產生的結果就需要更多修正。

有些工具在轉譜後,直接讓你用鋼琴捲軸編輯器或樂譜畫面檢查結果,Songscription 的音訊轉樂譜流程就是這類做法。校對時不用在不同軟體間來回切換。

挑選複音轉譜工具時,要看什麼?

工具都寫著能處理複音,實際表現卻不一定相同。決定使用之前,先用幾項測試確認。

先拿自己的音訊測試

宣傳頁寫著能處理複音,還是得實際試過。不少工具宣稱 AI 辨識很準,卻仍然一次只追蹤一個音。上傳一個簡單的鋼琴和弦,或一小段吉他刷弦,看看轉譜結果。真正能處理複音的工具,會在同一個時間位置記下多個音符,而不是每一刻都只留下最強的頻率。

確認模型實際能辨識哪些樂器

複音轉譜在不同樂器上的表現差異很大。鋼琴辨識得好的模型,遇到吉他或銅管,結果可能明顯差一些。各種樂器的泛音特徵和演奏技巧差異很大,模型必須分別針對它們訓練。

挑工具時,先看工具有沒有清楚說明擅長辨識哪些樂器。這比籠統宣稱什麼都能辨識更有參考價值。如果你主要處理同一種樂器,專門用這種樂器訓練的模型,通常比通用模型表現好。

能匯出哪些格式?

轉譜完成後,檔案格式會影響你接著怎麼用。演奏時要看樂譜,在 DAW(數位音訊工作站)裡製作音樂會用到 MIDI,交給記譜編輯器繼續修改則需要 MusicXML。這些格式各有用途,只能匯出一種格式,後續處理就會多些麻煩。想進一步了解怎麼使用 MIDI 輸出,可參考我們的音訊轉 MIDI 指南。

用你要轉譜的音樂做最後確認

大部分音樂都是複音,多數音樂人也需要能處理複音的工具。單音轉譜適合獨奏旋律、單獨的低音聲部,只是這些用途涵蓋的範圍,比大家實際想記下的音樂窄得多。

複音辨識穩定的模型,也能輕鬆處理單音音訊;只能辨識單音的工具,卻無法完整記下你右手彈的和弦。不確定怎麼選時,拿你預計要轉譜的內容裡最難的一段測試。要記下和弦,就測和弦,別只用音階判斷。

常見問題

單音轉譜和複音轉譜有什麼差別?

單音轉譜把同一時間只有一個音的音訊轉成樂譜,持續追蹤單一主要頻率。複音轉譜處理同時有多個音發聲的音訊,必須記下每個正在發聲的聲部,不能只抓最響的那個。管樂獨奏、無伴奏的單一人聲旋律都屬於單音;鋼琴和弦、吉他刷弦等常見演奏則屬於複音。

為什麼複音轉譜比單音轉譜難?

泛音互相重疊,讓訊號很難分開。幾個音同時發聲時,基音和泛音會混在同一個波形裡。低音的高次泛音,還可能正好落在另一個高音的基音頻率上。現在的 AI 模型是專門用複音音樂訓練的,比早期的訊號處理方法更能處理這種情況,但並非每段錄音都能辨識得毫無錯誤。

怎麼確認轉譜工具真的能處理複音?

拿自己的音訊測試,比只看宣傳頁可靠。上傳一個簡單的鋼琴和弦,或一小段吉他刷弦,再檢查結果。能正確處理複音的工具,會在同一個時間位置記下多個音符,而不是每一刻都只記下最強的頻率。也要查看模型實際能辨識哪些樂器,因為複音轉譜在不同樂器上的表現差異很大。

關於作者

Andrew Carlins

作者

Andrew Carlins

Songscription 共同創辦人兼執行長

Andrew 和幾位音樂人在史丹佛一起創辦了 Songscription,因為大家都受夠了想演奏一首歌,卻找不到樂譜的情況。他從小彈鋼琴、吹上低音薩克斯風,也演過音樂劇。雖然已經好幾年沒登台,他倒覺得自己還有兩下子。他的文章聊的是怎麼把錄音裡的歌寫成樂譜。

認識我們的團隊

閱讀更多相同主題的文章。