這篇文章是音樂採譜工具選擇指南的一部分。
單靠 Gemini 或 Claude,做不到。兩者都無法聽完錄音就產生準確的樂譜,也無法逐一讀對印刷樂譜上的音符。它們現在能處理的資料比純文字聊天模型多得多:Gemini 接受音訊和圖片,Claude 接受圖片和文字。不過,這些模型擅長的是理解內容,例如把語音轉成文字、描述圖片、根據文字推理。採譜需要的訊號處理,是另一種工作。請它們把歌曲記成樂譜,往往會得到一份說得很流暢、語氣很肯定的答案,裡面卻寫滿錄音中根本沒出現過的音符。
談樂理、解釋你貼上的記譜內容、建議和弦進行、寫一段單聲部旋律,或安排練習計畫,兩者都很有幫助。用之前先分清楚任務:需要文字說明的部分,交給聊天模型;需要把聲音轉成樂譜的部分,交給專門的採譜工具。
Gemini 和 Claude 能幫你做哪些音樂工作?
這兩個模型都已經能處理文字以外的資料。Gemini 原生就能處理多種資料類型,接受音訊檔後,能把語音轉成文字、摘要錄音、分辨誰在說話,也能回答談話內容相關的問題。它也接受圖片。Claude 則接受文字和圖片,能閱讀你提供的照片或文件。因此,把樂譜圖片交給任一模型,它都能看圖回應。不過,能看見或聽見檔案內容,和能把內容轉成正確的樂譜,是兩種不同的能力。
文字和樂理方面的任務,兩者都能幫上忙:
- 解釋樂理。 問它某段和弦進行為什麼這樣解決、什麼是三全音代理,或怎麼替小調音階配和聲,通常能得到清楚、相當可靠的解釋。
- 討論你貼上的文字記譜內容。 提供 ABC 記譜、和弦譜,或用文字描述一個段落,它能指出和弦、解釋音樂如何進行,也能提出修改建議。
- 建議和弦進行。 說明想要的情緒或調性,它會提出和弦進行、和弦重配或低音線,讓你試著彈看看。
- 寫出單聲部旋律草稿。 用文字描述旋律,它能用 ABC 這類文字記譜格式寫出來,再由你貼進記譜軟體。
這些任務都從文字或描述開始,最後有用的結果也都是文字。模型是根據音樂符號推理,沒有把聲音或印刷頁面轉成精確的音符。一旦你要求「這裡有一段錄音,請給我樂譜」,就超出兩者能可靠完成的範圍了。
為什麼它們無法從錄音採譜?
把音訊轉成樂譜,需要處理相當複雜的訊號。工具得偵測每個音的音高,精確找出開始和結束的時間,分辨和弦或完整混音裡同時發聲的音,再透過量化,把時間位置整理成容易讀的節奏。這些工作完成後,才能把音符寫在譜表上,配上正確的調號和拍號。每個步驟都需要專門針對音訊訓練的模型。Gemini 的音訊理解主要處理語音裡的字句、說話者和意思,並不擅長拆解同時出現的音高和起音時間。Claude 則根本不接受音訊檔;歌曲必須先經過另一道轉錄步驟,它才有內容能處理。
讀印刷樂譜也有類似的問題。研究人員直接測試這項任務時,發現模型即使能很準確地辨識頁面上的符號,大多數時候仍會把符號轉成錯誤的音符。它們常把音符寫成一連串四分音符,或像音階一樣排列的音型,因為它們更依賴文字模式來猜測,沒有照著譜上的內容讀出音符。所以,就算模型把頁面「看」得很清楚,報出的音高和節奏還是會偏離譜上寫的內容。
硬要它們採譜,兩者就會像其他語言模型遇到不確定的任務時一樣,給出流暢、肯定的答案。結果看起來像樂譜,卻充滿沒有人演奏過的音符。答案越像專業判斷,錯誤越不容易察覺;空白反而一眼就能看出有問題。想了解真正的採譜工作包含哪些步驟,可以讀 AI 音樂採譜如何運作。單音與多音採譜的差異則說明了為什麼同時發聲的音符,會讓通用模型出錯。
從錄音採譜,該用什麼工具?
把聲音轉成樂譜,要用專門處理這項工作的工具。在 Songscription 裡,上傳音訊檔或貼上影片連結,模型就會辨識音符,產生可編輯的樂譜,以及 MIDI、MusicXML、Guitar Pro TAB 譜和互動式鋼琴捲軸。你能放慢鋼琴捲軸的播放速度,核對採譜結果。不用逐一手動輸入音符,匯出前也能直接在瀏覽器裡修改。
拿到初步結果後,還有幾項功能能用上。鋼琴聲部會自動分成左右手,以高音和低音譜表呈現,所有音符不會混成同一串。如果只需要某個樂器的乾淨聲部,Songscription 能從完整混音裡單獨辨識那個樂器;Multi-Instrument(測試版)則能一次採出樂團或合奏錄音中的所有聲部。內建編輯器能把樂譜移調到任何調性,編曲模式也能將音符密集的曲子簡化成較容易演奏的版本,或替原曲沒有的樂器寫出單聲部旋律。Gemini 和 Claude 給你的是歌曲的文字說明,Songscription 給你的檔案則能拿來照譜演奏,之後也能繼續編輯。
準確度仍然要看錄音內容。乾淨的獨奏素材,例如鋼琴獨奏、吉他獨奏或單一人聲旋律,通常比多種樂器聲交疊的樂團混音採得準得多。自動採譜能很快完成大部分工作,但你還是需要看過結果,修正辨識錯誤的地方。如果要仔細處理樂譜排版,匯出 MusicXML,再用 MuseScore 這類記譜軟體完成。有些歌曲容易採得準,有些卻需要反覆修正,原因可以看為什麼 AI 採譜的準確度會不同。
有了樂譜之後,Gemini 和 Claude 還能幫什麼忙?
拿到樂譜後,就能請兩個模型幫你解讀樂譜、安排練習。手上已經有樂譜、和弦譜,或從 MIDI 整理出的和弦,就能請任一模型處理這些任務:
- 解釋不熟悉的和弦。 貼上和弦代號,問它包含哪些音、在曲子裡起什麼作用,以及適合搭配哪個音階。
- 提供指法建議。 描述段落和你使用的樂器,請它建議合理的指法或手的位置,再實際試看看。
- 安排練習計畫。 告訴它曲目、你的程度和可用的時間,它會安排有步驟的練習方式。
- 把你已經掌握的旋律寫成文字記譜。 如果你已經能描述或唱出旋律,就把旋律內容用文字告訴它,請它寫成 ABC 記譜,再貼進編輯器。
採譜模型先把聲音轉成音符,Gemini 和 Claude 再幫你理解樂譜、安排練習。搭配使用,就能先從錄音取得樂譜,再請模型協助學會演奏。想知道 AI 能解答哪些演奏問題,可以讀 AI 能告訴你一首歌該怎麼彈嗎?。至於 OpenAI 的模型能否完成同樣的採譜任務,另見 ChatGPT 能製作樂譜嗎?。
常見問題
Gemini 看得懂樂譜嗎?
只能讀出大概。Gemini 接受圖片,因此能看樂譜照片或 PDF,概略描述內容、指出調性,或看出某個段落的音符很密集。但要它逐一讀出譜上的音符,給出正確的音高和節奏,就不太可靠。針對這項任務的評測發現,即使模型很會辨識記譜符號,大多數時候還是會把符號轉成錯誤的音符,常常寫成一連串四分音符,或像音階一樣連續上行、下行的音型。它讀完印刷樂譜後給你的內容,適合當作粗略摘要,不能當成準確的採譜結果。
Claude 能把歌曲記成樂譜嗎?
不能直接從錄音採譜。Claude 處理的是文字和圖片,因此能討論你貼上的文字記譜內容,例如 ABC 記譜或和弦譜,也能解釋和聲,或根據你的文字描述寫出簡單的單聲部旋律。它無法接收音訊檔,再把錄音轉成準確的樂譜。把聲音轉成音符,需要偵測音高、找出每個音開始的時間,還要分辨同時發聲的音。這些訊號處理工作需要專門的採譜工具,聊天模型做不到。
Gemini 或 Claude 能把音訊轉成 MIDI 檔嗎?
不能直接把錄音轉成 MIDI。兩個模型都不會從音訊中偵測出製作 MIDI 檔所需的音符資料。請它們聽一首歌再輸出 MIDI,模型雖然回答得很肯定,給出的資料卻是錯的。如果你用文字描述旋律,模型有機會寫出一小段文字記譜內容,再由其他工具轉成 MIDI。但要從真實錄音取得對應的 MIDI 檔,就需要專門的音訊轉 MIDI 工具,直接辨識音符並匯出檔案。
把歌曲轉成樂譜,最好的做法是什麼?
用專門的 AI 採譜工具,輸入音訊檔或連結,取得可編輯的樂譜、MIDI 和鋼琴捲軸,再手動修正結果。自動採譜能很快完成大部分工作;錄音乾淨、只有單一樂器的素材,通常比多種樂器聲交疊的樂團混音採得更準。如果還要仔細排版,匯出 MusicXML,再到記譜軟體裡完成。
要把錄音轉成樂譜,從音訊轉樂譜頁面上傳歌曲或貼上連結。匯出前,先在瀏覽器裡編輯結果。
