樂團抓譜救星來了!全新 AI 音樂轉譜黑科技 MuScriptor,把整首複雜混音直接變多軌 MIDI - DigiLog 聲響實驗室

樂團抓譜救星來了!全新 AI 音樂轉譜黑科技 MuScriptor,把整首複雜混音直接變多軌 MIDI

樂團抓譜救星來了!全新 AI 音樂轉譜黑科技 MuScriptor,把整首複雜混音直接變多軌 MIDI

自動音樂轉譜一直以來都被視為音訊處理領域的聖盃。雖然現行的 AI 技術在處理單一樂器(例如純鋼琴獨奏)的錄音轉譜時已經有不錯的表現,但如果直接把一整首包含吉他、貝斯、鼓組等多種樂器交織的完整混音丟給傳統模型,通常會因為音頻訊號過於複雜,讓系統直接聽得滿頭問號。

為了解決這個讓音樂人頭痛已久的痛點,知名研究團隊 Kyutai 與 Mirelo 攜手推出了全新的開源模型 MuScriptor。這款模型直接針對真實世界中跨越多元曲風、包含多種樂器的完整混音進行訓練,成功填補了多樂器自動轉譜的技術空白。

什麼是 MuScriptor?

從核心架構來看,MuScriptor 是一個僅包含解碼器的 Transformer 模型。它的運作流程非常直覺:首先,模型會讀取一段短音訊片段的梅爾頻譜(也就是聲音的視覺頻譜化呈現);接著,它會以類似語言模型預測下一個字的方式,自迴歸地預測出對應音高、時間點以及樂器的類 MIDI 標記。

簡單來說,MuScriptor 把音樂轉譜這件繁瑣的差事,轉化成類似大型語言模型的「文字接龍」任務。目前研發團隊已經在 Hugging Face 上釋出了三種不同參數規模的版本,分別是 Small、Medium(預設版本)以及 Large。

在授權方面,MuScriptor 的推論程式碼採用了相當寬鬆的 MIT 授權;不過需要特別注意的是,它的模型權重使用的是 CC BY-NC 4.0 授權,這意味著它目前僅限於非商業用途。

樂團抓譜救星來了!全新 AI 音樂轉譜黑科技 MuScriptor,把整首複雜混音直接變多軌 MIDI

精準抓譜的幕後功臣:三階段訓練管線

MuScriptor 最核心的突破並不在於發明了多麼複雜的新架構,而是在於極致的數據驅動思維。整個訓練流程一共分為三個階段,每一步都精準踩在前一步的肩膀上:

  • 第一階段:虛擬合成數據預訓練 此階段採用了包含大約 145 萬個 MIDI 檔案的合成數據集。訓練過程中會透過即時管線將這些 MIDI 合成音訊,並加入大量的資料增強技術,例如變換音高、調整速度與力度、隨機更換樂器等。搭配超過 250 種虛擬音色庫以及隨機的微調,創造出近乎無限種音訊呈現方式,幫模型打下深厚的基本功。

  • 第二階段:真實錄音數據微調 在這個階段,模型開始接觸真實世界的聲音。團隊使用了高達 17 萬首真實錄音(總計超過 11,000 小時)的內部數據集,且皆帶有精確對齊的音符標註。大部分的對齊是透過先進的動態時間規整技術進行音訊與符號的同步,並嚴格過濾掉品質不佳的音訊配對,讓模型學會分辨真實樂器的殘響與動態。

  • 第三階段:強化學習後訓練 最後,為了讓成品更完美,團隊使用人工驗證的 300 首高質量曲目進行後訓練。他們採用一種類似 GRPO 的強化學習方法,將獎勵機制聚焦在起始時間、影格與結束時間的精準度。這讓模型學會做出更乾淨、更少雜音且極少誤判的轉譜結果。

實測效能:直接甩開傳統基準

為了驗證實力,研究團隊使用了包含 372 首未參與訓練且擁有精確標註曲目的測試集進行評估。在最嚴格的測試標準下(也就是模型連樂器種類也必須完全猜對),MuScriptor 展現了驚人的實力。

僅使用第一階段合成數據訓練時,模型在辨識精準度上表現平平;但一旦加入第二階段的真實錄音數據,整體的效能指標立刻飆升了約 20 分;最後經過強化學習的調教,更成功減少了漏判,並讓音符起始時間的捕捉更加犀利。最終的成果大幅超越了過去的傳統基準模型,在跨數據集的測試中,面對高難度的合唱曲目,其影格辨識率也從原本的 51.0 大幅暴增到 80.7。

豐富的應用場景

由於 MuScriptor 輸出的是標準 MIDI 格式,這為音樂人和開發者打開了無數可能:

  • 音樂製作人:可以輕鬆從混音中提取出喜歡的貝斯線 MIDI,隨後丟進數位音訊工作站(DAW)中更換成更好的虛擬樂器音色。

  • 音樂學者與研究員:能將珍貴的歷史錄音轉換為可編輯的電子樂譜,以便進行深度的音樂結構或和弦識別分析。

  • 音樂教育工作者:能開發出強大的樂器練習工具,在學生演奏或聆聽時呈現即時的鋼琴捲軸反饋。

  • 精準客製化抓譜:使用者可以在推論時傳入特定樂器的限制條件,達成「只幫我把這首歌的鼓組抓出來」的便利功能。

更棒的是,開發團隊還貼心地提供了一個網頁介面工具,只要啟動後就能直接在瀏覽器邊播音訊、邊觀看即時渲染的鋼琴捲軸,操作上非常平易近人。

MuScriptor 的優點與缺點

強大優勢:

  • 經過 17 萬首涵蓋古典到重金屬等多元曲風的真實錄音洗禮,實戰能力極強。

  • 開源模型權重並搭配 MIT 授權的推論程式碼,且提供三種規模供彈性選擇。

  • 支援樂器條件限制引導,不僅能自訂想要提取的樂器,還能穩定跨音訊片段的預測結果。

  • 提供完備的即時輸出功能與開箱即用的瀏覽器網頁端 UI。

潛在限制:

  • 模型權重採用 CC BY-NC 4.0 授權,若想將其整合進付費商業產品中會受到限制。

  • 目前版本捨棄了音符力度(大聲小聲)的捕捉,且無法完美重現同一個樂器在相同音高上重疊交錯的音符(例如兩把吉他同時彈同一個音)。

  • 面對合唱或極度黏滯的音樂風格時,音符起始點與結束點的準確度仍稍顯遜色。

  • 最大規模的模型在實際運行時非常依賴 GPU 的算力,且 5 秒的音訊切片限制了長距離上

 

資料來源:MuScriptor Github

MuScriptor 線上玩

分享這篇文章 LINE Facebook

瀏覽次數 This 文章 has been viewed 517 times

討論區

目前尚無評論