區域語音分離:方向與距離線索的實戰優化

如果你在吵雜的咖啡廳裡錄音,真正麻煩的通常不是「背景有聲音」,而是附近每個人都在說話。

冷氣聲、鍵盤聲和杯子碰撞聲還有機會透過一般降噪處理,但當干擾也是人聲,問題就複雜多了。傳統降噪模型知道那是一段清楚的人聲,卻不知道它是不是你想保留的那個人。

這正是區域語音分離想解決的問題。

它不只問「這是不是人聲」,而是進一步要求系統判斷:

  • 聲音從哪個方向傳來?
  • 說話者離麥克風多遠?
  • 這個人是否位於我們指定的收音區域?
  • 區域外的其他人聲是否應該被抑制?

2025 年阿里巴巴通義實驗室的研究團隊,在 Interspeech 發表《Exploring Efficient Directional and Distance Cues for Regional Speech Separation》。研究將改良式延遲加總波束成形與直達聲對殘響聲比例結合,讓模型同時理解方向和距離,而不是只靠其中一項線索。Interspeech 2025 論文資料

這個方向很有意思,但如果要把它裝進智慧眼鏡、會議設備或即時語音產品,模型準確率只是第一關。麥克風同步、房間殘響、硬體差異與延遲,才是後面真正讓工程師開始掉頭髮的部分。

Contents hide

什麼是區域語音分離?

一般語音分離的目標,是從一段混合音訊中拆出不同說話者。例如三個人同時說話,模型輸出三條獨立音軌。

區域語音分離換了一種思路:系統不一定要知道現場有幾個人,也不一定要辨認對方身分,而是只保留指定空間範圍內的聲音。

例如:

  • 保留正前方、兩公尺內的說話者。
  • 保留會議桌左側區域的聲音。
  • 只收錄智慧眼鏡配戴者面前的談話對象。
  • 保留駕駛座方向的語音,降低其他座位和車外聲音。
  • 在助聽設備中強化使用者面前的近距離談話。

指定區域通常由「方向範圍」與「距離範圍」共同構成。只有同時符合這兩個條件的聲音,才被視為目標。

這比單純指向某個角度更精確。因為兩個人可能站在同一方向,卻一個離麥克風一公尺,另一個站在五公尺外。只使用方向資訊時,兩人的聲音可能一起被保留下來;加入距離線索後,系統才有機會把遠處的人排除。

為什麼只靠方向不夠?

方向式語音分離通常依靠麥克風陣列。聲音抵達不同麥克風的時間會有細微差異,系統便能利用這些差異推測聲音來源。

例如一個人站在裝置左側,他的聲音會先到左邊的麥克風,再到右邊的麥克風。人耳也會使用類似的時間差和音量差判斷方向。

波束成形可以強化方向,卻不能解決所有問題

延遲加總波束成形是一種經典做法。系統先根據目標方向,對不同麥克風收到的訊號進行時間對齊,再將它們合併。

如果聲音真的來自目標方向,對齊後就會互相增強;其他方向的聲音因為沒有正確對齊,合併後通常會被削弱。

這個方法直觀、成本相對可控,也很適合拿來當神經網路的前置處理。不過,它有幾個現實限制:

  • 同一方向上的遠近聲源仍可能一起被保留。
  • 牆壁反射會產生看似來自其他方向的聲音。
  • 說話者移動後,原本設定的方向可能迅速失效。
  • 麥克風位置或時間同步稍有誤差,對齊效果就會下降。
  • 線性麥克風陣列容易把前後兩側的聲音混淆。

2020 年 NeurIPS 發表的「Cone of Silence」研究,便嘗試讓模型在執行期間指定一個角度範圍,抑制範圍外的聲音。這類方法證明方向可以成為強力的控制條件,但也凸顯了只靠角度仍無法完整描述三維空間。NeurIPS:The Cone of Silence

距離線索從哪裡來?

不少人會直覺認為,距離只要看音量就好。聲音越大代表越近,聲音越小代表越遠。

實際上沒這麼簡單。

一位說話很小聲的近距離使用者,可能比一位大聲說話的遠距離使用者更安靜。麥克風增益、自動音量控制和裝置朝向,也會改變接收到的音量。

所以比較可靠的距離判斷,不能只看「有多大聲」。

直達聲與殘響聲的比例

這篇 Interspeech 研究使用的重要距離特徵,是直達聲與殘響聲之間的比例。

直達聲指的是從說話者直接抵達麥克風的聲音;殘響聲則是碰到牆面、天花板、桌子和其他物體後,再反射到麥克風的聲音。

說話者靠近麥克風時,直達聲通常比較突出。說話者距離變遠後,直達聲會快速減弱,但房間裡的反射聲不一定以相同速度降低,因此殘響所占的比例會變高。

這種差異可以讓模型推測聲源大致位於近距離還是遠距離。Google Research 在 2022 年的距離式聲音分離研究中,也展示了即使只有單一麥克風,模型仍可能利用音量、殘響與聲學環境特徵,把近處和遠處聲音分開。Distance-Based Sound Separation

不過,距離線索通常沒有方向線索穩定。厚重窗簾、玻璃牆、開放式空間和小型會議室,會形成完全不同的殘響模式。模型若只在某幾種模擬房間中訓練,換到真實場景後很容易判斷失準。

方向與距離如何放進同一個模型?

2025 年的區域語音分離研究沒有使用兩套獨立模型,分別判斷方向和距離,而是將兩類特徵一起交給同一個神經網路處理。

整體流程可以用四個步驟理解。

第一步:對齊目標方向

系統先根據指定角度,調整各個麥克風訊號的時間,使目標方向傳來的聲音盡量同步。

這一步相當於告訴模型:「我們現在主要想聽這個方向。」

第二步:建立多組方向特徵

研究團隊不只把所有麥克風訊號直接相加,也比較部分麥克風配對後的結果。

相加後的訊號可以強化目標方向;相減後的訊號則會削弱已經對齊的目標,讓干擾部分更加明顯。兩者一起提供給模型,相當於同時告訴它「目標可能長這樣」以及「非目標可能長這樣」。

這種做法比單純輸入原始多聲道音訊更有方向感,也減少模型必須從零學習聲學規則的負擔。

第三步:加入距離特徵

系統再比較直達聲和殘餘聲音的能量關係,產生代表距離的特徵。

論文測試了兩種方式:一種是把兩類能量直接交給模型,另一種是先整理成比例。結果顯示,直接使用比例的效果比較好。

我很喜歡這種設計思路。不是把所有原始資料全部塞進模型,期待 AI 自己悟出物理學,而是先把已知有效的聲學線索整理好,再讓模型處理複雜邊界。

模型參數再多,也不代表前處理可以隨便。

第四步:預測需要保留的聲音

神經網路最後會對音訊中的不同時間和頻率區段進行判斷,保留位於目標區域內的聲音,降低其他方向或距離之外的干擾。

研究採用可以處理時間與頻率關係的雙路徑循環神經網路,模型約有 97.9 萬個參數。音訊取樣率為 16 kHz,研究報告的語音分離延遲為 20 毫秒,具備即時串流的潛力。區域語音分離完整方法與實驗

實驗結果真的有改善嗎?

從論文數據來看,方向與距離線索確實互補。

在模擬的區域語音分離測試中,原始混合音訊的語音可懂度約為 61.1%。只輸入原始多麥克風訊號後,可懂度提升至 76.2%。

加入改良式方向特徵後,語音可懂度上升至 85%;只加入距離比例特徵時,則達到 83.5%。當方向與距離特徵同時使用,可懂度進一步提高至 88.2%。

訊號失真指標也呈現相同趨勢:

  • 只使用原始麥克風訊號約為 5.75 dB。
  • 加入方向線索後約為 7.85 dB。
  • 加入距離線索後約為 7.43 dB。
  • 同時使用方向與距離線索後提高至 8.79 dB。

這組結果說明,單獨使用方向或距離都有幫助,但兩者結合才能比較完整地定義目標空間。

真實智慧眼鏡測試更值得關注

純模擬資料很容易讓音訊模型看起來很漂亮。真正有價值的是,研究也使用 CHiME-8 MMCSG 智慧眼鏡資料進行測試。

這套資料包含配戴者、談話對象、干擾說話者和環境噪音,由智慧眼鏡上的七個非規則排列麥克風錄製。這比固定在桌上的實驗室陣列更接近現實:裝置會跟著頭部移動,說話者位置也不會永遠保持不變。

在要求整體延遲低於 0.15 秒的語音辨識測試中,基準系統的平均字錯誤率為 22.1%,論文方法降低到 15.2%。在較寬鬆的延遲條件下,字錯誤率則從基準的 17.9%降到 13.05%。

這裡最重要的不是某個語音品質分數,而是分離後的音訊確實改善了後續語音辨識。對產品而言,使用者不會在意模型的論文指標,他只會在意逐字稿有沒有把同事的話聽錯。

實際部署時,第一個問題通常不是 AI

論文已經證明方法可行,但要把它放進產品,通常先撞到的是硬體和資料管道。

麥克風位置必須固定而且準確

方向估計依賴不同麥克風之間極小的時間差。若實際麥克風位置與模型假設不一致,對齊方向就會偏掉。

原型階段使用固定開發板通常沒問題,但量產設備可能遇到:

  • 麥克風焊接位置誤差。
  • 外殼厚度改變聲音傳遞。
  • 防水網罩影響頻率響應。
  • 左右聲道增益不一致。
  • 音訊驅動造成不同聲道的時間偏移。

這些問題不是再加兩層神經網路就能修好。量產前必須做每種硬體版本的陣列校正,並把校正參數與韌體版本一起管理。

不要把所有麥克風組合都丟給模型

麥克風越多,可建立的配對數量就增加得越快。全部使用看似能提供最多空間資訊,實際上也會增加特徵通道、記憶體用量和運算成本。

論文的八麥克風測試顯示,使用全部配對產生 65 個特徵通道,只比選擇四組對稱麥克風、使用17個通道的版本稍微好一點。方向分離的可懂度只從 91.5%提高到 92%。

為了這半個百分點,多承擔數倍輸入通道不一定划算。

工程上比較合理的做法是先測試:

  • 哪些麥克風基線最能區分目標角度。
  • 拿掉哪些配對幾乎不影響辨識率。
  • 不同裝置姿勢下,哪些麥克風最容易被遮擋。
  • 減少通道後能省下多少延遲和功耗。

可用的模型不一定是分數最高的模型,而是品質、耗電、發熱和延遲能一起過關的版本。

距離特徵最容易受房間影響

利用殘響判斷距離有一個先天問題:模型不只在估計說話者距離,也在間接判斷房間長什麼樣子。

同一個人站在一公尺外,在臥室、浴室、會議室和戶外錄製,得到的直達聲與殘響比例可能完全不同。

論文測試顯示,模型在不同殘響時間下仍維持相對穩定的指標,這是一個正面訊號。但模擬殘響仍無法完整涵蓋真實世界中的玻璃隔間、開門、移動物體和人群吸音效果。

訓練資料不能只有乾淨的房間模擬

如果我要建立正式資料集,至少會涵蓋:

  • 小房間、長走廊、開放式辦公室和戶外。
  • 木牆、玻璃、布簾與大量家具。
  • 麥克風被頭髮、衣物或手掌部分遮住。
  • 說話者在移動中轉頭。
  • 近距離小聲說話和遠距離大聲說話。
  • 音樂、電視和其他語言的人聲干擾。
  • 不同性別、音高、口音及說話速度。
  • 多種麥克風增益和硬體版本。

只用房間模擬器快速生資料很方便,我也做過這種事。但模擬資料最大的特色,就是永遠比產品上線後收到的資料有禮貌。

區域邊界不應該是一刀切

假設系統設定只保留兩公尺內的聲音,那麼一位使用者從 1.9 公尺走到 2.1 公尺時,聲音不應突然消失。

如果模型在邊界附近不斷切換,使用者會聽到音量抽動、語句破碎,甚至出現像網路不穩的錯覺。

比較實用的處理方式包括:

加入邊界緩衝

進入目標區域和離開目標區域可以使用不同門檻,避免距離估計稍微波動就反覆開關。

使用漸進式音量調整

接近區域邊緣時逐步降低聲音,不要從完整保留直接變成完全靜音。這類淡入淡出通常比硬切自然得多。

保留短時間狀態

系統可以觀察連續數個音訊片段,再決定說話者是否真的離開區域。這會增加一些延遲,卻能換取更穩定的聆聽體驗。

這些設計在論文指標裡不一定明顯,但使用者通常一下就聽得出來。

移動中的說話者才是真正考驗

會議室裡的人會轉頭,智慧眼鏡配戴者會走動,車內乘客也不會固定面向麥克風。

如果系統只在開始時估計一次方向,幾秒後目標區域就可能偏離真正的說話者。

因此,正式產品還需要加入:

  • 持續更新的聲源方向估計。
  • 說話者移動軌跡平滑。
  • 頭部或裝置姿態感測。
  • 說話活動偵測。
  • 多人交談時的目標切換機制。
  • 暫時被遮擋後的聲音追蹤。

更新速度太慢,模型會追不上人;更新太快,方向又可能因短暫噪音跳來跳去。實作時通常要在反應速度和穩定性之間找平衡。

即時系統不能只看模型延遲

論文中的語音分離延遲是 20 毫秒,對串流應用來說相當有吸引力。但這只是語音分離模組本身。

一套完整產品還可能包含:

  • 麥克風驅動與音訊緩衝。
  • 回音消除與自動增益控制。
  • 聲音方向追蹤。
  • 區域語音分離。
  • 語音活動偵測。
  • 自動語音辨識。
  • 網路傳輸與字幕顯示。

每一層都只多二三十毫秒,累積起來就可能超過使用者能接受的範圍。

我通常會量測從聲音真正進入麥克風,到耳機播放、字幕顯示或遠端收到資料的端到端延遲,而不是只引用模型報告裡最漂亮的數字。

另外,論文模型處理兩秒音訊約需要 62 億次浮點運算。參數量不到一百萬並不算大,但運算量仍不能忽略。要部署到智慧眼鏡、助聽器或低功耗裝置,還需要考慮量化、運算子支援、記憶體搬移及晶片實際吞吐量。

「模型檔案很小」和「裝置跑得動」從來不是同一件事。

評估語音分離不能只聽一段 Demo

語音 Demo 很容易挑出最好聽的案例。真正的測試應同時涵蓋聲音品質、語意完整度與產品行為。

語音品質

可以使用語音品質、可懂度和失真程度等客觀指標,確認輸出是否比原始混音清楚。

語音辨識結果

如果產品最終會接語音轉文字,就應直接測量字錯誤率。分離後聽起來比較乾淨,不代表辨識器一定更容易理解。

有些模型會把人耳不太在意的子音細節一起削掉,聽感似乎平順,逐字稿卻錯得更多。

區域誤判率

系統還應測試兩種錯誤:

  • 目標區域內的人聲被錯誤刪除。
  • 區域外的人聲被錯誤保留下來。

如果用於會議紀錄或助聽設備,漏掉目標語句通常比殘留一些背景聲更嚴重。若用於隱私隔離,錯誤保留區域外談話反而可能是更大的問題。

真實使用者測試

最後仍要找人實際配戴或使用設備,測試說話者移動、搶話、笑聲、短句和突然轉頭等情況。

論文數字可以幫我決定是否值得做原型,但不會替我簽署上線同意書。

區域語音分離適合哪些產品?

智慧眼鏡與穿戴裝置

系統可以保留配戴者面前、特定距離內的談話對象,降低背後人群或遠處廣播聲,改善即時字幕與語音助理輸入。

助聽器與耳機

使用者不需要事先登錄對方聲紋,只要面向交談者,就能強化附近談話。相較於只能辨識固定說話者的模型,空間區域提供了更直覺的控制方式。

視訊會議設備

會議室可以只收錄座位區內的人聲,降低走廊談話、遠方同事和開放式辦公空間的干擾。

車載語音系統

不同座位可以被定義為獨立區域,讓系統辨認是駕駛還是乘客下達指令,也能改善多乘客同時說話時的語音辨識。

機器人與智慧家庭

機器人可以將鏡頭或感測器偵測到的位置轉換成目標收音區域,只處理面前使用者的指令,降低電視或其他房間談話造成的誤觸發。

哪些情況不需要硬上區域語音分離?

如果產品只有單一固定說話者,而且麥克風距離很近,一般降噪和回音消除可能已經足夠。

以下情況也不一定需要完整的方向加距離模型:

  • Podcast 使用者各自配戴獨立麥克風。
  • 線上會議每位參與者都有自己的近講設備。
  • 系統只需要消除冷氣和鍵盤等非人聲噪音。
  • 裝置只有一支麥克風,卻要求精確區分複雜方向。
  • 產品無法取得足夠的真實空間錄音進行訓練。
  • 延遲和功耗限制比語音分離品質更重要。

這些情況下,硬上大型 AI 模型可能只會增加開發成本、耗電與維護負擔。能用正確的麥克風擺放解決,就先不要急著訓練一個模型。

常見問題

什麼是區域語音分離?

區域語音分離是依照聲源所在的空間範圍保留或移除聲音。指定條件通常包含方向、距離,有時也會加入高度資訊。

區域語音分離和一般降噪有什麼不同?

一般降噪主要移除環境噪音,卻不一定能分辨目標人聲與干擾人聲。區域語音分離會根據聲音來源位置,抑制指定區域外的其他說話者。

為什麼需要多支麥克風?

多支麥克風可以比較聲音抵達時間、相位和音量的差異,提供方向資訊。麥克風數量、排列方式與間距都會影響定位精度。

如何判斷說話者距離?

常見方法會觀察音量、直達聲與殘響聲比例,以及多麥克風接收到的波前差異。單看音量通常不夠可靠,因為每個人的說話音量不同。

方向和距離線索哪一個比較重要?

目前研究結果普遍顯示方向線索較穩定,距離線索則能處理同方向但遠近不同的說話者。兩者結合通常比單獨使用任一線索更完整。

區域語音分離可以即時運作嗎?

可以。2025 年 Interspeech 研究報告的分離模組延遲為 20 毫秒。不過,產品仍須計算音訊緩衝、方向追蹤、語音辨識和網路傳輸造成的總延遲。

區域語音分離能完全消除其他人聲嗎?

不能保證。相近方向、強烈殘響、說話者移動、麥克風遮擋及陌生房間,都可能造成聲音殘留或誤刪。正式產品應提供強度調整與失效時的保守模式。

結語:空間線索比單純堆大模型更重要

區域語音分離的核心,不是要求 AI 憑空猜出誰最重要,而是提供一套明確的空間規則:只保留這個方向、這段距離內的聲音。

方向線索通常較強,可以先快速排除大部分干擾;距離線索則進一步處理同方向、不同遠近的說話者。2025 年的研究顯示,把改良式波束成形和直達聲對殘響聲比例放進同一模型,確實能改善語音品質、可懂度與後續辨識率。

但從研究原型走到正式產品,仍要處理麥克風誤差、房間差異、移動聲源、邊界切換、耗電和端到端延遲。

我會把這類技術視為「聲學系統加上神經網路」,而不是單純的 AI 功能。先利用物理線索把問題整理好,再讓模型處理傳統方法難以涵蓋的變化,通常比把所有原始聲音塞進一個更大的模型可靠。

畢竟正式環境不在乎模型用了多少層。它只在乎使用者開口時,系統到底聽見了誰。

立即體驗安全可靠的交易平台,點擊加入:https://www.okx.com/join?channelId=42974376