如果你在吵雜的咖啡廳裡錄音,真正麻煩的通常不是「背景有聲音」,而是附近每個人都在說話。
冷氣聲、鍵盤聲和杯子碰撞聲還有機會透過一般降噪處理,但當干擾也是人聲,問題就複雜多了。傳統降噪模型知道那是一段清楚的人聲,卻不知道它是不是你想保留的那個人。
這正是區域語音分離想解決的問題。
它不只問「這是不是人聲」,而是進一步要求系統判斷:
- 聲音從哪個方向傳來?
- 說話者離麥克風多遠?
- 這個人是否位於我們指定的收音區域?
- 區域外的其他人聲是否應該被抑制?
2025 年阿里巴巴通義實驗室的研究團隊,在 Interspeech 發表《Exploring Efficient Directional and Distance Cues for Regional Speech Separation》。研究將改良式延遲加總波束成形與直達聲對殘響聲比例結合,讓模型同時理解方向和距離,而不是只靠其中一項線索。Interspeech 2025 論文資料
這個方向很有意思,但如果要把它裝進智慧眼鏡、會議設備或即時語音產品,模型準確率只是第一關。麥克風同步、房間殘響、硬體差異與延遲,才是後面真正讓工程師開始掉頭髮的部分。
什麼是區域語音分離?
一般語音分離的目標,是從一段混合音訊中拆出不同說話者。例如三個人同時說話,模型輸出三條獨立音軌。
區域語音分離換了一種思路:系統不一定要知道現場有幾個人,也不一定要辨認對方身分,而是只保留指定空間範圍內的聲音。
例如:
- 保留正前方、兩公尺內的說話者。
- 保留會議桌左側區域的聲音。
- 只收錄智慧眼鏡配戴者面前的談話對象。
- 保留駕駛座方向的語音,降低其他座位和車外聲音。
- 在助聽設備中強化使用者面前的近距離談話。
指定區域通常由「方向範圍」與「距離範圍」共同構成。只有同時符合這兩個條件的聲音,才被視為目標。
這比單純指向某個角度更精確。因為兩個人可能站在同一方向,卻一個離麥克風一公尺,另一個站在五公尺外。只使用方向資訊時,兩人的聲音可能一起被保留下來;加入距離線索後,系統才有機會把遠處的人排除。
為什麼只靠方向不夠?
方向式語音分離通常依靠麥克風陣列。聲音抵達不同麥克風的時間會有細微差異,系統便能利用這些差異推測聲音來源。
例如一個人站在裝置左側,他的聲音會先到左邊的麥克風,再到右邊的麥克風。人耳也會使用類似的時間差和音量差判斷方向。
波束成形可以強化方向,卻不能解決所有問題
延遲加總波束成形是一種經典做法。系統先根據目標方向,對不同麥克風收到的訊號進行時間對齊,再將它們合併。
如果聲音真的來自目標方向,對齊後就會互相增強;其他方向的聲音因為沒有正確對齊,合併後通常會被削弱。
這個方法直觀、成本相對可控,也很適合拿來當神經網路的前置處理。不過,它有幾個現實限制:
- 同一方向上的遠近聲源仍可能一起被保留。
- 牆壁反射會產生看似來自其他方向的聲音。
- 說話者移動後,原本設定的方向可能迅速失效。
- 麥克風位置或時間同步稍有誤差,對齊效果就會下降。
- 線性麥克風陣列容易把前後兩側的聲音混淆。
2020 年 NeurIPS 發表的「Cone of Silence」研究,便嘗試讓模型在執行期間指定一個角度範圍,抑制範圍外的聲音。這類方法證明方向可以成為強力的控制條件,但也凸顯了只靠角度仍無法完整描述三維空間。NeurIPS:The Cone of Silence
距離線索從哪裡來?
不少人會直覺認為,距離只要看音量就好。聲音越大代表越近,聲音越小代表越遠。
實際上沒這麼簡單。
一位說話很小聲的近距離使用者,可能比一位大聲說話的遠距離使用者更安靜。麥克風增益、自動音量控制和裝置朝向,也會改變接收到的音量。
所以比較可靠的距離判斷,不能只看「有多大聲」。
直達聲與殘響聲的比例
這篇 Interspeech 研究使用的重要距離特徵,是直達聲與殘響聲之間的比例。
直達聲指的是從說話者直接抵達麥克風的聲音;殘響聲則是碰到牆面、天花板、桌子和其他物體後,再反射到麥克風的聲音。
說話者靠近麥克風時,直達聲通常比較突出。說話者距離變遠後,直達聲會快速減弱,但房間裡的反射聲不一定以相同速度降低,因此殘響所占的比例會變高。
這種差異可以讓模型推測聲源大致位於近距離還是遠距離。Google Research 在 2022 年的距離式聲音分離研究中,也展示了即使只有單一麥克風,模型仍可能利用音量、殘響與聲學環境特徵,把近處和遠處聲音分開。Distance-Based Sound Separation
不過,距離線索通常沒有方向線索穩定。厚重窗簾、玻璃牆、開放式空間和小型會議室,會形成完全不同的殘響模式。模型若只在某幾種模擬房間中訓練,換到真實場景後很容易判斷失準。
方向與距離如何放進同一個模型?
2025 年的區域語音分離研究沒有使用兩套獨立模型,分別判斷方向和距離,而是將兩類特徵一起交給同一個神經網路處理。
整體流程可以用四個步驟理解。
第一步:對齊目標方向
系統先根據指定角度,調整各個麥克風訊號的時間,使目標方向傳來的聲音盡量同步。
這一步相當於告訴模型:「我們現在主要想聽這個方向。」
第二步:建立多組方向特徵
研究團隊不只把所有麥克風訊號直接相加,也比較部分麥克風配對後的結果。
相加後的訊號可以強化目標方向;相減後的訊號則會削弱已經對齊的目標,讓干擾部分更加明顯。兩者一起提供給模型,相當於同時告訴它「目標可能長這樣」以及「非目標可能長這樣」。
這種做法比單純輸入原始多聲道音訊更有方向感,也減少模型必須從零學習聲學規則的負擔。
第三步:加入距離特徵
系統再比較直達聲和殘餘聲音的能量關係,產生代表距離的特徵。
論文測試了兩種方式:一種是把兩類能量直接交給模型,另一種是先整理成比例。結果顯示,直接使用比例的效果比較好。
我很喜歡這種設計思路。不是把所有原始資料全部塞進模型,期待 AI 自己悟出物理學,而是先把已知有效的聲學線索整理好,再讓模型處理複雜邊界。
模型參數再多,也不代表前處理可以隨便。
第四步:預測需要保留的聲音
神經網路最後會對音訊中的不同時間和頻率區段進行判斷,保留位於目標區域內的聲音,降低其他方向或距離之外的干擾。
研究採用可以處理時間與頻率關係的雙路徑循環神經網路,模型約有 97.9 萬個參數。音訊取樣率為 16 kHz,研究報告的語音分離延遲為 20 毫秒,具備即時串流的潛力。區域語音分離完整方法與實驗
實驗結果真的有改善嗎?
從論文數據來看,方向與距離線索確實互補。
在模擬的區域語音分離測試中,原始混合音訊的語音可懂度約為 61.1%。只輸入原始多麥克風訊號後,可懂度提升至 76.2%。
加入改良式方向特徵後,語音可懂度上升至 85%;只加入距離比例特徵時,則達到 83.5%。當方向與距離特徵同時使用,可懂度進一步提高至 88.2%。
訊號失真指標也呈現相同趨勢:
- 只使用原始麥克風訊號約為 5.75 dB。
- 加入方向線索後約為 7.85 dB。
- 加入距離線索後約為 7.43 dB。
- 同時使用方向與距離線索後提高至 8.79 dB。
這組結果說明,單獨使用方向或距離都有幫助,但兩者結合才能比較完整地定義目標空間。
真實智慧眼鏡測試更值得關注
純模擬資料很容易讓音訊模型看起來很漂亮。真正有價值的是,研究也使用 CHiME-8 MMCSG 智慧眼鏡資料進行測試。
這套資料包含配戴者、談話對象、干擾說話者和環境噪音,由智慧眼鏡上的七個非規則排列麥克風錄製。這比固定在桌上的實驗室陣列更接近現實:裝置會跟著頭部移動,說話者位置也不會永遠保持不變。
在要求整體延遲低於 0.15 秒的語音辨識測試中,基準系統的平均字錯誤率為 22.1%,論文方法降低到 15.2%。在較寬鬆的延遲條件下,字錯誤率則從基準的 17.9%降到 13.05%。
這裡最重要的不是某個語音品質分數,而是分離後的音訊確實改善了後續語音辨識。對產品而言,使用者不會在意模型的論文指標,他只會在意逐字稿有沒有把同事的話聽錯。
實際部署時,第一個問題通常不是 AI
論文已經證明方法可行,但要把它放進產品,通常先撞到的是硬體和資料管道。
麥克風位置必須固定而且準確
方向估計依賴不同麥克風之間極小的時間差。若實際麥克風位置與模型假設不一致,對齊方向就會偏掉。
原型階段使用固定開發板通常沒問題,但量產設備可能遇到:
- 麥克風焊接位置誤差。
- 外殼厚度改變聲音傳遞。
- 防水網罩影響頻率響應。
- 左右聲道增益不一致。
- 音訊驅動造成不同聲道的時間偏移。
這些問題不是再加兩層神經網路就能修好。量產前必須做每種硬體版本的陣列校正,並把校正參數與韌體版本一起管理。
不要把所有麥克風組合都丟給模型
麥克風越多,可建立的配對數量就增加得越快。全部使用看似能提供最多空間資訊,實際上也會增加特徵通道、記憶體用量和運算成本。
論文的八麥克風測試顯示,使用全部配對產生 65 個特徵通道,只比選擇四組對稱麥克風、使用17個通道的版本稍微好一點。方向分離的可懂度只從 91.5%提高到 92%。
為了這半個百分點,多承擔數倍輸入通道不一定划算。
工程上比較合理的做法是先測試:
- 哪些麥克風基線最能區分目標角度。
- 拿掉哪些配對幾乎不影響辨識率。
- 不同裝置姿勢下,哪些麥克風最容易被遮擋。
- 減少通道後能省下多少延遲和功耗。
可用的模型不一定是分數最高的模型,而是品質、耗電、發熱和延遲能一起過關的版本。
距離特徵最容易受房間影響
利用殘響判斷距離有一個先天問題:模型不只在估計說話者距離,也在間接判斷房間長什麼樣子。
同一個人站在一公尺外,在臥室、浴室、會議室和戶外錄製,得到的直達聲與殘響比例可能完全不同。
論文測試顯示,模型在不同殘響時間下仍維持相對穩定的指標,這是一個正面訊號。但模擬殘響仍無法完整涵蓋真實世界中的玻璃隔間、開門、移動物體和人群吸音效果。
訓練資料不能只有乾淨的房間模擬
如果我要建立正式資料集,至少會涵蓋:
- 小房間、長走廊、開放式辦公室和戶外。
- 木牆、玻璃、布簾與大量家具。
- 麥克風被頭髮、衣物或手掌部分遮住。
- 說話者在移動中轉頭。
- 近距離小聲說話和遠距離大聲說話。
- 音樂、電視和其他語言的人聲干擾。
- 不同性別、音高、口音及說話速度。
- 多種麥克風增益和硬體版本。
只用房間模擬器快速生資料很方便,我也做過這種事。但模擬資料最大的特色,就是永遠比產品上線後收到的資料有禮貌。
區域邊界不應該是一刀切
假設系統設定只保留兩公尺內的聲音,那麼一位使用者從 1.9 公尺走到 2.1 公尺時,聲音不應突然消失。
如果模型在邊界附近不斷切換,使用者會聽到音量抽動、語句破碎,甚至出現像網路不穩的錯覺。
比較實用的處理方式包括:
加入邊界緩衝
進入目標區域和離開目標區域可以使用不同門檻,避免距離估計稍微波動就反覆開關。
使用漸進式音量調整
接近區域邊緣時逐步降低聲音,不要從完整保留直接變成完全靜音。這類淡入淡出通常比硬切自然得多。
保留短時間狀態
系統可以觀察連續數個音訊片段,再決定說話者是否真的離開區域。這會增加一些延遲,卻能換取更穩定的聆聽體驗。
這些設計在論文指標裡不一定明顯,但使用者通常一下就聽得出來。
移動中的說話者才是真正考驗
會議室裡的人會轉頭,智慧眼鏡配戴者會走動,車內乘客也不會固定面向麥克風。
如果系統只在開始時估計一次方向,幾秒後目標區域就可能偏離真正的說話者。
因此,正式產品還需要加入:
- 持續更新的聲源方向估計。
- 說話者移動軌跡平滑。
- 頭部或裝置姿態感測。
- 說話活動偵測。
- 多人交談時的目標切換機制。
- 暫時被遮擋後的聲音追蹤。
更新速度太慢,模型會追不上人;更新太快,方向又可能因短暫噪音跳來跳去。實作時通常要在反應速度和穩定性之間找平衡。
即時系統不能只看模型延遲
論文中的語音分離延遲是 20 毫秒,對串流應用來說相當有吸引力。但這只是語音分離模組本身。
一套完整產品還可能包含:
- 麥克風驅動與音訊緩衝。
- 回音消除與自動增益控制。
- 聲音方向追蹤。
- 區域語音分離。
- 語音活動偵測。
- 自動語音辨識。
- 網路傳輸與字幕顯示。
每一層都只多二三十毫秒,累積起來就可能超過使用者能接受的範圍。
我通常會量測從聲音真正進入麥克風,到耳機播放、字幕顯示或遠端收到資料的端到端延遲,而不是只引用模型報告裡最漂亮的數字。
另外,論文模型處理兩秒音訊約需要 62 億次浮點運算。參數量不到一百萬並不算大,但運算量仍不能忽略。要部署到智慧眼鏡、助聽器或低功耗裝置,還需要考慮量化、運算子支援、記憶體搬移及晶片實際吞吐量。
「模型檔案很小」和「裝置跑得動」從來不是同一件事。
評估語音分離不能只聽一段 Demo
語音 Demo 很容易挑出最好聽的案例。真正的測試應同時涵蓋聲音品質、語意完整度與產品行為。
語音品質
可以使用語音品質、可懂度和失真程度等客觀指標,確認輸出是否比原始混音清楚。
語音辨識結果
如果產品最終會接語音轉文字,就應直接測量字錯誤率。分離後聽起來比較乾淨,不代表辨識器一定更容易理解。
有些模型會把人耳不太在意的子音細節一起削掉,聽感似乎平順,逐字稿卻錯得更多。
區域誤判率
系統還應測試兩種錯誤:
- 目標區域內的人聲被錯誤刪除。
- 區域外的人聲被錯誤保留下來。
如果用於會議紀錄或助聽設備,漏掉目標語句通常比殘留一些背景聲更嚴重。若用於隱私隔離,錯誤保留區域外談話反而可能是更大的問題。
真實使用者測試
最後仍要找人實際配戴或使用設備,測試說話者移動、搶話、笑聲、短句和突然轉頭等情況。
論文數字可以幫我決定是否值得做原型,但不會替我簽署上線同意書。
區域語音分離適合哪些產品?
智慧眼鏡與穿戴裝置
系統可以保留配戴者面前、特定距離內的談話對象,降低背後人群或遠處廣播聲,改善即時字幕與語音助理輸入。
助聽器與耳機
使用者不需要事先登錄對方聲紋,只要面向交談者,就能強化附近談話。相較於只能辨識固定說話者的模型,空間區域提供了更直覺的控制方式。
視訊會議設備
會議室可以只收錄座位區內的人聲,降低走廊談話、遠方同事和開放式辦公空間的干擾。
車載語音系統
不同座位可以被定義為獨立區域,讓系統辨認是駕駛還是乘客下達指令,也能改善多乘客同時說話時的語音辨識。
機器人與智慧家庭
機器人可以將鏡頭或感測器偵測到的位置轉換成目標收音區域,只處理面前使用者的指令,降低電視或其他房間談話造成的誤觸發。
哪些情況不需要硬上區域語音分離?
如果產品只有單一固定說話者,而且麥克風距離很近,一般降噪和回音消除可能已經足夠。
以下情況也不一定需要完整的方向加距離模型:
- Podcast 使用者各自配戴獨立麥克風。
- 線上會議每位參與者都有自己的近講設備。
- 系統只需要消除冷氣和鍵盤等非人聲噪音。
- 裝置只有一支麥克風,卻要求精確區分複雜方向。
- 產品無法取得足夠的真實空間錄音進行訓練。
- 延遲和功耗限制比語音分離品質更重要。
這些情況下,硬上大型 AI 模型可能只會增加開發成本、耗電與維護負擔。能用正確的麥克風擺放解決,就先不要急著訓練一個模型。
常見問題
什麼是區域語音分離?
區域語音分離是依照聲源所在的空間範圍保留或移除聲音。指定條件通常包含方向、距離,有時也會加入高度資訊。
區域語音分離和一般降噪有什麼不同?
一般降噪主要移除環境噪音,卻不一定能分辨目標人聲與干擾人聲。區域語音分離會根據聲音來源位置,抑制指定區域外的其他說話者。
為什麼需要多支麥克風?
多支麥克風可以比較聲音抵達時間、相位和音量的差異,提供方向資訊。麥克風數量、排列方式與間距都會影響定位精度。
如何判斷說話者距離?
常見方法會觀察音量、直達聲與殘響聲比例,以及多麥克風接收到的波前差異。單看音量通常不夠可靠,因為每個人的說話音量不同。
方向和距離線索哪一個比較重要?
目前研究結果普遍顯示方向線索較穩定,距離線索則能處理同方向但遠近不同的說話者。兩者結合通常比單獨使用任一線索更完整。
區域語音分離可以即時運作嗎?
可以。2025 年 Interspeech 研究報告的分離模組延遲為 20 毫秒。不過,產品仍須計算音訊緩衝、方向追蹤、語音辨識和網路傳輸造成的總延遲。
區域語音分離能完全消除其他人聲嗎?
不能保證。相近方向、強烈殘響、說話者移動、麥克風遮擋及陌生房間,都可能造成聲音殘留或誤刪。正式產品應提供強度調整與失效時的保守模式。
結語:空間線索比單純堆大模型更重要
區域語音分離的核心,不是要求 AI 憑空猜出誰最重要,而是提供一套明確的空間規則:只保留這個方向、這段距離內的聲音。
方向線索通常較強,可以先快速排除大部分干擾;距離線索則進一步處理同方向、不同遠近的說話者。2025 年的研究顯示,把改良式波束成形和直達聲對殘響聲比例放進同一模型,確實能改善語音品質、可懂度與後續辨識率。
但從研究原型走到正式產品,仍要處理麥克風誤差、房間差異、移動聲源、邊界切換、耗電和端到端延遲。
我會把這類技術視為「聲學系統加上神經網路」,而不是單純的 AI 功能。先利用物理線索把問題整理好,再讓模型處理傳統方法難以涵蓋的變化,通常比把所有原始聲音塞進一個更大的模型可靠。
畢竟正式環境不在乎模型用了多少層。它只在乎使用者開口時,系統到底聽見了誰。
立即體驗安全可靠的交易平台,點擊加入:https://www.okx.com/join?channelId=42974376