
在聊音頻質量評估指標之前先講一件上個月真實發(fā)生的事。幫朋友調試一套近場監(jiān)聽系統(tǒng)掃頻、失真、底噪全測了一遍軟件彈出來的數(shù)字接近“完美”頻響波動在±1dB以內(nèi)THDN不到0.05%底噪低到幾乎聽不見。按任何量化標準這套系統(tǒng)都屬于“數(shù)據(jù)健康”。但朋友聽了一下午始終覺得高頻發(fā)毛人聲咬字不自然尤其女聲唇齒音一出來就煩躁。后來拉了一場雙盲ABX才把那點不對勁釘死在高音單元8k到11kHz之間的一個諧振峰上——頻響圖上只有3dB左右的小鼓包寫報告都算“平直”但聽感上就是一層揮之不去的金屬味。這個案例基本概括了音頻質量評估這個領域最讓人頭疼的地方指標到底在測什么指標和聽感之間隔著什么以及什么時候該相信數(shù)字、什么時候該相信耳朵。這篇內(nèi)容想把從主觀到客觀的完整框架講清楚主觀評價怎么做到嚴謹不玄學客觀指標每一類在測什么、怎么讀、怎么和聽感掛鉤以及現(xiàn)實條件下一套能落地的評測鏈路怎么搭。適合音頻算法工程師、聲學相關從業(yè)者、音頻硬件評測愛好者也適合做語音通信質量優(yōu)化的人參考。1. 音頻質量評估的兩條路線為什么“數(shù)據(jù)完美”和“聽著好聽”經(jīng)常對不上1.1 一個“數(shù)據(jù)完美但聽著不對勁”的真實案例先把前面那個案例拆開看。那對近場監(jiān)聽在測試環(huán)境里測得的THDN表現(xiàn)非常好為什么耳朵還能找出毛病原因在于THDN只衡量了總諧波失真加噪聲的總能量測的是所有諧波和噪聲功率加在一起后的比值不同諧波分量、不同來源的噪聲被一股腦地加總了。一只揚聲器如果只在特定頻段存在窄帶諧振這個能量占比放在整個頻段里看并不大THDN很容易就被“稀釋”掉。而人耳對窄帶共振非常敏感尤其是中高頻段哪怕只有幾dB的峰都會表現(xiàn)為刺耳、發(fā)毛、齒音過重。測量儀器沒有主觀偏重它把一切誤差一視同仁地計權人的聽覺系統(tǒng)卻對某些頻段、某些時間特征異常敏感。這還沒算另一個問題測量系統(tǒng)本身是穩(wěn)態(tài)正弦掃頻幾乎不會捕捉到瞬態(tài)失真、間隙性噪聲、時鐘抖動邊帶這類隨機/非平穩(wěn)問題。也就是說儀器看到的是一個“平均值”世界人耳聽的是一個“動態(tài)變化”世界。數(shù)字漂亮只能說明系統(tǒng)在測試條件下沒有明顯毛病不能說明系統(tǒng)在任何情況下都讓人舒服。1.2 人耳是一種遠比頻譜儀復雜的“設備”為什么客觀指標不能完全等價于聽感因為人耳的聽覺機制從來就不是一臺線性頻譜分析儀。具體說有這幾個層次頻率分辨率是可變的人耳在低頻段頻率分辨率較弱中高頻段較強聽音樂時中高頻段輕微的頻響不平整很容易被察覺低頻室駐波則更多表現(xiàn)為“轟鳴感”而不是“音高變化”。響度感知是非線性的等響度曲線Fletcher-Munson曲線說明不同聲壓級下人對不同頻率的敏感度完全不同。低音量聽歌時低頻聽起來遠小于物理測量值高頻相對更突出。所以一套揚聲器在85dB SPL聲壓級測得平直在60dB SPL下可能是另一副聲音。做主觀對比時音量如果不匹配結論幾乎必然出偏差。掩蔽效應決定“聽得到”和“聽不到”的邊界一個較強的信號可以掩蓋同時發(fā)生或鄰近頻率的較弱信號但失真分量如果處于掩蔽閾值之外或者出現(xiàn)在背景變安靜的時刻就會非??陕?。穩(wěn)態(tài)總諧波失真測量不會記錄“這段音樂里失真是否被掩蓋”只能機械地算出比例。時間維度極重要瞬態(tài)沖擊、預回聲、拖尾、衰減振蕩這些對聽感影響巨大但很多客觀指標在時間維度上是“啞巴”。所以主觀評價和客觀評價本質上測的是兩層東西客觀指標測物理信號層面的誤差主觀評價測人的感知層面的差異。兩者的關系更像“體檢報告”和“身體感受”——體檢看器官指標身體感受看整體狀態(tài)兩者相關但永遠不會完全一致。2. 主觀評價怎么做才能不再是“我覺得好聽”很多人在評價音頻設備或算法時慣用語是“我覺得這個好聽”“那個有點悶”。這種個體經(jīng)驗作為早期篩選可以但做產(chǎn)品決策、算法調參、設備選型時遠遠不夠因為個體偏好、心理暗示、環(huán)境干擾都可能扭曲判斷。主觀評價升高到“方法論”層面之后完全是另一套玩法。2.1 雙盲ABX測試唯一能說服自己的降噪工具ABX是我日常用得最多的主觀對比方法因為它的邏輯足夠簡單實際執(zhí)行足夠嚴格。流程是這樣的被測對象A和B系統(tǒng)再給一個XX隨機來自A或B。試聽者不知道X是哪一個只被要求回答“X是A還是B”。由于試聽者自己也不知道哪個是哪個心理暗示被極大削弱如果連續(xù)多次判斷都正確說明A和B之間確實存在可聽得見的差異。實際操作時有幾個經(jīng)驗電平必須匹配到±0.1dB以內(nèi)。很多人做ABX實際比較的是音量差而不是音色差。響度差異對主觀判斷的干擾遠高于其他變量。先用測量設備校準而不是靠耳朵“感覺一樣響”。每輪之間要做隨機化。同一首歌、同一段素材讓X隨機落在A或B上統(tǒng)計上才能排除僥幸因素。用統(tǒng)計顯著性替代“我覺得有區(qū)別”。最常見的方法10次判斷中有至少9次正確二項檢驗逼近p0.01基本可以認定存在可聞差異20次中至少15次正確也顯著。如果只有60%正確率那不管聽起來多么“明顯”統(tǒng)計上都不支持差異存在。選測試素材要照顧敏感頻段。純低頻、純高頻、密集人聲、打擊樂瞬態(tài)、弱混響的安靜片段各準備幾段。很多差異只在特定的素材條件下暴露。關于ABX工具foobar2000的ABX組件比較方便也可以用DeltaWave這類專業(yè)對比軟件。后者還能順帶記錄時間對齊、時鐘漂移修正后的樣本級差異對量化ABX結論幫助很大。2.2 MUSHRA對比多個算法時的高階玩法如果只是對比兩個設備ABX夠了。但當手上同時有三五個編解碼器、三五個降噪算法要橫向排序時ABX的低效會讓測試周期拉得極長。這時適合用MUSHRAMUlti Stimulus test with Hidden Reference and Anchor標準號ITU-R BS.1534。MUSHRA的核心設計思想是“相對比較參考錨定”。測試里會送進來多個待測樣品其中包含一個隱藏的原始參考hidden reference和幾個錨點anchor。錨點一般是故意降低質量的版本比如截掉3.5kHz以上的低通版本用來給評分劃定“低分區(qū)間”。評聽員聽完全部樣品后在0到100的連續(xù)刻度上給每個樣品打分。因為隱藏參考理論上應該拿高分錨點理論上應該拿低分評聽員的分寸感就有了錨。我做過幾輪不同音頻編解碼器的MUSHRA測試最大的體感是這個方案極大減少了“評分員今天心情好不好”帶來的方差。絕對打分靠不住相對打分靠譜得多。實際執(zhí)行時要求評聽員先聽一遍所有樣品形成整體感知尺度再開始正式評分而且同一組樣品建議讓評聽員反復切換對比而不是聽完一個評一個。2.3 MOS評分大規(guī)模主觀語音質量測試的老牌方案如果是語音通話鏈路、VoIP效果、語音增強算法這類場景最常見的還是MOSMean Opinion Score。ITU-T P.800規(guī)定了兩種典型方法ACR絕對等級評分和DCR退化等級評分。ACR就是聽一段語音后直接給1到5分5是極好1是極差DCR則每次都和參考對一下比較“退化程度”適合評測增強或修復類算法。MOS看著簡單落地全是細節(jié)評聽員不能太少正式測試一般要求至少20到30人且都做過聽力篩查材料要覆蓋男聲、女聲、安靜環(huán)境、噪聲環(huán)境不能只測一種語音場地背景噪聲要控制在很低水平播放設備和監(jiān)聽耳機也要統(tǒng)一。最終分數(shù)不是簡單平均還要剔除異常評聽員、計算置信區(qū)間必要時對分數(shù)做回歸映射如MOS-LQO。所以真有團隊以為“拉五個人聽一遍打平均分就是MOS”那就和曬了個假成績差不多。主觀評價把這套體系走完時間成本、人力成本、環(huán)境成本都很高這也是為什么客觀指標在現(xiàn)代音頻工程里依然是第一道門。3. 客觀指標全家桶基礎電聲指標與感知客觀指標的分類拆解客觀指標按測量對象可以大致切分為兩大塊一類是傳統(tǒng)電聲指標直接測物理量不理解調之后是什么場景另一類是感知型客觀指標算法把參考/受損音頻映射成估測的人耳差異輸出一個類似“模擬MOS分”的結果。兩者的用途完全不同混為一談是很多誤解的根源。3.1 基礎電聲指標頻響、THDN、噪聲、動態(tài)范圍、IMD的測量口徑我在實際工作中??吹碾娐曋笜司瓦@幾個指標常見測量條件量綱/表達對應聽感問題頻率響應正弦掃頻1kHz歸一化dB±x dB音色平衡、冷暖、亮暗THDN1kHz正弦-1/-3dBFS輸入22Hz-22kHz帶限% 或 dB失真、顆粒感、粗糙感信噪比SNR靜音段與參考電平下的噪聲比dB底噪、黑位、安靜段落沙沙聲動態(tài)范圍從最大不失真電平到噪聲底dB大小聲壓差、細節(jié)表現(xiàn)IMD互調失真SMPTE 60Hz7kHz雙音或CCIF 19kHz20kHz%人聲渾濁、樂器分離度下降串擾單聲道信號輸入測量另一聲道泄漏dB聲場寬度、定位模糊群延遲/相位全頻段相位測量度或ms聲像一致性、頻率疊加干涉這里面最容易出誤會的兩個指標是THDN和IMD。THDN測的是諧波加噪聲總能量但兩個完全不同的設備可能得到相同的THDN數(shù)值一個的失真集中在二次諧波聽感相對“暖”一個的失真集中在五、六次以上高次諧波聽感明顯更硬更刺耳。所以只看一個總百分比遠遠不夠要養(yǎng)成看諧波能量分布的習慣尤其看三次、五次諧波有沒有異常抬升。IMD則完全不在THD的成績單里。兩個純音疊加后系統(tǒng)非線性會產(chǎn)生兩個基頻的和差分量這些分量通常落在非諧波位置人耳對非諧波失真特別敏感因為正常音樂信號里不該出現(xiàn)這些頻率組合。很多“參數(shù)漂亮但聲音臟”的設備IMD指標往往不怎么樣。頻響測量也有坑。普通設備上用掃頻所得的頻響曲線是穩(wěn)態(tài)響應它不能反映時域上的能量積累。兩個頻響完全一樣的揚聲器在瀑布圖衰減-頻率-時間三維圖上可能有完全不同的表現(xiàn)一個在低頻段有長拖尾一個干凈利落。所以測量頻響最好同時看對應的CSD/瀑布圖不要把一條平直的曲線當成全部真相。3.2 感知型客觀指標PEAQ、PESQ/POLQA、STOI是如何“模擬人耳”的傳統(tǒng)電聲指標是物理測量的“通用貨幣”但不回答“人覺得怎么樣”。于是出現(xiàn)了第二類指標感知型客觀指標。它們的思路是先模擬人耳的外中耳濾波、臨界頻帶劃分、響度感知、掩蔽效應再用統(tǒng)計模型把“輸入信號和參考信號的感知差異”映射成一個可比較的分數(shù)。代表性工具包括PEAQITU-R BS.1387用于音頻編解碼器質量評估輸出ODGObjective Difference Grade0表示無感知差異負值越小越差。做AAC/Opus/MP3這類有損編碼橫向對比時我很常用能快速篩出采樣率碼率變化帶來的影響但要記住它和任何主觀分一樣存在“不準的邊角”。PESQITU-T P.862/ POLQAITU-T P.863用于語音質量評估。PESQ主要適配窄帶電話語音POLQA是它的接任者對寬帶/超寬帶語音的預測準確度提升明顯輸出MOS-LQO。VoIP網(wǎng)關、通信鏈路的補盲閾值通常用它們來定。STOIShort-Time Objective Intelligibility這個指標衡量的是可懂度而不是質量輸出0到1。語音增強算法和ASR前端鏈路經(jīng)常會用比如去噪之后聽感可能不算好但STOI顯著提升說明字詞辨識度確實改善了。ViSQOL同時支持全帶寬音頻和語音倒譜距離加聽覺模型適用范圍比PESQ更寬在一些音視頻會議系統(tǒng)評測里出現(xiàn)過。這類感知指標最大的優(yōu)勢是能自動化、可重復、成本低最大的風險是它們本身是模型不完全等于人耳。尤其面對近年來神經(jīng)網(wǎng)絡的語音增強/去混響/超分算法模型輸出和真人聽感背離的情況并不少見。所以我的使用原則很明確感知指標用于回歸測試、版本對比、快速篩查關鍵節(jié)點仍然用MUSHRA或ABX收口。3.3 無參考與半?yún)⒖贾笜藳]有原始音源時怎么判斷前面的客觀指標幾乎都需要參考信號原始無損/原始語音但真實場景常有拿不到參考的時候——比如實時通信監(jiān)控、會議系統(tǒng)每日質量巡檢、直播鏈路上某條線路持續(xù)質量劣化。這時就要用到無參考指標。業(yè)界常見的無參考方案包括傳統(tǒng)模型P.563窄帶語音MOS預估以及近年基于深度學習的NISQA、DNSMOS等。這類模型訓練時用海量帶標數(shù)據(jù)擬合人類評分在“趨勢判斷”層面有一定參考價值突然掉0.5分說明鏈路大概率出問題了。但它們用作絕對仲裁還不太靠譜因為訓練集外的失配條件可能讓預測完全失真。所以我在實時質量監(jiān)控項目上的做法是無參考指標設閾值告警 告警后抓包錄音 層級用ABX或POLQA復核。沒有原始音頻絕不斷言“這路信號聽感很差”。4. 把指標和聽感掛鉤哪些是底線哪些只是參考客觀指標不能完美預測聽感但不等于沒規(guī)律可循。多年實踐下來電子工程、聲學工程、語音通信這三個領域中摸到哪些邊界就有相對可靠的經(jīng)驗判斷了。4.1 不同場景下我常用的大致達標線場景主要指標經(jīng)驗達標線近場監(jiān)聽音箱音樂制作聽音位頻響±1dB以內(nèi)消聲室條件室內(nèi)允許低頻區(qū)域更寬近場監(jiān)聽音箱THDN聲學測量中頻段低于1%80Hz以下允許更高監(jiān)聽耳機頻響±3dB以內(nèi)已經(jīng)算很健康單揚聲器同批次一致性±1.5dB模擬線路設備THDN通常要求低于0.01%-80dB0.1%以下普通聽感大多可接受采樣率/位深鏈路動態(tài)范圍16bit系統(tǒng)約96dB24bit系統(tǒng)實測能達到110dB以上就算不錯語音窄帶通話PESQ3.0以上算可接受3.5以上算良好語音寬帶通話POLQA3.8以上算良好4.0以上接近無損語音可懂度STOI0.9以上普遍認為“字字清晰”無損音頻編解碼PEAQ ODG-0.5以內(nèi)多數(shù)人聽不出問題0到-1之間存在盲區(qū)這些數(shù)字不是我拍腦袋編的而是多年對比測試和項目驗收中反復驗證過的粗線條。但注意這些線是用來“排除明顯問題”的不是用來“證明聲音好”的。4.2 一套完整的合格判定流程先查數(shù)字再上盲聽日常做音頻設備或鏈路驗收我總結了一套固定流程先電測再聲測然后有目的地盲聽。第一步電學參數(shù)測量。把被測試設備通過標準負載接入測試系統(tǒng)測頻響、THDN、IMD、底噪、動態(tài)范圍。這一步主要排除硬件層面的基本問題。 第二步聲學參數(shù)測量。如果被檢對象是揚聲器、耳機、房間還要用測量麥克風在聽音位做聲學測量看頻響、失真、衰減時間、瀑布圖。注意環(huán)境噪聲和測量麥克風校準。 第三步聽感排查。播放幾個固定試聽素材重點聽之前測量中暴露的可疑頻段。比如頻響圖上有個2dB到3dB的峰那就專門做ABX來定位這個峰是否可聞。 第四步如果設備之間有競爭關系要么排序、要么二選一一律上MUSHRA或ABX違背規(guī)則就是承認自己在拍腦袋。 第五步復盤盲聽發(fā)現(xiàn)的差異對應測量數(shù)據(jù)的哪些特征如果數(shù)據(jù)里看不出來回想哪個量沒測、哪個條件下沒覆蓋然后補測。這個循環(huán)走完你對這套東西的“指標-聽感映射”會越來越準。4.3 兩個典型的“數(shù)字很好、聽起來不對”故障模式這里分享兩個我實際踩過、也幫不少用戶排查過的故障模式都屬于“數(shù)據(jù)健康但聽感翻車”的典型。故障模式一頻響平直但低頻拖尾嚴重。某次測量一套書架箱在普通客廳里測得低頻區(qū)域在63Hz附近有個寬峰頻響曲線看起來只是略高但用瀑布圖看發(fā)現(xiàn)50Hz到80Hz的能量衰減時間比中頻長了將近一倍。聽感上的表現(xiàn)就是鼓點發(fā)悶、低音“一團漿糊”貝斯線條不清晰。如果不看時間軸單看頻響曲線很容易認為這個問題不存在。處理方式是重新擺位、加低頻陷阱然后再測衰減時間。故障模式二數(shù)字設備在安靜段落有間歇性毛刺。一臺桌面解碼器THDN、動態(tài)范圍指標全部優(yōu)秀但在弱音量的鋼琴獨奏中每個音符尾巴上能聽到輕微的“嘶嘶”噪音。拿去掃頻測穩(wěn)態(tài)指標依然沒問題。后來用較長的安靜錄音段做FFT功率譜平均才在高頻段看到一個窄帶小包峰低到-100dBFS左右——穩(wěn)態(tài)測量幾乎不會注意到但安靜片段里人耳對突發(fā)噪聲極其敏感。最后查出來是USB供電隔離不足引發(fā)時鐘邊帶干擾處理完接口供電后問題消失。這類問題說明指標之外采樣時間結構、瞬態(tài)行為、窄帶能量分布這些“二級特征”在聽感判斷中舉足輕重。這也是為什么客觀評測做得再熟最終仍然要對耳朵留一份尊重。5. 可以落地的小型評測實驗我自己的一套低成本測試鏈路紙上談兵沒有意義。最后給一套我自己實際在用的、成本可控的音頻質量評估方案。沒有消聲室、沒有昂貴聲學分析儀也可以做有意義的基礎評估。5.1 硬件和軟件選型從幾百塊到上千塊的方案硬件上一個靠譜的USB音頻接口是底線建議選兩個獨立聲道以上、信噪比高于100dB的入門款。板載聲卡首選排除因為它的底噪和時鐘精度會污染測量結果。測量麥克風方面入門款如Behringer ECM8000性價比高但必須有校準文件才適合做絕對頻響測量不配套校準文件的話至少不能相信3kHz以上的高頻段準確度。預算允許的情況iSEMcon和Earthworks的測量麥更省心。再加一臺聲壓計用于SPL校準整套設備控制在幾千元以內(nèi)沒問題。軟件方面我最常用的是REWRoom EQ Wizard免費且功能覆蓋頻響、失真、RT60、瀑布圖、阻抗測量。DeltaWave用于樣本級音頻對比和ABX輔助。ARTA也是專業(yè)向但學習曲線稍陡。整體來說REW足夠應付絕大部分音頻/設備評估。5.2 用REW做一次完整的“頻響失真”測量以測量一對桌面監(jiān)聽音箱為例完整流程大致分五步連好物理鏈路USB聲卡輸出接放大器/音箱測量麥克風放在音箱前方約1米、高音單元齊平的位置麥克風輸出接聲卡輸入。在REW的Preferences里設置好聲卡輸入輸出設備用聲卡輸出連接監(jiān)聽功放做“聲卡回環(huán)校準”把聲卡本身的延遲和頻響影響扣除干凈。這一步不做后續(xù)時間和相位數(shù)據(jù)都會失真。用聲壓計或校準文件在REW內(nèi)設置SPL校準。目標是在80dB到85dB SPL左右測量接近實際聽音電平聲壓和距離直接關系到時間窗截取是否有效。設置正弦掃頻參數(shù)啟動測量。用時間窗比如8ms到20ms截掉大部分房間反射得到近場意義上的直達聲頻響。同一位置重復測3次看重復性是否穩(wěn)定。分析先看頻響主曲線再看THD曲線各頻率的諧波失真占比最后切到CSD瀑布圖看時間維度能量衰減。實際做一遍就會發(fā)現(xiàn)比起簡單的“聲道響度對比”REW能暴露多得多的問題某個頻率失真突然升高說明該頻段存在結構共振瀑布圖上有長拖尾說明房間駐波沒處理。5.3 測量中的常見誤差源為什么你的測量數(shù)據(jù)可能不靠譜這套方案做下來最常把人帶偏的不是測試軟件本身而是測量鏈路里的隱藏誤差源麥克風沒有校準文件。沒有校準文件的簡裝麥克風在高頻段可能偏差好幾個dB頻響圖里的一個“谷”可能根本不存在。房間反射混入窗口。測量窗口開太長會把反射能量算進直達聲高頻段出現(xiàn)梳狀濾波效應曲線變成鋸齒狀。窗口開太短又丟失低頻信息。這是近場測量最大的取舍。環(huán)境噪聲太高。空調、風扇、街道噪聲會把低頻底噪抬高失真曲線在低頻段永遠偏高。白天測和深夜測數(shù)據(jù)可能差很大。測量電平過低或過高。電平過低失真被底噪掩蓋THD結果假好看電平過高系統(tǒng)進入削波失真結果假難看。正規(guī)做法是看輸入信號記錄電平控制在測量鏈路不削波且遠離底噪的水平。聲壓計不校準倍頻程。SPL校準誤差超過±1dB后續(xù)所有聲壓實測數(shù)據(jù)都不可信。我自己的習慣是每次測量前都做一次聲卡回環(huán)校準每季度查一次測量麥克風的校準狀態(tài)每次測量完再評估一遍環(huán)境噪聲是否滿足條件。功夫下在數(shù)據(jù)采集之前才不至于讓后續(xù)分析變成雕花垃圾。這套鏈路測出來的數(shù)據(jù)配合前面的ABX/MUSHRA主觀流程基本能在“沒啥預算”的前提下形成一套自洽的評估閉環(huán)。音頻質量評估沒有萬能指標但也沒有理由全憑感覺拍板——把主觀做嚴謹、把客觀做有邊界兩層工具合起來用結論的可靠度會高出一個數(shù)量級。