量評估指南:從客觀指標(biāo)到主觀聽感的完整框架)
在聊音頻質(zhì)量評估指標(biāo)之前先講一件上個(gè)月真實(shí)發(fā)生的事。幫朋友調(diào)試一套近場監(jiān)聽系統(tǒng)掃頻、失真、底噪全測了一遍軟件彈出來的數(shù)字接近“完美”頻響波動在±1dB以內(nèi)THDN不到0.05%底噪低到幾乎聽不見。按任何量化標(biāo)準(zhǔn)這套系統(tǒng)都屬于“數(shù)據(jù)健康”。但朋友聽了一下午始終覺得高頻發(fā)毛人聲咬字不自然尤其女聲唇齒音一出來就煩躁。后來拉了一場雙盲ABX才把那點(diǎn)不對勁釘死在高音單元8k到11kHz之間的一個(gè)諧振峰上——頻響圖上只有3dB左右的小鼓包寫報(bào)告都算“平直”但聽感上就是一層揮之不去的金屬味。這個(gè)案例基本概括了音頻質(zhì)量評估這個(gè)領(lǐng)域最讓人頭疼的地方指標(biāo)到底在測什么指標(biāo)和聽感之間隔著什么以及什么時(shí)候該相信數(shù)字、什么時(shí)候該相信耳朵。這篇內(nèi)容想把從主觀到客觀的完整框架講清楚主觀評價(jià)怎么做到嚴(yán)謹(jǐn)不玄學(xué)客觀指標(biāo)每一類在測什么、怎么讀、怎么和聽感掛鉤以及現(xiàn)實(shí)條件下一套能落地的評測鏈路怎么搭。適合音頻算法工程師、聲學(xué)相關(guān)從業(yè)者、音頻硬件評測愛好者也適合做語音通信質(zhì)量優(yōu)化的人參考。1. 音頻質(zhì)量評估的兩條路線為什么“數(shù)據(jù)完美”和“聽著好聽”經(jīng)常對不上1.1 一個(gè)“數(shù)據(jù)完美但聽著不對勁”的真實(shí)案例先把前面那個(gè)案例拆開看。那對近場監(jiān)聽在測試環(huán)境里測得的THDN表現(xiàn)非常好為什么耳朵還能找出毛病原因在于THDN只衡量了總諧波失真加噪聲的總能量測的是所有諧波和噪聲功率加在一起后的比值不同諧波分量、不同來源的噪聲被一股腦地加總了。一只揚(yáng)聲器如果只在特定頻段存在窄帶諧振這個(gè)能量占比放在整個(gè)頻段里看并不大THDN很容易就被“稀釋”掉。而人耳對窄帶共振非常敏感尤其是中高頻段哪怕只有幾dB的峰都會表現(xiàn)為刺耳、發(fā)毛、齒音過重。測量儀器沒有主觀偏重它把一切誤差一視同仁地計(jì)權(quán)人的聽覺系統(tǒng)卻對某些頻段、某些時(shí)間特征異常敏感。這還沒算另一個(gè)問題測量系統(tǒng)本身是穩(wěn)態(tài)正弦掃頻幾乎不會捕捉到瞬態(tài)失真、間隙性噪聲、時(shí)鐘抖動邊帶這類隨機(jī)/非平穩(wěn)問題。也就是說儀器看到的是一個(gè)“平均值”世界人耳聽的是一個(gè)“動態(tài)變化”世界。數(shù)字漂亮只能說明系統(tǒng)在測試條件下沒有明顯毛病不能說明系統(tǒng)在任何情況下都讓人舒服。1.2 人耳是一種遠(yuǎn)比頻譜儀復(fù)雜的“設(shè)備”為什么客觀指標(biāo)不能完全等價(jià)于聽感因?yàn)槿硕穆犛X機(jī)制從來就不是一臺線性頻譜分析儀。具體說有這幾個(gè)層次頻率分辨率是可變的人耳在低頻段頻率分辨率較弱中高頻段較強(qiáng)聽音樂時(shí)中高頻段輕微的頻響不平整很容易被察覺低頻室駐波則更多表現(xiàn)為“轟鳴感”而不是“音高變化”。響度感知是非線性的等響度曲線Fletcher-Munson曲線說明不同聲壓級下人對不同頻率的敏感度完全不同。低音量聽歌時(shí)低頻聽起來遠(yuǎn)小于物理測量值高頻相對更突出。所以一套揚(yáng)聲器在85dB SPL聲壓級測得平直在60dB SPL下可能是另一副聲音。做主觀對比時(shí)音量如果不匹配結(jié)論幾乎必然出偏差。掩蔽效應(yīng)決定“聽得到”和“聽不到”的邊界一個(gè)較強(qiáng)的信號可以掩蓋同時(shí)發(fā)生或鄰近頻率的較弱信號但失真分量如果處于掩蔽閾值之外或者出現(xiàn)在背景變安靜的時(shí)刻就會非??陕劇7€(wěn)態(tài)總諧波失真測量不會記錄“這段音樂里失真是否被掩蓋”只能機(jī)械地算出比例。時(shí)間維度極重要瞬態(tài)沖擊、預(yù)回聲、拖尾、衰減振蕩這些對聽感影響巨大但很多客觀指標(biāo)在時(shí)間維度上是“啞巴”。所以主觀評價(jià)和客觀評價(jià)本質(zhì)上測的是兩層?xùn)|西客觀指標(biāo)測物理信號層面的誤差主觀評價(jià)測人的感知層面的差異。兩者的關(guān)系更像“體檢報(bào)告”和“身體感受”——體檢看器官指標(biāo)身體感受看整體狀態(tài)兩者相關(guān)但永遠(yuǎn)不會完全一致。2. 主觀評價(jià)怎么做才能不再是“我覺得好聽”很多人在評價(jià)音頻設(shè)備或算法時(shí)慣用語是“我覺得這個(gè)好聽”“那個(gè)有點(diǎn)悶”。這種個(gè)體經(jīng)驗(yàn)作為早期篩選可以但做產(chǎn)品決策、算法調(diào)參、設(shè)備選型時(shí)遠(yuǎn)遠(yuǎn)不夠因?yàn)閭€(gè)體偏好、心理暗示、環(huán)境干擾都可能扭曲判斷。主觀評價(jià)升高到“方法論”層面之后完全是另一套玩法。2.1 雙盲ABX測試唯一能說服自己的降噪工具ABX是我日常用得最多的主觀對比方法因?yàn)樗倪壿嬜銐蚝唵螌?shí)際執(zhí)行足夠嚴(yán)格。流程是這樣的被測對象A和B系統(tǒng)再給一個(gè)XX隨機(jī)來自A或B。試聽者不知道X是哪一個(gè)只被要求回答“X是A還是B”。由于試聽者自己也不知道哪個(gè)是哪個(gè)心理暗示被極大削弱如果連續(xù)多次判斷都正確說明A和B之間確實(shí)存在可聽得見的差異。實(shí)際操作時(shí)有幾個(gè)經(jīng)驗(yàn)電平必須匹配到±0.1dB以內(nèi)。很多人做ABX實(shí)際比較的是音量差而不是音色差。響度差異對主觀判斷的干擾遠(yuǎn)高于其他變量。先用測量設(shè)備校準(zhǔn)而不是靠耳朵“感覺一樣響”。每輪之間要做隨機(jī)化。同一首歌、同一段素材讓X隨機(jī)落在A或B上統(tǒng)計(jì)上才能排除僥幸因素。用統(tǒng)計(jì)顯著性替代“我覺得有區(qū)別”。最常見的方法10次判斷中有至少9次正確二項(xiàng)檢驗(yàn)逼近p0.01基本可以認(rèn)定存在可聞差異20次中至少15次正確也顯著。如果只有60%正確率那不管聽起來多么“明顯”統(tǒng)計(jì)上都不支持差異存在。選測試素材要照顧敏感頻段。純低頻、純高頻、密集人聲、打擊樂瞬態(tài)、弱混響的安靜片段各準(zhǔn)備幾段。很多差異只在特定的素材條件下暴露。關(guān)于ABX工具foobar2000的ABX組件比較方便也可以用DeltaWave這類專業(yè)對比軟件。后者還能順帶記錄時(shí)間對齊、時(shí)鐘漂移修正后的樣本級差異對量化ABX結(jié)論幫助很大。2.2 MUSHRA對比多個(gè)算法時(shí)的高階玩法如果只是對比兩個(gè)設(shè)備ABX夠了。但當(dāng)手上同時(shí)有三五個(gè)編解碼器、三五個(gè)降噪算法要橫向排序時(shí)ABX的低效會讓測試周期拉得極長。這時(shí)適合用MUSHRAMUlti Stimulus test with Hidden Reference and Anchor標(biāo)準(zhǔn)號ITU-R BS.1534。MUSHRA的核心設(shè)計(jì)思想是“相對比較參考錨定”。測試?yán)飼瓦M(jìn)來多個(gè)待測樣品其中包含一個(gè)隱藏的原始參考hidden reference和幾個(gè)錨點(diǎn)anchor。錨點(diǎn)一般是故意降低質(zhì)量的版本比如截掉3.5kHz以上的低通版本用來給評分劃定“低分區(qū)間”。評聽員聽完全部樣品后在0到100的連續(xù)刻度上給每個(gè)樣品打分。因?yàn)殡[藏參考理論上應(yīng)該拿高分錨點(diǎn)理論上應(yīng)該拿低分評聽員的分寸感就有了錨。我做過幾輪不同音頻編解碼器的MUSHRA測試最大的體感是這個(gè)方案極大減少了“評分員今天心情好不好”帶來的方差。絕對打分靠不住相對打分靠譜得多。實(shí)際執(zhí)行時(shí)要求評聽員先聽一遍所有樣品形成整體感知尺度再開始正式評分而且同一組樣品建議讓評聽員反復(fù)切換對比而不是聽完一個(gè)評一個(gè)。2.3 MOS評分大規(guī)模主觀語音質(zhì)量測試的老牌方案如果是語音通話鏈路、VoIP效果、語音增強(qiáng)算法這類場景最常見的還是MOSMean Opinion Score。ITU-T P.800規(guī)定了兩種典型方法ACR絕對等級評分和DCR退化等級評分。ACR就是聽一段語音后直接給1到5分5是極好1是極差DCR則每次都和參考對一下比較“退化程度”適合評測增強(qiáng)或修復(fù)類算法。MOS看著簡單落地全是細(xì)節(jié)評聽員不能太少正式測試一般要求至少20到30人且都做過聽力篩查材料要覆蓋男聲、女聲、安靜環(huán)境、噪聲環(huán)境不能只測一種語音場地背景噪聲要控制在很低水平播放設(shè)備和監(jiān)聽耳機(jī)也要統(tǒng)一。最終分?jǐn)?shù)不是簡單平均還要剔除異常評聽員、計(jì)算置信區(qū)間必要時(shí)對分?jǐn)?shù)做回歸映射如MOS-LQO。所以真有團(tuán)隊(duì)以為“拉五個(gè)人聽一遍打平均分就是MOS”那就和曬了個(gè)假成績差不多。主觀評價(jià)把這套體系走完時(shí)間成本、人力成本、環(huán)境成本都很高這也是為什么客觀指標(biāo)在現(xiàn)代音頻工程里依然是第一道門。3. 客觀指標(biāo)全家桶基礎(chǔ)電聲指標(biāo)與感知客觀指標(biāo)的分類拆解客觀指標(biāo)按測量對象可以大致切分為兩大塊一類是傳統(tǒng)電聲指標(biāo)直接測物理量不理解調(diào)之后是什么場景另一類是感知型客觀指標(biāo)算法把參考/受損音頻映射成估測的人耳差異輸出一個(gè)類似“模擬MOS分”的結(jié)果。兩者的用途完全不同混為一談是很多誤解的根源。3.1 基礎(chǔ)電聲指標(biāo)頻響、THDN、噪聲、動態(tài)范圍、IMD的測量口徑我在實(shí)際工作中??吹碾娐曋笜?biāo)就這幾個(gè)指標(biāo)常見測量條件量綱/表達(dá)對應(yīng)聽感問題頻率響應(yīng)正弦掃頻1kHz歸一化dB±x dB音色平衡、冷暖、亮暗THDN1kHz正弦-1/-3dBFS輸入22Hz-22kHz帶限% 或 dB失真、顆粒感、粗糙感信噪比SNR靜音段與參考電平下的噪聲比dB底噪、黑位、安靜段落沙沙聲動態(tài)范圍從最大不失真電平到噪聲底dB大小聲壓差、細(xì)節(jié)表現(xiàn)IMD互調(diào)失真SMPTE 60Hz7kHz雙音或CCIF 19kHz20kHz%人聲渾濁、樂器分離度下降串?dāng)_單聲道信號輸入測量另一聲道泄漏dB聲場寬度、定位模糊群延遲/相位全頻段相位測量度或ms聲像一致性、頻率疊加干涉這里面最容易出誤會的兩個(gè)指標(biāo)是THDN和IMD。THDN測的是諧波加噪聲總能量但兩個(gè)完全不同的設(shè)備可能得到相同的THDN數(shù)值一個(gè)的失真集中在二次諧波聽感相對“暖”一個(gè)的失真集中在五、六次以上高次諧波聽感明顯更硬更刺耳。所以只看一個(gè)總百分比遠(yuǎn)遠(yuǎn)不夠要養(yǎng)成看諧波能量分布的習(xí)慣尤其看三次、五次諧波有沒有異常抬升。IMD則完全不在THD的成績單里。兩個(gè)純音疊加后系統(tǒng)非線性會產(chǎn)生兩個(gè)基頻的和差分量這些分量通常落在非諧波位置人耳對非諧波失真特別敏感因?yàn)檎R魳沸盘柪锊辉摮霈F(xiàn)這些頻率組合。很多“參數(shù)漂亮但聲音臟”的設(shè)備IMD指標(biāo)往往不怎么樣。頻響測量也有坑。普通設(shè)備上用掃頻所得的頻響曲線是穩(wěn)態(tài)響應(yīng)它不能反映時(shí)域上的能量積累。兩個(gè)頻響完全一樣的揚(yáng)聲器在瀑布圖衰減-頻率-時(shí)間三維圖上可能有完全不同的表現(xiàn)一個(gè)在低頻段有長拖尾一個(gè)干凈利落。所以測量頻響最好同時(shí)看對應(yīng)的CSD/瀑布圖不要把一條平直的曲線當(dāng)成全部真相。3.2 感知型客觀指標(biāo)PEAQ、PESQ/POLQA、STOI是如何“模擬人耳”的傳統(tǒng)電聲指標(biāo)是物理測量的“通用貨幣”但不回答“人覺得怎么樣”。于是出現(xiàn)了第二類指標(biāo)感知型客觀指標(biāo)。它們的思路是先模擬人耳的外中耳濾波、臨界頻帶劃分、響度感知、掩蔽效應(yīng)再用統(tǒng)計(jì)模型把“輸入信號和參考信號的感知差異”映射成一個(gè)可比較的分?jǐn)?shù)。代表性工具包括PEAQITU-R BS.1387用于音頻編解碼器質(zhì)量評估輸出ODGObjective Difference Grade0表示無感知差異負(fù)值越小越差。做AAC/Opus/MP3這類有損編碼橫向?qū)Ρ葧r(shí)我很常用能快速篩出采樣率碼率變化帶來的影響但要記住它和任何主觀分一樣存在“不準(zhǔn)的邊角”。PESQITU-T P.862/ POLQAITU-T P.863用于語音質(zhì)量評估。PESQ主要適配窄帶電話語音POLQA是它的接任者對寬帶/超寬帶語音的預(yù)測準(zhǔn)確度提升明顯輸出MOS-LQO。VoIP網(wǎng)關(guān)、通信鏈路的補(bǔ)盲閾值通常用它們來定。STOIShort-Time Objective Intelligibility這個(gè)指標(biāo)衡量的是可懂度而不是質(zhì)量輸出0到1。語音增強(qiáng)算法和ASR前端鏈路經(jīng)常會用比如去噪之后聽感可能不算好但STOI顯著提升說明字詞辨識度確實(shí)改善了。ViSQOL同時(shí)支持全帶寬音頻和語音倒譜距離加聽覺模型適用范圍比PESQ更寬在一些音視頻會議系統(tǒng)評測里出現(xiàn)過。這類感知指標(biāo)最大的優(yōu)勢是能自動化、可重復(fù)、成本低最大的風(fēng)險(xiǎn)是它們本身是模型不完全等于人耳。尤其面對近年來神經(jīng)網(wǎng)絡(luò)的語音增強(qiáng)/去混響/超分算法模型輸出和真人聽感背離的情況并不少見。所以我的使用原則很明確感知指標(biāo)用于回歸測試、版本對比、快速篩查關(guān)鍵節(jié)點(diǎn)仍然用MUSHRA或ABX收口。3.3 無參考與半?yún)⒖贾笜?biāo)沒有原始音源時(shí)怎么判斷前面的客觀指標(biāo)幾乎都需要參考信號原始無損/原始語音但真實(shí)場景常有拿不到參考的時(shí)候——比如實(shí)時(shí)通信監(jiān)控、會議系統(tǒng)每日質(zhì)量巡檢、直播鏈路上某條線路持續(xù)質(zhì)量劣化。這時(shí)就要用到無參考指標(biāo)。業(yè)界常見的無參考方案包括傳統(tǒng)模型P.563窄帶語音MOS預(yù)估以及近年基于深度學(xué)習(xí)的NISQA、DNSMOS等。這類模型訓(xùn)練時(shí)用海量帶標(biāo)數(shù)據(jù)擬合人類評分在“趨勢判斷”層面有一定參考價(jià)值突然掉0.5分說明鏈路大概率出問題了。但它們用作絕對仲裁還不太靠譜因?yàn)橛?xùn)練集外的失配條件可能讓預(yù)測完全失真。所以我在實(shí)時(shí)質(zhì)量監(jiān)控項(xiàng)目上的做法是無參考指標(biāo)設(shè)閾值告警 告警后抓包錄音 層級用ABX或POLQA復(fù)核。沒有原始音頻絕不斷言“這路信號聽感很差”。4. 把指標(biāo)和聽感掛鉤哪些是底線哪些只是參考客觀指標(biāo)不能完美預(yù)測聽感但不等于沒規(guī)律可循。多年實(shí)踐下來電子工程、聲學(xué)工程、語音通信這三個(gè)領(lǐng)域中摸到哪些邊界就有相對可靠的經(jīng)驗(yàn)判斷了。4.1 不同場景下我常用的大致達(dá)標(biāo)線場景主要指標(biāo)經(jīng)驗(yàn)達(dá)標(biāo)線近場監(jiān)聽音箱音樂制作聽音位頻響±1dB以內(nèi)消聲室條件室內(nèi)允許低頻區(qū)域更寬近場監(jiān)聽音箱THDN聲學(xué)測量中頻段低于1%80Hz以下允許更高監(jiān)聽耳機(jī)頻響±3dB以內(nèi)已經(jīng)算很健康單揚(yáng)聲器同批次一致性±1.5dB模擬線路設(shè)備THDN通常要求低于0.01%-80dB0.1%以下普通聽感大多可接受采樣率/位深鏈路動態(tài)范圍16bit系統(tǒng)約96dB24bit系統(tǒng)實(shí)測能達(dá)到110dB以上就算不錯(cuò)語音窄帶通話PESQ3.0以上算可接受3.5以上算良好語音寬帶通話POLQA3.8以上算良好4.0以上接近無損語音可懂度STOI0.9以上普遍認(rèn)為“字字清晰”無損音頻編解碼PEAQ ODG-0.5以內(nèi)多數(shù)人聽不出問題0到-1之間存在盲區(qū)這些數(shù)字不是我拍腦袋編的而是多年對比測試和項(xiàng)目驗(yàn)收中反復(fù)驗(yàn)證過的粗線條。但注意這些線是用來“排除明顯問題”的不是用來“證明聲音好”的。4.2 一套完整的合格判定流程先查數(shù)字再上盲聽日常做音頻設(shè)備或鏈路驗(yàn)收我總結(jié)了一套固定流程先電測再聲測然后有目的地盲聽。第一步電學(xué)參數(shù)測量。把被測試設(shè)備通過標(biāo)準(zhǔn)負(fù)載接入測試系統(tǒng)測頻響、THDN、IMD、底噪、動態(tài)范圍。這一步主要排除硬件層面的基本問題。 第二步聲學(xué)參數(shù)測量。如果被檢對象是揚(yáng)聲器、耳機(jī)、房間還要用測量麥克風(fēng)在聽音位做聲學(xué)測量看頻響、失真、衰減時(shí)間、瀑布圖。注意環(huán)境噪聲和測量麥克風(fēng)校準(zhǔn)。 第三步聽感排查。播放幾個(gè)固定試聽素材重點(diǎn)聽之前測量中暴露的可疑頻段。比如頻響圖上有個(gè)2dB到3dB的峰那就專門做ABX來定位這個(gè)峰是否可聞。 第四步如果設(shè)備之間有競爭關(guān)系要么排序、要么二選一一律上MUSHRA或ABX違背規(guī)則就是承認(rèn)自己在拍腦袋。 第五步復(fù)盤盲聽發(fā)現(xiàn)的差異對應(yīng)測量數(shù)據(jù)的哪些特征如果數(shù)據(jù)里看不出來回想哪個(gè)量沒測、哪個(gè)條件下沒覆蓋然后補(bǔ)測。這個(gè)循環(huán)走完你對這套東西的“指標(biāo)-聽感映射”會越來越準(zhǔn)。4.3 兩個(gè)典型的“數(shù)字很好、聽起來不對”故障模式這里分享兩個(gè)我實(shí)際踩過、也幫不少用戶排查過的故障模式都屬于“數(shù)據(jù)健康但聽感翻車”的典型。故障模式一頻響平直但低頻拖尾嚴(yán)重。某次測量一套書架箱在普通客廳里測得低頻區(qū)域在63Hz附近有個(gè)寬峰頻響曲線看起來只是略高但用瀑布圖看發(fā)現(xiàn)50Hz到80Hz的能量衰減時(shí)間比中頻長了將近一倍。聽感上的表現(xiàn)就是鼓點(diǎn)發(fā)悶、低音“一團(tuán)漿糊”貝斯線條不清晰。如果不看時(shí)間軸單看頻響曲線很容易認(rèn)為這個(gè)問題不存在。處理方式是重新擺位、加低頻陷阱然后再測衰減時(shí)間。故障模式二數(shù)字設(shè)備在安靜段落有間歇性毛刺。一臺桌面解碼器THDN、動態(tài)范圍指標(biāo)全部優(yōu)秀但在弱音量的鋼琴獨(dú)奏中每個(gè)音符尾巴上能聽到輕微的“嘶嘶”噪音。拿去掃頻測穩(wěn)態(tài)指標(biāo)依然沒問題。后來用較長的安靜錄音段做FFT功率譜平均才在高頻段看到一個(gè)窄帶小包峰低到-100dBFS左右——穩(wěn)態(tài)測量幾乎不會注意到但安靜片段里人耳對突發(fā)噪聲極其敏感。最后查出來是USB供電隔離不足引發(fā)時(shí)鐘邊帶干擾處理完接口供電后問題消失。這類問題說明指標(biāo)之外采樣時(shí)間結(jié)構(gòu)、瞬態(tài)行為、窄帶能量分布這些“二級特征”在聽感判斷中舉足輕重。這也是為什么客觀評測做得再熟最終仍然要對耳朵留一份尊重。5. 可以落地的小型評測實(shí)驗(yàn)我自己的一套低成本測試鏈路紙上談兵沒有意義。最后給一套我自己實(shí)際在用的、成本可控的音頻質(zhì)量評估方案。沒有消聲室、沒有昂貴聲學(xué)分析儀也可以做有意義的基礎(chǔ)評估。5.1 硬件和軟件選型從幾百塊到上千塊的方案硬件上一個(gè)靠譜的USB音頻接口是底線建議選兩個(gè)獨(dú)立聲道以上、信噪比高于100dB的入門款。板載聲卡首選排除因?yàn)樗牡自牒蜁r(shí)鐘精度會污染測量結(jié)果。測量麥克風(fēng)方面入門款如Behringer ECM8000性價(jià)比高但必須有校準(zhǔn)文件才適合做絕對頻響測量不配套校準(zhǔn)文件的話至少不能相信3kHz以上的高頻段準(zhǔn)確度。預(yù)算允許的情況iSEMcon和Earthworks的測量麥更省心。再加一臺聲壓計(jì)用于SPL校準(zhǔn)整套設(shè)備控制在幾千元以內(nèi)沒問題。軟件方面我最常用的是REWRoom EQ Wizard免費(fèi)且功能覆蓋頻響、失真、RT60、瀑布圖、阻抗測量。DeltaWave用于樣本級音頻對比和ABX輔助。ARTA也是專業(yè)向但學(xué)習(xí)曲線稍陡。整體來說REW足夠應(yīng)付絕大部分音頻/設(shè)備評估。5.2 用REW做一次完整的“頻響失真”測量以測量一對桌面監(jiān)聽音箱為例完整流程大致分五步連好物理鏈路USB聲卡輸出接放大器/音箱測量麥克風(fēng)放在音箱前方約1米、高音單元齊平的位置麥克風(fēng)輸出接聲卡輸入。在REW的Preferences里設(shè)置好聲卡輸入輸出設(shè)備用聲卡輸出連接監(jiān)聽功放做“聲卡回環(huán)校準(zhǔn)”把聲卡本身的延遲和頻響影響扣除干凈。這一步不做后續(xù)時(shí)間和相位數(shù)據(jù)都會失真。用聲壓計(jì)或校準(zhǔn)文件在REW內(nèi)設(shè)置SPL校準(zhǔn)。目標(biāo)是在80dB到85dB SPL左右測量接近實(shí)際聽音電平聲壓和距離直接關(guān)系到時(shí)間窗截取是否有效。設(shè)置正弦掃頻參數(shù)啟動測量。用時(shí)間窗比如8ms到20ms截掉大部分房間反射得到近場意義上的直達(dá)聲頻響。同一位置重復(fù)測3次看重復(fù)性是否穩(wěn)定。分析先看頻響主曲線再看THD曲線各頻率的諧波失真占比最后切到CSD瀑布圖看時(shí)間維度能量衰減。實(shí)際做一遍就會發(fā)現(xiàn)比起簡單的“聲道響度對比”REW能暴露多得多的問題某個(gè)頻率失真突然升高說明該頻段存在結(jié)構(gòu)共振瀑布圖上有長拖尾說明房間駐波沒處理。5.3 測量中的常見誤差源為什么你的測量數(shù)據(jù)可能不靠譜這套方案做下來最常把人帶偏的不是測試軟件本身而是測量鏈路里的隱藏誤差源麥克風(fēng)沒有校準(zhǔn)文件。沒有校準(zhǔn)文件的簡裝麥克風(fēng)在高頻段可能偏差好幾個(gè)dB頻響圖里的一個(gè)“谷”可能根本不存在。房間反射混入窗口。測量窗口開太長會把反射能量算進(jìn)直達(dá)聲高頻段出現(xiàn)梳狀濾波效應(yīng)曲線變成鋸齒狀。窗口開太短又丟失低頻信息。這是近場測量最大的取舍。環(huán)境噪聲太高??照{(diào)、風(fēng)扇、街道噪聲會把低頻底噪抬高失真曲線在低頻段永遠(yuǎn)偏高。白天測和深夜測數(shù)據(jù)可能差很大。測量電平過低或過高。電平過低失真被底噪掩蓋THD結(jié)果假好看電平過高系統(tǒng)進(jìn)入削波失真結(jié)果假難看。正規(guī)做法是看輸入信號記錄電平控制在測量鏈路不削波且遠(yuǎn)離底噪的水平。聲壓計(jì)不校準(zhǔn)倍頻程。SPL校準(zhǔn)誤差超過±1dB后續(xù)所有聲壓實(shí)測數(shù)據(jù)都不可信。我自己的習(xí)慣是每次測量前都做一次聲卡回環(huán)校準(zhǔn)每季度查一次測量麥克風(fēng)的校準(zhǔn)狀態(tài)每次測量完再評估一遍環(huán)境噪聲是否滿足條件。功夫下在數(shù)據(jù)采集之前才不至于讓后續(xù)分析變成雕花垃圾。這套鏈路測出來的數(shù)據(jù)配合前面的ABX/MUSHRA主觀流程基本能在“沒啥預(yù)算”的前提下形成一套自洽的評估閉環(huán)。音頻質(zhì)量評估沒有萬能指標(biāo)但也沒有理由全憑感覺拍板——把主觀做嚴(yán)謹(jǐn)、把客觀做有邊界兩層工具合起來用結(jié)論的可靠度會高出一個(gè)數(shù)量級。