從口頭報到中偵測聲學受損

SafeVoice——一個專有的語音智能引擎,僅從幾秒鐘的普通語音中標示可能的酒精影響。非侵入性,零專用硬件,只需一句話。

受影響的人員仍然是可預防工業事故的主要且未被充分監測的驅動因素。酒精在症狀明顯可見之前就已降低反應速度、空間判斷力和精細運動控制。傳統控制措施——定期呼氣測試和主管目視檢查——是間歇性的、侵入性的、在班次閘口造成瓶頸,且易於逃避。結果是一個營運盲點:高風險狀態仍然最難以持續攔截。

語音是消除這一差距的理想信號。工人在整個班次中自然使用即按即說對講機、門禁對講系統和語音介面。酒精持續改變聲學生物力學——損害發音速度、發聲時序、韻律和頻譜語音品質——這些生物標記可由專門模型從幾秒鐘的音頻中提取。

SafeVoice 以兩種互補架構部署。

SafeVoice-Ref 將實時語音與工人註冊的清醒基線進行比較——非常適合班次開始時的出入篩查。

SafeVoice-Solo 以零樣本方式運作,無需註冊基線,在整個班次的日常無線電通訊中評估單一語音片段。

德國酒精語言語料庫的保留測試分割,標準公共基準,以無權重平均召回率(UAR)評分。與先前技術的比較使用每窗口指標——每個話語單一決策,無投票——因為先前技術不投票。

我們建立了什麼

說話者相對差分編碼

SafeVoice-Ref 並非孤立地分類音頻,而是將語音與個人的基線檔案進行對比。消除說話者之間的聲學差異可立即帶來約 5 個百分點的無權重平均召回率(UAR)提升——這是我們最具影響力的架構里程碑。

雙模型架構,統一特徵堆疊

Ref 和 Solo 均利用相同的低層聲學表示。SafeVoice-Ref 透過快速的一次性註冊最大化精度,而 SafeVoice-Solo 優先考慮零營運摩擦,無需歷史數據即可立即篩查任何說話者。

完整骨幹適應

標準做法建議在小語料庫上凍結預訓練骨幹。我們的實證掃描證明了相反的情況:篩查準確度隨微調深度而提升,與部分層凍結相比,在完整的端到端骨幹適應下跳升約 7 個百分點。

多尺度特徵聚合

聲學生物標記存在於不同的時間解析度中。較低層的骨幹保留精細的發音和聲道動態,而較高層則建模韻律流程和短語節奏。多層融合後進行注意力池化,動態加權最具診斷性的幀。

重型工業噪音課程

我們繞過了合成白噪音,轉而採用廣泛的工業音頻課程——重型機械、車輛隆隆聲、環境人群嘈雜聲和結構混響。這在嚴峻的現場條件下縮小了性能差距,而不會降低乾淨基線的準確度。

多窗口共識解碼

為防止瞬時尖峰或清喉嚨觸發誤報,推理管線對每個話語評分多個重疊的分析窗口。應用共識投票可增加 1–2 個百分點的 UAR,並使偵測對現實世界的聲學尖峰具有極強的韌性。

量度結果

不同聲學條件下的性能下降

共識 UAR(MV@5),基於參考/無參考。已發表,包括準確度下降的條件。

系統是什麼——以及不是什麼

SafeVoice並唔量度血液酒精濃度,唔可以作為將工人調離崗位嘅依據。佢係一個第一線篩查工具,用嚟指出邊個需要關注,再以既定方法核實。相關比較並唔係同酒精測試儀比,而係同今日實際採用嘅替代方案比:主管觀察,其表現大約等於未經訓練嘅聆聽。

所有結果都嚟自同一個語料庫——German Alcohol Language Corpus,由162位講者錄製,每位都有血液同呼氣酒精濃度嘅基準真值。佢係呢項任務嘅參考基準,但只係單一語料庫,以上所有比較都係喺佢嘅保留測試集上進行。

我哋喺公布整體數據嘅同時,亦會公布準確度下降嘅情況,而且會公布我哋否決咗嘅嘢:輔助情緒同血液酒精回歸輸出頭(負面影響)、部分骨幹凍結(大約差七個百分點)、決策閾值調整(治標不治本,只值0.2個百分點),以及針對無參考模型嘅講者嵌入條件化——真實增益0.6個百分點,但因為需要每位用戶註冊,破壞咗Solo零摩擦嘅優勢而被捨棄。

使用方式

開工前適任檢查:以已註冊基準進行簡短口述簽到

對日常無線電通訊進行持續被動監測,無需註冊

將經校準嘅警示發送畀相關主管,由人類作最終決定

喺CPU上運行,每個分析視窗延遲低於一秒

喺缺乏人口統計背景時會優雅地降級

透過XENOM平台同場地其他營運訊號一齊呈現