SafeVoice——專有的語音智慧引擎,僅從幾秒鐘的日常說話中標記可能的酒精受損。非侵入式、無需專用硬體,只需要一句口頭短語。
受損人員仍是可預防工業事件的主要且未充分量測的驅動因素。酒精會在症狀明顯可見之前,降低反應速度、空間判斷力和精細動作控制。傳統控制手段——定期酒精檢測和目視主管檢查——是間歇性的、侵入性的、在班次閘門造成瓶頸,且易於規避。結果就是一個營運盲點:高風險狀態仍是最難持續攔截的。
語音是消除此差距的理想訊號。工人在整個班次中自然使用隨按即說無線電、對講機和語音介面。酒精會持續改變聲學生物力學——損害發音速度、發聲時序、韻律和頻譜語音品質——這些生物標記可由專業模型從數秒的音訊中擷取。
SafeVoice 以兩種互補架構部署。
SafeVoice-Ref 將即時語音與該工人已註冊的清醒基線進行比對——非常適合班次開始時的門禁篩檢。
SafeVoice-Solo 以零樣本方式運作,無需註冊基線,在班次期間的日常無線電通訊中評估單次語音片段。
德國酒精語言語料庫(German Alcohol Language Corpus,標準公開基準)的保留測試分割,以未加權平均召回率(UAR)計分。與先前技術的比較使用每視窗指標——每個話語單一決策,無投票——因為先前技術不進行投票。
SafeVoice-Ref 不是孤立地分類音訊,而是將語音與個人的基線檔案進行比對。消除說話者間的聲學變異,立即帶來約 5 個百分點的未加權平均召回率(UAR)提升——這是我們最具影響力的架構里程碑。
Ref 和 Solo 都利用相同的低層聲學表徵。SafeVoice-Ref 透過快速的一次性註冊最大化精確度,而 SafeVoice-Solo 則優先考量零營運摩擦,無需歷史資料即可立即篩檢任何說話者。
標準做法建議在小語料庫上凍結預訓練骨幹。我們的實證掃描證明恰好相反:篩檢準確度隨微調深度而提升,在完整的端到端骨幹調整下,與部分層凍結相比躍升約 7 個百分點。
聲學生物標記存在於不同的時間解析度中。較低層的骨幹保留精細的發音和聲道動態,而較高層則模擬韻律流動和措辭節奏。多層融合搭配注意力池化,動態加權最具診斷性的幀。
我們跳過合成白噪音,採用廣泛的工業音訊課程——重型機械、車輛低鳴、環境人群嘈雜聲和結構迴響。這在不降低乾淨基線準確度的情況下,縮小了嚴苛現場條件下的效能差距。
為防止短暫的尖峰或清喉嚨觸發誤報,推論管線對每個話語的多個重疊分析視窗進行評分。套用共識投票增加 1–2 個百分點的 UAR,並使偵測對真實世界的聲學尖峰具有極高的韌性。
共識 UAR(MV@5),基於參考 / 無參考。發布內容包含準確度下降的條件。
SafeVoice 不量測血液酒精濃度,也不能作為將工作人員調離崗位的依據。它是一線篩查工具,指出誰需要關注,再由既定方式進行確認。相關的比較對象不是酒測器,而是當今實際使用的替代方案:主管目視觀察,其表現大約等同於未經訓練的聆聽。
所有結果均來自單一語料庫——German Alcohol Language Corpus,由 162 位說話者錄製,每位說話者皆有血液及呼氣酒精濃度之真實標註。這是此任務的參考基準,但它是單一語料庫,上述所有比較皆在其保留的測試分割上進行。
我們在發布整體數據的同時,也公布準確率下降的條件,並公布我們否決的內容:輔助情緒與血液酒精迴歸輸出頭(負面影響)、部分骨幹凍結(約差七個百分點)、決策閾值調整(治標不治本,僅增益 0.2 個百分點),以及無參考模型的說話者嵌入條件化——實際增益 0.6 個百分點,但因需要每位使用者註冊、破壞 Solo 的零摩擦優勢而捨棄。
班次開始時的適勤檢查:以簡短的口語簽到比對已註冊的基準聲紋
針對常規無線電通訊進行持續被動監測,無需註冊
將經校正的警示標記傳送給相應主管,由人做最終決定
在 CPU 上運行,每個分析窗口延遲低於一秒
在缺乏人口統計背景資訊時能優雅降級
透過 XENOM 平台與現場其他營運訊號一併呈現