XENOM 研發達成非侵入式語音篩檢的最新技術水準

語音承載的不只是言語。酒精中毒會在發音、語速與頻譜微變化中留下可測量的痕跡——這些是人耳至多只能不可靠地察覺的訊號。

XENOM 的研發團隊已訓練自有深度學習模型來偵測這些聲學生物標記,並在 Alcohol Language Corpus 上進行評估,這是此任務的標準公開基準。

以嚴格相同的標準計分——逐窗未加權平均召回率,每段話僅做單一決策且不投票,與先前研究的衡量方式完全一致——基於參考的配置達到 86.3% UAR。無需註冊基線、僅從單一語音樣本判斷的無參考配置則達到 81.9%。在部署的作業點上,系統會將一段錄音中的多個視窗結合成共識決策,分別提升至 87.6% 與 82.5%。

作為對照:此語料庫的官方 Interspeech 2011 Speaker-State Challenge 基線為 65.9% UAR,先前發表的最佳技術水準結果約在 73–75% 的峰值,未經訓練的人類聽者約為 60–65%。

此系統作為例行無線電通訊的被動層運作。工作者如常說話;無需額外程序、不會中斷工作、沒有單獨的檢查點。

系統能做什麼——以及不能做什麼。它不測量血液酒精濃度,也不能作為將工作者調離職務的依據。它是一線篩檢工具,指出誰需要關注,再由既有方式進行驗證。相關的比較對象不是酒測器,而是當今使用的替代方案:主管觀察,其表現大約在未經訓練聆聽的水準。

我們已發布跨聲學條件的完整結果——包括準確度下降的條件——以及可比較性注意事項和此方法的已知限制。