語音所傳達的不只是文字。酒精中毒會在發音、語速及頻譜微變化中留下可測量的痕跡——這些訊號人耳充其量只能不可靠地察覺。
XENOM 的研發團隊已訓練出專有的深度學習模型來偵測這些聲學生物標記,並在 Alcohol Language Corpus(此任務的標準公開基準)上進行評估。
嚴格以同等方式評分——按窗口計算的未加權平均召回率,每個話語只作一次決定,無投票機制,與先前研究的衡量方式完全一致——基於參考的配置達到 86.3% UAR。無需參考的配置(無需已登錄的基線,僅憑單一語音樣本作決定)達到 81.9%。在部署操作點,系統將錄音中的多個窗口結合成共識決定時,分別上升至 87.6% 和 82.5%。
作為背景參考:Interspeech 2011 說話者狀態挑戰賽在此語料庫上的官方基線為 65.9% UAR,先前發表的最先進結果約在 73–75% 之間,未受訓練的人類聆聽者得分約為 60–65%。
系統作為常規無線電通訊之上的被動層運行。工人如常說話;無需額外程序、不中斷工作、不設獨立檢查站。
系統能做什麼——以及不能做什麼。它不測量血液酒精濃度,亦不能作為將工人調離崗位的依據。它是第一線篩查工具,指出哪些人值得關注,再以既定方式進行核實。相關的比較對象不是酒精呼氣測試儀,而是現時使用的替代方案:主管觀察,其表現大約等同於未受訓練的聆聽。
我們已發布跨聲學條件的完整結果——包括準確度下降的情況——以及方法的可比性注意事項和已知限制。