XENOM 研发在非侵入式语音筛查方面达到顶尖水平

语音承载的不仅是词语。酒精中毒会在发音、语速和频谱微变化中留下可测量的痕迹——这些信号人耳最多只能不可靠地察觉。

XENOM 的研发团队训练了一个专有的深度学习模型来检测这些声学生物标志物,并在 Alcohol Language Corpus(该任务的标准公共基准)上对其进行了评估。

按照严格的一对一评分——每窗口未加权平均召回率,每次发声单一决策且无投票,与先前工作的衡量方式完全一致——基于参考的配置达到 86.3% UAR。无参考配置无需注册基线,仅通过单个语音样本即可做出判断,达到 81.9%。在部署工作点,系统将一段录音的多个窗口合并为共识决策时,这些数字分别上升到 87.6% 和 82.5%。

供参考:官方 Interspeech 2011 说话人状态挑战赛在该语料库上的基线为 65.9% UAR,此前发表的最先进结果峰值约为 73–75%,未经训练的人类听者得分约为 60–65%。

该系统作为常规无线电通信之上的被动层运行。工人像平常一样说话;无需额外程序,不中断任务,也无需单独检查点。

该系统是什么——以及不是什么。它不测量血液酒精浓度,不能作为将工人调离岗位的依据。它是一种一线筛查工具,指示谁需要关注,以便通过既定方式进行验证。相关的比较对象不是呼气测醉器,而是当今使用的替代方案:主管观察,其表现大致相当于未经训练的听音水平。

我们已发布跨声学条件的完整结果——包括准确性下降的情况——以及可比性注意事项和该方法的已知局限性。