SafeVoice——专有语音智能引擎,仅凭几秒钟的普通语音即可标记可能的酒精损伤。非侵入性,零专用硬件,只需一句口述短语。
状态受损的人员仍然是可预防工业事故的主要且监管不足的驱动因素。酒精在症状明显可见之前就已降低反应速度、空间判断力和精细运动控制能力。传统管控——周期性呼气检测和主管目视检查——是间歇性的、侵入性的、班次门口的瓶颈,且易于规避。结果是运营盲区:高风险状态最难被持续拦截。
语音是消除这一盲区的理想信号。工人在整个班次中自然使用按键通话对讲机、门禁对讲和语音界面。酒精持续改变声学生物力學——损害发音速度、发声时序、韵律和频谱语音质量——这些都是专用模型从几秒钟音频中提取的生物标志物。
SafeVoice 以两种互补架构部署。
SafeVoice-Ref 将实时语音与工人登记的清醒基线进行比对——适合班次开始的准入筛查。
SafeVoice-Solo 以零样本方式运行,无需登记基线,在班次期间的日常无线电通信中评估单个语音片段。
德语酒精语言语料库(标准公开基准)的留出测试集,以未加权平均召回率(UAR)评分。与先前工作的比较使用逐窗口指标——每个话语单一决策,无投票——因为先前工作不进行投票。
SafeVoice-Ref 不是孤立地对音频进行分类,而是将语音与个人的基线特征进行比对。消除说话人之间的声学差异,立即带来约 5 个百分点的未加权平均召回率(UAR)提升——这是我们最具影响力的架构里程碑。
Ref 和 Solo 都利用相同的底层声学表示。SafeVoice-Ref 通过快速一次性登记最大化精度,而 SafeVoice-Solo 优先考虑零运营摩擦,无需历史数据即可立即筛查任何说话人。
标准做法建议在小语料库上冻结预训练骨干网络。我们的实证扫描证明了相反的情况:筛查精度随微调深度而提升,与部分层冻结相比,全端到端骨干网络适配带来约 7 个百分点的提升。
声学生物标志物存在于不同的时间分辨率中。较低的骨干层保留精细的发音和声道动态,而较高层建模韵律流和短语节奏。多级融合后接注意力池化,动态加权最具诊断性的帧。
我们绕过了合成白噪声,转而使用大量工业音频课程——重型机械、车辆轰鸣、环境人群嘈杂和结构混响。这在严苛的现场条件下缩小了性能差距,而不会降低干净基线精度。
为防止瞬时尖峰或清嗓子触发误报,推理流程对每个话语的多个重叠分析窗口进行评分。采用共识投票可增加 1–2 个百分点的 UAR,并使检测对现实世界中的声学尖峰具有极强的鲁棒性。
共识 UAR(MV@5),基于参考 / 无参考。公开包括精度下降的条件。
SafeVoice 不测量血液酒精浓度,也不能作为将员工调离岗位的依据。它是一线筛查工具,用于提示谁需要关注,再由既定手段进行确认。相关的对比对象不是呼气式酒精检测仪,而是当下实际使用的替代方案:主管观察,其表现大致相当于未经训练的聆听。
所有结果均来自一个语料库——德语酒精语言语料库,采集自 162 位说话人,并带有每位说话人的血液和呼气酒精浓度真值。这是该任务的参考基准,但它只是单一语料库,上述所有比较均在其留出测试集上进行。
我们公开准确率下降的条件以及主要指标,也公开我们否决的方案:辅助情绪识别和血液酒精回归头(负面效果)、部分骨干冻结(约差 7 个百分点)、决策阈值调优(治标不治本,仅提升 0.2 个百分点),以及为无参考模型引入说话人嵌入条件——确实带来 0.6 个百分点的提升,但因需要逐用户注册、破坏 Solo 的零摩擦优势而被放弃。
班前适岗检查:对照已注册基线进行简短的语音签到
对常规无线电通信进行持续被动监测,无需注册
将校准后的警示发送给相应主管,由人工做出决定
在 CPU 上运行,每个分析窗口延迟低于一秒
在缺少人口统计学背景信息时性能平滑下降
通过 XENOM 平台与现场其他运营信号一同呈现