音声には言葉以上のものが含まれています。アルコール中毒は、調音、テンポ、スペクトルの微細な変動に測定可能な痕跡を残します。人間の耳が信頼性高く捉えられるとは言い難い信号です。
XENOMのR&Dチームは、これらの音響バイオマーカーを検出する独自のディープラーニングモデルを訓練し、このタスクの標準的な公開ベンチマークであるAlcohol Language Corpusで評価しました。
厳密に同一条件で評価 — ウィンドウごとの無加重平均再現率、投票なしの発話ごとの単一決定、先行研究とまったく同じ測定方法 — 参照ベース構成は86.3%のUARに達しました。登録されたベースラインを必要とせず、単一の音声サンプルから決定する参照フリー構成は81.9%に達しました。展開時の動作点では、システムが録音の複数ウィンドウを合意決定に統合し、それぞれ87.6%と82.5%に上昇します。
参考として、このコーパスにおけるInterspeech 2011 Speaker-State Challengeの公式ベースラインは65.9% UARであり、既発表の最先端結果はおよそ73〜75%がピークで、訓練を受けていない人間の聴取者は約60〜65%です。
このシステムは、通常の無線通信に重ねる受動的レイヤーとして動作します。作業員はこれまで通りに話すだけです。追加の手順も、作業の中断も、別個のチェックポイントもありません。
このシステムができること、できないこと。血中アルコール濃度を測定するものではなく、作業員を職務から外す根拠として使用することはできません。これは、確立された手段による確認のために、注意を要する人物を示す一次スクリーニングツールです。関連する比較対象は飲酒検知器ではなく、今日使用されている代替手段、すなわち監督者の観察です。これは訓練を受けていない聴取とほぼ同じレベルです。
精度が低下する条件を含む全音響条件での完全な結果を、比較可能性に関する注意事項および本手法の既知の制限とともに公開しています。