音声チェックインからの音響機能障害検知

SafeVoice — わずか数秒の通常の会話からアルコール機能障害の可能性をフラグ付けする独自の音声インテリジェンスエンジン。非侵襲的で専用ハードウェア不要、話し言葉のフレーズだけで十分です。

機能障害のある人員は、予防可能な産業インシデントの主要な、そして十分に計測されていない要因であり続けています。アルコールは、症状が視覚的に明らかになるずっと前に、反応速度、空間判断、微細運動制御を低下させます。従来の管理 — 定期的な呼気検査とスーパーバイザーの目視チェック — は断続的で侵襲的であり、シフトゲートでのボトルネックとなり、回避も容易です。その結果は運用上の盲点です。高リスク状態こそ、継続的に捕捉するのが最も難しいのです。

音声はこのギャップを解消する理想的なシグナルです。作業員はシフト中、自然にプッシュトゥトーク無線、インターホン、音声インターフェースを使用します。アルコールは音響生体力学を一貫して変化させます。調音速度、発声タイミング、韻律、スペクトル音質を損ないます。これらは、専門モデルが数秒の音声から抽出するバイオマーカーです。

SafeVoiceは2つの補完的なアーキテクチャで展開されます。

SafeVoice-Refは、リアルタイムの音声を作業員の登録された素面のベースラインと比較します — シフト開始時のアクセススクリーニングに最適です。

SafeVoice-Soloは、登録されたベースラインなしでゼロショットで動作し、シフト中の通常の無線通信中に単一の発話バーストを評価します。

ドイツ語アルコール言語コーパス(標準的な公開ベンチマーク)の保持されたテスト分割を、非加重平均再現率(UAR)でスコアリング。先行研究との比較では、ウィンドウごとの指標(発話ごとに単一の決定、投票なし)を使用しています。先行研究は投票しないためです。

当社が構築したもの

話者相対差分エンコーディング

音声を単独で分類するのではなく、SafeVoice-Refは個人のベースラインプロファイルに対して発話をベンチマークします。話者間の音響分散を排除することで、非加重平均再現率(UAR)が即座に約5ポイント向上します — 当社の最も影響力のあるアーキテクチャ上のマイルストーンです。

デュアルモデルアーキテクチャ、統合特徴スタック

RefとSoloはどちらも同じ低レベル音響表現を活用します。SafeVoice-Refは迅速な一度きりの登録で精度を最大化し、SafeVoice-Soloは運用上の摩擦をゼロにすることを優先し、履歴データなしでどの話者も即座にスクリーニングします。

フルバックボーン適応

標準的な慣行では、小規模コーパスでは事前学習済みバックボーンを凍結することが推奨されます。当社の経験的スイープはその逆を証明しました。スクリーニング精度はファインチューニングの深さに応じて向上し、部分的な層凍結と比較して、完全なエンドツーエンドのバックボーン適応では約7ポイント向上しました。

マルチスケール特徴集約

音響バイオマーカーは異なる時間解像度で存在します。低いバックボーン層は微細な調音と声道ダイナミクスを保持し、高い層は韻律の流れとフレージングのリズムをモデル化します。マルチレベル融合と注意プーリングが、最も診断的なフレームを動的に重み付けします。

重工業ノイズカリキュラム

合成ホワイトノイズを避け、重機、車両の轟音、周囲の群衆のざわめき、構造的残響など、広範な産業用オーディオカリキュラムを採用しました。これにより、クリーンなベースライン精度を損なうことなく、過酷なフィールド条件での性能ギャップを埋めました。

マルチウィンドウコンセンサスデコーディング

一時的なスパイクや咳払いが誤警報を引き起こすのを防ぐため、推論パイプラインは発話ごとに複数の重複する分析ウィンドウをスコアリングします。コンセンサス投票を適用することで、UARが1〜2ポイント向上し、実際の音響スパイクに対して検知が非常に堅牢になります。

測定結果

音響条件による劣化

コンセンサスUAR(MV@5)、参照ベース / 参照フリー。精度が低下する条件を含めて公開。

システムのできること、できないこと

SafeVoiceは血中アルコール濃度を測定するものではなく、作業者を業務から外す根拠として使用することはできません。これは、既存の手段による確認のために対応が必要な人物を示す一次スクリーニングツールです。関連する比較対象は飲酒検知器ではなく、現在使用されている代替手段である監督者の目視観察です。その精度は訓練を受けていない聴取とほぼ同程度です。

すべての結果は1つのコーパス — 162名の話者から録音され、話者ごとの血中および呼気アルコールの正解データを持つGerman Alcohol Language Corpus — に基づいています。これは本タスクのリファレンスベンチマークですが、単一のコーパスであり、上記のすべての比較はそのホールドアウトテスト分割で行われています。

精度が低下する条件を主要数値と併せて公開し、棄却した内容も公開しています:補助的な感情および血中アルコール回帰ヘッド(負の効果)、部分的なバックボーン凍結(約7ポイント低下)、判定閾値の調整(0.2ポイントの改善に過ぎない対症療法)、および参照不要モデルへの話者埋め込み条件付け — 0.6ポイントの真の改善ですが、ユーザーごとの登録が必要となりSoloのゼロフリクションの利点が失われるため棄却しました。

使用方法

シフト開始時の適合性確認:登録済みベースラインに対する短い音声サインイン

日常的な無線通信を対象とした継続的パッシブモニタリング(登録不要)

適切な監督者にルーティングされる較正済みフラグ(人間による判断のため)

CPU上で動作し、分析ウィンドウあたり1秒未満のレイテンシ

人口統計的コンテキストが利用できない場合でも緩やかに劣化

XENOMプラットフォームを通じてサイトの他の運用信号と併せて表示