SafeVoice — 단 몇 초의 일반적인 음성만으로 알코올 장애 가능성을 표시하는 독자적인 음성 지능 엔진. 비침습적이며 특수 하드웨어가 전혀 필요 없고 음성 한 마디만 있으면 됩니다.
장애 상태의 인력은 예방 가능한 산업 사고의 주요하면서도 계측이 부족한 원인으로 남아 있습니다. 알코올은 증상이 시각적으로 명백해지기 훨씬 전에 반응 속도, 공간 판단, 미세 운동 제어를 저하시킵니다. 기존 통제(정기 음주 측정기와 감독자의 육안 점검)는 간헐적이고, 침습적이며, 근무조 게이트에서 병목이 되고, 회피하기 쉽습니다. 그 결과 고위험 상태를 지속적으로 차단하기 가장 어려운 운영 사각지대가 생깁니다.
음성은 이 격차를 없애기에 이상적인 신호입니다. 작업자들은 근무 내내 자연스럽게 Push-to-Talk 무전기, 인터콤, 음성 인터페이스를 사용합니다. 알코올은 음향 생체역학을 일관되게 변화시킵니다. 조음 속도, 발성 타이밍, 운율, 스펙트럼 음질이 손상되며, 이러한 생체지표를 전문 모델이 몇 초의 오디오에서 추출합니다.
SafeVoice는 두 가지 보완적 아키텍처로 배포됩니다.
SafeVoice-Ref는 실시간 음성을 작업자의 등록된 정상 기준과 비교합니다. 근무 시작 접근 선별에 이상적입니다.
SafeVoice-Solo는 등록된 기준 없이 제로샷으로 작동하여, 근무 중 일상적인 무선 통신에서 단일 음성 발화를 평가합니다.
표준 공개 벤치마크인 독일어 알코올 언어 코퍼스의 홀드아웃 테스트 분할, 비가중 평균 재현율(UAR)로 점수화. 선행 연구와의 비교는 창별 지표(발화당 단일 결정, 투표 없음)를 사용합니다. 선행 연구는 투표를 하지 않기 때문입니다.
오디오를 독립적으로 분류하는 대신 SafeVoice-Ref는 개인의 기준 프로필과 음성을 비교합니다. 화자 간 음향 분산을 제거하면 비가중 평균 재현율(UAR)이 즉시 약 5포인트 향상됩니다. 가장 영향력 있는 아키텍처 이정표입니다.
Ref와 Solo 모두 동일한 저수준 음향 표현을 활용합니다. SafeVoice-Ref는 신속한 일회성 등록으로 정밀도를 극대화하고, SafeVoice-Solo는 운영 마찰을 없애 과거 데이터 없이도 모든 화자를 즉시 선별합니다.
일반적인 관행은 작은 코퍼스에서 사전 훈련된 백본을 동결하는 것입니다. 우리의 실험적 스윕은 그 반대를 입증했습니다. 선별 정확도는 미세 조정 깊이에 따라 확장되었으며, 전체 엔드투엔드 백본 적응에서 부분 레이어 동결 대비 약 7포인트 상승했습니다.
음향 생체지표는 서로 다른 시간적 해상도에 존재합니다. 하위 백본 레이어는 미세한 조음 및 성도 역학을 유지하고, 상위 레이어는 운율 흐름과 구절 리듬을 모델링합니다. 다중 레벨 융합과 주의 풀링이 가장 진단적인 프레임에 동적으로 가중치를 부여합니다.
합성 백색 소음을 우회하고 광범위한 산업 오디오 커리큘럼(중장비, 차량 굉음, 주변 군중 소음, 구조적 잔향)을 채택했습니다. 이는 깨끗한 기준 정확도를 저하시키지 않으면서 열악한 현장 조건에서의 성능 격차를 해소했습니다.
일시적인 스파이크나 목 가다듬기가 오경보를 유발하지 않도록, 추론 파이프라인은 발화당 여러 개의 중첩 분석 창을 점수화합니다. 합의 투표를 적용하면 UAR이 1~2포인트 추가되고 실제 음향 스파이크에 대한 감지가 탁월하게 견고해집니다.
합의 UAR(MV@5), 기준 기반 / 기준 없음. 정확도가 떨어지는 조건을 포함하여 발표.
SafeVoice는 혈중 알코올 농도를 측정하지 않으며 근로자를 업무에서 배제하는 근거로 사용될 수 없습니다. 이는 검증된 수단을 통한 확인이 필요한 대상자를 가리키는 1차 선별 도구입니다. 관련 비교 대상은 음주 측정기가 아니라 오늘날 사용되는 대안, 즉 훈련받지 않은 청취 수준의 성능을 보이는 관리자 관찰입니다.
모든 결과는 하나의 코퍼스, 즉 화자별 혈중 및 호흡 알코올 기준값이 기록된 162명의 화자로부터 수집된 독일어 알코올 언어 코퍼스(German Alcohol Language Corpus)에서 나온 것입니다. 이는 본 작업의 참조 벤치마크이지만 단일 코퍼스이며, 위의 모든 비교는 이 코퍼스의 홀드아웃 테스트 분할에서 이루어졌습니다.
우리는 주요 수치와 함께 정확도가 저하되는 조건을 공개하고, 기각한 사항도 공개합니다. 보조 감정 및 혈중 알코올 회귀 헤드(부정적 효과), 부분 백본 고정(약 7포인트 저하), 결정 임계값 튜닝(0.2포인트 가치의 증상 완화책), 그리고 레퍼런스 프리 모델을 위한 화자 임베딩 컨디셔닝(실제 0.6포인트 향상이었으나 사용자별 등록이 필요해 Solo의 무마찰 이점을 훼손하므로 폐기)이 그것입니다.
교대 시작 전 적합성 확인: 등록된 기준선에 대한 짧은 음성 로그인
일상적인 무선 교신에 대한 등록 없이 이루어지는 지속적인 수동 모니터링
인간의 결정을 위해 적절한 관리자에게 전달되는 보정된 플래그
분석 창당 1초 미만의 지연 시간으로 CPU에서 실행
인구통계학적 컨텍스트를 사용할 수 없을 때 점진적으로 성능 저하
현장의 다른 운영 신호와 함께 XENOM 플랫폼을 통해 표시