Acoustic Impairment Detection mula sa Isang Binibigkas na Check-In

SafeVoice — isang proprietary speech-intelligence engine na tumutukoy ng posibleng alcohol impairment mula sa ilang segundo lamang ng ordinaryong pananalita. Hindi invasive, zero specialized hardware, nangangailangan ng wala nang higit pa sa isang binibigkas na parirala.

Ang mga tauhang may impairment ay nananatiling isang nangunguna at hindi gaanong nasusukat na dahilan ng mga maiiwasang insidente sa industriya. Pinapababa ng alkohol ang bilis ng reaksyon, spatial na paghuhusga, at pinong kontrol sa motor bago pa maging halata ang mga sintomas. Ang mga tradisyonal na kontrol — pana-panahong breathalyzer at biswal na pagsusuri ng supervisor — ay paulit-ulit, invasive, mga bottleneck sa mga gate ng shift, at madaling iwasan. Ang resulta ay isang operational blind spot: ang mga high-risk na estado ay nananatiling pinakamahirap na harangin nang tuloy-tuloy.

Ang boses ang perpektong signal upang alisin ang puwang na ito. Natural na gumagamit ang mga manggagawa ng Push-to-Talk na radyo, mga access intercom, at mga voice interface sa kanilang shift. Patuloy na binabago ng alkohol ang acoustic biomechanics — pinahihina ang bilis ng artikulasyon, timing ng phonation, prosody, at spectral na kalidad ng boses — mga biomarker na kinukuha ng isang espesyal na modelo mula sa mga segundo ng audio.

Ang SafeVoice ay nagde-deploy sa dalawang komplementaryong arkitektura.

Ang SafeVoice-Ref ay nagkukumpara ng real-time na boses laban sa naka-enroll na matino na baseline ng manggagawa — perpekto para sa screening ng access sa simula ng shift.

Ang SafeVoice-Solo ay gumagana nang zero-shot na walang naka-enroll na baseline, tinatasa ang mga solong pagsabog ng pananalita sa mga karaniwang komunikasyon sa radyo sa buong shift.

Held-out na test split ng German Alcohol Language Corpus, ang karaniwang pampublikong benchmark, na minarkahan ng unweighted average recall (UAR). Ang mga paghahambing sa naunang sining ay gumagamit ng per-window metric — isang solong desisyon bawat pagbigkas, walang botohan — dahil ang naunang sining ay hindi bumoboto.

Ano ang Aming Binuo

Speaker-Relative Differential Encoding

Sa halip na uriin ang audio nang nakahiwalay, ibine-benchmark ng SafeVoice-Ref ang pananalita laban sa baseline profile ng indibidwal. Ang pag-aalis ng inter-speaker na acoustic variance ay nagbubunga ng agarang ~5-puntong pagtaas sa Unweighted Average Recall (UAR) — ang aming pinakamahalagang milestone sa arkitektura.

Dalawang Modelong Arkitektura, Pinag-isang Feature Stack

Parehong ginagamit ng Ref at Solo ang parehong low-level na acoustic representation. Pinapakinabangan ng SafeVoice-Ref ang katumpakan sa pamamagitan ng mabilis na one-time enrollment, habang inuuna ng SafeVoice-Solo ang zero operational friction, sinusuri ang sinumang nagsasalita kaagad nang walang historikal na datos.

Buong Backbone Adaptation

Iminumungkahi ng karaniwang kasanayan na i-freeze ang mga pre-trained na backbone sa maliliit na korpora. Pinatunayan ng aming mga empirical sweep ang kabaligtaran: tumaas ang katumpakan ng screening sa lalim ng fine-tuning, tumalon ng ~7 puntos sa ilalim ng buong end-to-end na backbone adaptation kumpara sa bahagyang layer freezing.

Multi-Scale Feature Aggregation

Umiiral ang mga acoustic biomarker sa mga natatanging temporal na resolusyon. Ang mga mas mababang layer ng backbone ay nagpapanatili ng pinong articulatory at vocal tract dynamics, habang ang mga mas mataas na layer ay nagmomodelo ng prosodic flow at ritmo ng pagbigkas. Ang multi-level fusion na sinusundan ng attentive pooling ay dynamic na nagtitimbang sa mga pinaka-diagnostic na frame.

Heavy Industrial Noise Curricula

Nilampasan namin ang sintetikong white noise pabor sa malawak na kurikulum ng audio sa industriya — mabibigat na makinarya, dagundong ng sasakyan, ambient na ingay ng karamihan, at structural reverberation. Isinara nito ang agwat sa pagganap sa malupit na mga kondisyon sa field nang hindi pinapababa ang malinis na baseline na katumpakan.

Multi-Window Consensus Decoding

Upang maiwasan ang mga pansamantalang spike o paglilinis ng lalamunan mula sa pag-trigger ng mga maling alarma, ang inference pipeline ay nagbibigay ng marka sa maraming magkakapatong na window ng pagsusuri bawat pagbigkas. Ang paglalapat ng consensus voting ay nagdaragdag ng 1–2 puntos ng UAR at ginagawang labis na matatag ang pagtuklas laban sa mga tunay na acoustic spike sa mundo.

Mga nasusukat na resulta

Pagbaba sa iba't ibang kondisyon ng acoustic

Consensus UAR (MV@5), batay-sa-sanggunian / walang sanggunian. Na-publish kasama ang mga kondisyon kung saan bumababa ang katumpakan.

Ano ang sistema — at hindi

Hindi sinusukat ng SafeVoice ang konsentrasyon ng alkohol sa dugo at hindi maaaring magsilbing batayan para alisin ang isang manggagawa sa tungkulin. Isa itong pangunang-screen na tool na tumutukoy kung sino ang nangangailangan ng atensyon, para sa beripikasyon sa pamamagitan ng mga itinakdang paraan. Ang kaugnay na paghahambing ay hindi sa breathalyzer kundi sa alternatibong ginagamit ngayon: ang pagmamasid ng superbisor, na gumaganap sa halos antas ng hindi sanay na pakikinig.

Lahat ng resulta ay mula sa isang corpus — ang German Alcohol Language Corpus, na naitala mula sa 162 tagapagsalita na may per-tagapagsalita na ground truth ng alkohol sa dugo at hininga. Ito ang reference benchmark para sa gawaing ito, ngunit isa lamang itong corpus, at bawat paghahambing sa itaas ay ginawa sa held-out test split nito.

Inilalathala namin ang mga kondisyon kung saan bumababa ang katumpakan kasama ng mga pangunahing numero, at inilalathala namin ang mga tinanggihan namin: auxiliary emotion at blood-alcohol-regression heads (negatibong epekto), partial backbone freezing (humigit-kumulang pitong puntos na mas mababa), decision-threshold tuning (isang pag-aayos ng sintomas na nagkakahalaga ng 0.2 puntos), at speaker-embedding conditioning para sa reference-free na modelo — isang tunay na 0.6-puntos na pakinabang, na itinapon dahil mangangailangan ito ng per-user enrollment at sisirain ang zero-friction na bentahe ng Solo.

Paano ito ginagamit

Pagsusuri ng fitness-for-duty sa simula ng shift: isang maikling pasalitang sign-in laban sa isang naka-enroll na baseline

Tuluy-tuloy na passive monitoring sa karaniwang trapiko sa radyo, nang walang enrollment

Isang naka-calibrate na babala na ipinapadala sa naaangkop na superbisor para sa desisyon ng tao

Gumagana sa CPU na may mas mababa sa isang segundong latency bawat window ng pagsusuri

Bumababa nang maayos kapag hindi available ang kontekstong demograpiko

Ipinapakita sa pamamagitan ng XENOM platform kasama ng iba pang mga operational signal ng site