Akustinen päihtymyksen tunnistus puhutusta kuittauksesta

SafeVoice — oma puheälymoottori, joka merkitsee todennäköisen alkoholipäihtymyksen muutamasta sekunnista tavallista puhetta. Ei-invasiivinen, nolla erikoislaitteistoa, vaatii vain puhutun lauseen.

Päihtyneet työntekijät ovat edelleen johtava ja alimitoitettu ehkäistävissä olevien teollisuusonnettomuuksien aiheuttaja. Alkoholi heikentää reaktionopeutta, tilanhahmotuskykyä ja hienomotoriikkaa kauan ennen kuin oireet näkyvät ulospäin. Perinteiset keinot — määräaikaiset alkometrit ja esimiehen silmämääräiset tarkastukset — ovat jaksoittaisia, invasiivisia, pullonkauloja vuoroportilla ja helppoja kiertää. Tuloksena on operatiivinen sokea piste: korkean riskin tilat jäävät vaikeimmiksi havaita jatkuvasti.

Ääni on ihanteellinen signaali tämän aukon poistamiseen. Työntekijät käyttävät luonnostaan Push-to-Talk-radioita, sisäpuhelimia ja ääniliittymiä koko vuoron ajan. Alkoholi muuttaa johdonmukaisesti akustista biomekaniikkaa — heikentäen artikulaationopeutta, ääntöaikataulua, prosodiaa ja spektristä äänenlaatua — biomarkkereita, joita erikoistunut malli poimii sekuntien äänestä.

SafeVoice otetaan käyttöön kahdessa toisiaan täydentävässä arkkitehtuurissa.

SafeVoice-Ref vertaa reaaliaikaista ääntä työntekijän tallennettuun selvään perustasoon — ihanteellinen vuoron aloituksen pääsynseulontaan.

SafeVoice-Solo toimii zero-shot-tilassa ilman tallennettua perustasoa, arvioiden yksittäisiä puhejaksoja rutiininomaisen radioviestinnän aikana vuoron mittaan.

German Alcohol Language Corpus -aineiston pidätetty testiositus, standardi julkinen vertailuaineisto, pisteytetty painottamattomalla keskimääräisellä herkkyydellä (UAR). Vertailut aiempaan tutkimukseen käyttävät ikkunakohtaista metriikkaa — yksi päätös per lausuma, ei äänestystä — koska aiempi tutkimus ei äänestä.

Mitä rakensimme

Puhujakohtainen differentiaalinen koodaus

Sen sijaan, että ääni luokiteltaisiin eristyksissä, SafeVoice-Ref vertaa puhetta yksilön perustasoprofiiliin. Puhujien välisen akustisen varianssin eliminointi tuottaa välittömän noin 5 pisteen parannuksen painottamattomaan keskimääräiseen herkkyyteen (UAR) — merkittävin arkkitehtoninen virstanpylväämme.

Kaksoismalliarkkitehtuurit, yhtenäinen piirrepino

Sekä Ref että Solo hyödyntävät samoja matalan tason akustisia representaatioita. SafeVoice-Ref maksimoi tarkkuuden nopealla kertailmoittautumisella, kun taas SafeVoice-Solo priorisoi nollaa operatiivista kitkaa, seulomalla kenet tahansa puhujan välittömästi ilman historiatietoja.

Täysi runkoverkon mukauttaminen

Vakiokäytäntö ehdottaa esikoulutettujen runkoverkkojen jäädyttämistä pienillä aineistoilla. Empiiriset testauksemme osoittivat päinvastaista: seulontatarkkuus skaalautui hienosäädön syvyyden myötä, hypäten noin 7 pistettä täydellä päästä päähän -runkoverkon mukautuksella verrattuna osittaiseen kerrosten jäädyttämiseen.

Moniskaalainen piirteiden yhdistäminen

Akustiset biomarkkerit esiintyvät eri aikaskaaloilla. Alemmat runkoverkon kerrokset säilyttävät hienot artikulatoriset ja ääniväylän dynamiikat, kun taas ylemmät kerrokset mallintavat prosodista virtausta ja fraasirytmiä. Monitasoinen fuusio ja tarkkaavainen yhdistäminen painottavat dynaamisesti diagnostisimpia kehyksiä.

Raskaat teollisuusmelukurriklumit

Ohitimme synteettisen valkoisen kohinan laajojen teollisuusäänikurrikulumien hyväksi — raskaat koneet, ajoneuvojen jyrinä, ympäröivä väkijoukon puhe ja rakenteellinen kaiku. Tämä kuroi kiinni suorituskykyeron ankarissa kenttäolosuhteissa heikentämättä puhdasta perustarkkuutta.

Moni-ikkunainen konsensusdekoodaus

Estääkseen ohimenevien piikkien tai kurkun selvittämisen aiheuttamat väärät hälytykset, päättelyputki pisteyttää useita päällekkäisiä analyysi-ikkunoita per lausuma. Konsensusäänestyksen soveltaminen lisää 1–2 pistettä UAR:iin ja tekee tunnistuksesta poikkeuksellisen kestävän todellisia akustisia piikkejä vastaan.

Mitatut tulokset

Heikentyminen eri akustisissa olosuhteissa

Konsensus UAR (MV@5), vertailuun perustuva / vertailusta riippumaton. Julkaistu mukaan lukien olosuhteet, joissa tarkkuus laskee.

Mitä järjestelmä on — ja mitä se ei ole

SafeVoice ei mittaa veren alkoholipitoisuutta eikä voi toimia perusteena työntekijän poistamiselle tehtävistä. Se on ensivaiheen seulontatyökalu, joka osoittaa, kuka ansaitsee huomiota, varmennettavaksi vakiintunein menetelmin. Olennainen vertailu ei ole alkometriin vaan nykyisin käytössä olevaan vaihtoehtoon: esimiehen havainnointiin, joka suoriutuu suunnilleen kouluttamattoman kuuntelun tasolla.

Kaikki tulokset tulevat yhdestä korpuksesta — German Alcohol Language Corpus, joka on nauhoitettu 162 puhujalta ja jossa on puhujakohtainen veri- ja uloshengitysilman alkoholipitoisuuden perustotuus. Se on tämän tehtävän viitevertailu, mutta se on yksittäinen korpus, ja kaikki yllä olevat vertailut on tehty sen pidätetyllä testiosalla.

Julkaisemme olosuhteet, joissa tarkkuus heikkenee, otsikkolukujen rinnalla, ja julkaisemme sen, minkä hylkäsimme: aputunnepäät ja veren alkoholipitoisuuden regressiopäät (negatiivinen vaikutus), osittainen runkoverkon jäädytys (noin seitsemän pistettä huonompi), päätöskynnysten viritys (oireen korjaus, arvoltaan 0,2 pistettä) ja puhujaembedointi-ehdollistus referenssittömälle mallille — aito 0,6 pisteen parannus, joka hylättiin, koska se olisi vaatinut käyttäjäkohtaista rekisteröintiä ja tuhonnut Solon nollakitkaedun.

Miten sitä käytetään

Vuoron aloituksen työkuntoisuustarkastus: lyhyt puhuttu kirjautuminen rekisteröityä perustasoa vasten

Jatkuva passiivinen seuranta tavanomaisen radioliikenteen aikana, ilman rekisteröintiä

Kalibroitu hälytys ohjataan asianmukaiselle esimiehelle ihmisen tekemää päätöstä varten

Toimii suorittimella alle sekunnin viiveellä analyysi-ikkunaa kohden

Heikkenee hallitusti, kun demografista kontekstia ei ole saatavilla

Tuodaan esiin XENOM-alustan kautta yhdessä työmaan muiden operatiivisten signaalien kanssa