Akustično zaznavanje opitosti iz govorjene prijave

SafeVoice — lastniški govorno-inteligenčni motor, ki zazna verjetno alkoholno opitost iz le nekaj sekund običajnega govora. Neinvazivno, brez specializirane strojne opreme, ne potrebuje ničesar drugega kot izgovorjeno frazo.

Opito osebje ostaja vodilni in premalo merjeni vzrok preprečljivih industrijskih incidentov. Alkohol zmanjša reakcijski čas, prostorsko presojo in fino motoriko že dolgo preden simptomi postanejo vizualno očitni. Tradicionalni nadzori — občasni alkotesti in vizualni pregledi nadzornikov — so prekinjajoči, invazivni, ozka grla pri vhodih v izmeno in jih je enostavno zaobiti. Rezultat je operativna slepa pega: stanja z visokim tveganjem je najtežje neprekinjeno prestreči.

Glas je idealen signal za odpravo te vrzeli. Delavci med izmeno naravno uporabljajo radijske postaje pritisni-in-govori, domofone in glasovne vmesnike. Alkohol dosledno spreminja akustično biomehaniko — poslabša hitrost artikulacije, čas fonacije, prozodijo in spektralno kakovost glasu — biomarkerje, ki jih specializirani model izlušči iz nekaj sekund zvoka.

SafeVoice se uvaja v dveh komplementarnih arhitekturah.

SafeVoice-Ref primerja glas v realnem času z vpisanim treznim izhodiščem delavca — idealno za presejanje pri vstopu v izmeno.

SafeVoice-Solo deluje brez vpisanega izhodišča in ocenjuje posamezne govorne izbruhe med rutinsko radijsko komunikacijo skozi celotno izmeno.

Zadržani testni razcep nemškega korpusa jezika alkohola, standardne javne merilne zbirke, ocenjen z neuteženim povprečnim priklicem (UAR). Primerjave s predhodnimi deli uporabljajo metriko na okno — ena odločitev na izjavo, brez glasovanja — ker predhodna dela ne glasujejo.

Kaj smo zgradili

Govorčevo-relativno diferencialno kodiranje

Namesto izolirane klasifikacije zvoka SafeVoice-Ref primerja govor z individualnim profilom izhodišča. Odprava medgovorske akustične variance prinese takojšen približno 5-točkovni dobiček v neuteženem povprečnem priklicu (UAR) — naš najpomembnejši arhitekturni mejnik.

Dvojne modelne arhitekture, enoten nabor značilk

Tako Ref kot Solo uporabljata iste nizkonivojske akustične predstavitve. SafeVoice-Ref maksimizira natančnost s hitrim enkratnim vpisom, SafeVoice-Solo pa daje prednost ničelnemu operativnemu trenju in preseja katerega koli govorca takoj, brez zgodovinskih podatkov.

Popolna prilagoditev hrbtenice

Standardna praksa predlaga zamrznitev vnaprej naučenih hrbtenic pri majhnih korpusih. Naša empirična preverjanja so dokazala nasprotno: natančnost presejanja je rasla z globino finega prilagajanja in poskočila za približno 7 točk pri popolni prilagoditvi hrbtenice od konca do konca v primerjavi z delnim zamrzovanjem plasti.

Večnivojsko združevanje značilk

Akustični biomarkerji obstajajo v različnih časovnih ločljivostih. Nižje plasti hrbtenice ohranjajo fine artikulacijske in vokalne dinamike trakta, višje plasti pa modelirajo prozodični tok in ritem fraziranja. Večnivojsko zlivanje, ki mu sledi pozorno združevanje, dinamično uteži najbolj diagnostične okvirje.

Učni načrti s težkim industrijskim šumom

Sintetični beli šum smo obšli v korist obsežnih industrijskih zvočnih učnih načrtov — težki stroji, ropotanje vozil, okoliški klepet množice in strukturni odmev. To je zaprlo vrzel v zmogljivosti v težkih terenskih pogojih, ne da bi poslabšalo čisto izhodiščno natančnost.

Soglasno dekodiranje z več okni

Da bi preprečili lažne alarme zaradi prehodnih konic ali kašljanja, cevovod sklepanja oceni več prekrivajočih se analiznih oken na izjavo. Uporaba soglasnega glasovanja doda 1–2 točki UAR in naredi zaznavanje izjemno odporno na resnične akustične konice.

Izmerjeni rezultati

Upad zmogljivosti v različnih akustičnih pogojih

Soglasni UAR (MV@5), na podlagi reference / brez reference. Objavljeno vključno s pogoji, kjer natančnost pade.

Kaj sistem je — in kaj ni

SafeVoice ne meri koncentracije alkohola v krvi in ne more služiti kot podlaga za odstranitev delavca z delovnega mesta. Je orodje za prvo linijo presejanja, ki pokaže, kdo potrebuje pozornost, za preverjanje z uveljavljenimi sredstvi. Ustrezna primerjava ni z alkotestom, temveč z alternativo, ki se uporablja danes: opazovanje nadzornika, ki deluje približno na ravni nepoučenega poslušanja.

Vsi rezultati izhajajo iz enega korpusa — German Alcohol Language Corpus, posnetega pri 162 govorcih z referenčno vrednostjo alkohola v krvi in izdihanem zraku za vsakega govorca. Je referenčno merilo za to nalogo, vendar je en sam korpus in vsaka zgornja primerjava je narejena na njegovem izločenem testnem razdelku.

Objavljamo pogoje, kjer se natančnost poslabša, skupaj z glavnimi številkami, in objavljamo tudi, kaj smo zavrnili: pomožne glave za čustva in regresijo alkohola v krvi (negativen učinek), delno zamrzovanje hrbtenice (približno sedem točk slabše), uravnavanje praga odločitve (popravek simptoma, vreden 0,2 točke) in pogojevanje z vdelavo govorca za model brez reference — pristen dobiček 0,6 točke, zavržen, ker bi zahteval vpis vsakega uporabnika in uničil prednost Solo brez trenja.

Kako se uporablja

Preverjanje sposobnosti za delo ob začetku izmene: kratka govorna prijava glede na vpisano osnovo

Neprekinjeno pasivno spremljanje rutinskega radijskega prometa, brez vpisa

Umerjeno opozorilo, posredovano ustreznemu nadzorniku za človeško odločitev

Deluje na CPE z manj kot eno sekundo zakasnitve na analizno okno

Ob padcu demografskega konteksta deluje manj natančno, a postopno

Prikazano prek platforme XENOM skupaj z drugimi operativnimi signali lokacije