Raziskave in razvoj XENOM dosegajo najsodobnejšo raven pri neinvazivnem glasovnem presejanju

Govor nosi več kot besede. Alkoholna opitost pušča merljive sledi v artikulaciji, tempu in spektralnih mikro-variacijah — signalih, ki jih človeško uho v najboljšem primeru zazna nezanesljivo.

Raziskovalno-razvojna ekipa podjetja XENOM je usposobila lastniški model globokega učenja za zaznavanje teh akustičnih biomarkerjev in ga ovrednotila na korpusu Alcohol Language Corpus, standardnem javnem merilu za to nalogo.

Strogo enakovredno ocenjeno — neuteženo povprečje priklica po oknih, ena odločitev na izjavo brez glasovanja, natanko tako, kot se meri prejšnje delo — referenčna konfiguracija dosega 86,3 % UAR. Referenčno prosta konfiguracija, ki ne zahteva vpisanega izhodišča in se odloča iz enega samega govornega vzorca, dosega 81,9 %. Na operativni točki uvajanja, kjer sistem združi več oken posnetka v soglasno odločitev, se ti dvignejo na 87,6 % oziroma 82,5 %.

Za kontekst: uradno izhodišče Interspeech 2011 Speaker-State Challenge na tem korpusu znaša 65,9 % UAR, predhodno objavljeni najsodobnejši rezultati dosegajo približno 73–75 %, neusposobljeni človeški poslušalci pa dosegajo približno 60–65 %.

Sistem deluje kot pasivna plast nad običajnim radijskim prometom. Delavci govorijo tako kot vedno; brez dodatnega postopka, brez prekinitve naloge, brez ločene kontrolne točke.

Kaj sistem je — in kaj ni. Ne meri koncentracije alkohola v krvi in ne more biti podlaga za odstranitev delavca z dolžnosti. Je orodje za presejanje prve stopnje, ki pokaže, kdo zasluži pozornost, za preverjanje z uveljavljenimi sredstvi. Ustrezna primerjava ni z alkotestom, temveč z alternativo, ki se uporablja danes: opazovanjem nadzornika, ki deluje približno na ravni neusposobljenega poslušanja.

Objavili smo celotne rezultate v različnih akustičnih pogojih — vključno s tistimi, kjer se natančnost poslabša — skupaj z opozorili o primerljivosti in znanimi omejitvami metode.