Маўленне нясе больш, чым словы. Алкагольнае ап'яненне пакідае вымерныя сляды ў артыкуляцыі, тэмпе і спектральных мікраварыяцыях — сігналы, якія чалавечае вуха рэгіструе ў лепшым выпадку ненадзейна.
Каманда R&D XENOM навучыла ўласную мадэль глыбокага навучання для выяўлення гэтых акустычных біямаркераў і ацаніла яе на Alcohol Language Corpus, стандартным публічным бенчмарку для гэтай задачы.
Пры строга параўнальнай ацэнцы — неўзважанае сярэдняе значэнне паўнаты для кожнага акна, адно рашэнне на выказванне без галасавання, роўна так, як ацэньваюцца папярэднія працы — канфігурацыя з апорай на эталон дасягае 86.3% UAR. Канфігурацыя без апораў, якая не патрабуе зарэгістраванага базавага ўзору і прымае рашэнне з адзінага вымаўленага ўзору, дасягае 81.9%. Пры працоўнай кропцы разгортвання, дзе сістэма аб'ядноўвае некалькі вокнаў запісу ў кансэнсуснае рашэнне, гэтыя значэнні ўзрастаюць да 87.6% і 82.5% адпаведна.
Для кантэксту: афіцыйны базавы ўзровень Interspeech 2011 Speaker-State Challenge на гэтым корпусе складае 65.9% UAR, раней апублікаваныя вынікі сучаснага ўзроўню дасягаюць прыкладна 73–75%, а ненавучаныя людзі-слухачы паказваюць каля 60–65%.
Сістэма працуе як пасіўны пласт па-над звычайным радыётрафікам. Работнікі гавораць, як заўсёды; ніякай дадатковай працэдуры, ніякага перапынення задачы, ніякага асобнага кантрольнага пункта.
Што сістэма робіць — а чаго не робіць. Яна не вымярае канцэнтрацыю алкаголю ў крыві і не можа служыць падставай для адхілення работніка ад абавязкаў. Гэта інструмент першаснага скрынінгу, які паказвае, хто заслугоўвае ўвагі, для праверкі ўстаноўленымі сродкамі. Адпаведнае параўнанне не з алкатэстарам, а з альтэрнатывай, якая выкарыстоўваецца сёння: назіраннем супервайзера, якое працуе прыкладна на ўзроўні ненавучанага слухання.
Мы апублікавалі поўныя вынікі па акустычных умовах — уключаючы тыя, дзе дакладнасць пагаршаецца — разам з агаворкамі аб параўнальнасці і вядомымі абмежаваннямі метаду.