SafeVoice — прапрыетарны рухавік маўленчага інтэлекту, які пазначае верагоднае алкагольнае ап'яненне па ўсяго некалькіх секундах звычайнага маўлення. Неінвазіўны, без спецыяльнага абсталявання, не патрабуе нічога большага за вымаўленую фразу.
Персанал у стане ап'янення застаецца адным з вядучых і недастаткова кантраляваных фактараў прадухільных прамысловых інцыдэнтаў. Алкаголь зніжае хуткасць рэакцыі, прасторавае меркаванне і дробную маторыку задоўга да таго, як сімптомы стануць візуальна прыкметнымі. Традыцыйныя сродкі кантролю — перыядычныя алкатэстары і візуальныя праверкі кіраўнікоў — маюць перарывісты характар, інвазіўныя, ствараюць заторы на прахадных і іх лёгка абыйсці. У выніку ўзнікае аперацыйная сляпая зона: станы высокай рызыкі застаюцца найцяжэйшымі для бесперапыннага перахопу.
Голас — ідэальны сігнал для ліквідацыі гэтага прабелу. Працоўныя натуральна выкарыстоўваюць Push-to-Talk-рацыі, дамафоны і галасавыя інтэрфейсы на працягу ўсёй змены. Алкаголь паслядоўна змяняе акустычную біямеханіку — пагаршаючы хуткасць артыкуляцыі, таймінг фанацыі, прасодыю і спектральную якасць голасу — біямаркеры, якія спецыялізаваная мадэль выцягвае з секунд аўдыё.
SafeVoice разгортваецца ў дзвюх узаемадапаўняльных архітэктурах.
SafeVoice-Ref параўноўвае голас у рэжыме рэальнага часу з зарэгістраваным цвярозым базавым профілем працоўнага — ідэальна для скрынінгу доступу на пачатку змены.
SafeVoice-Solo працуе без базавага профілю, ацэньваючы асобныя маўленчыя фрагменты падчас звычайных радыёкамунікацый на працягу змены.
Затрыманая тэставая выбарка з Нямецкага алкагольнага моўнага корпуса, стандартны публічны бенчмарк, ацэнены па неўзважанай сярэдняй паўнаце (UAR). Параўнанне з папярэднімі працамі выкарыстоўвае метрыку на акно — адно рашэнне на выказванне, без галасавання — таму што папярэднія працы не галасуюць.
Замест класіфікацыі аўдыё ізалявана, SafeVoice-Ref параўноўвае маўленне з базавым профілем чалавека. Ліквідацыя міждыктарскай акустычнай варыятыўнасці дае неадкладны прырост прыкладна на 5 пунктаў неўзважанай сярэдняй паўнаты (UAR) — наша найбольш уплывовая архітэктурная вяха.
Абедзве, Ref і Solo, выкарыстоўваюць адны і тыя ж нізкаўзроўневыя акустычныя прадстаўленні. SafeVoice-Ref максімізуе дакладнасць праз хуткую аднаразовую рэгістрацыю, у той час як SafeVoice-Solo аддае перавагу нулявому аперацыйнаму трэнню, правяраючы любога дыктара неадкладна без гістарычных даных.
Стандартная практыка прапануе замарожваць папярэдне навучаныя асновы на малых карпусах. Нашы эмпірычныя даследаванні даказалі адваротнае: дакладнасць скрынінгу расла з глыбінёй данавучання, павялічваючыся прыкладна на 7 пунктаў пры поўнай скразной адаптацыі асновы ў параўнанні з частковым замарожваннем слаёў.
Акустычныя біямаркеры існуюць на розных часавых раздзяленнях. Ніжнія слаі асновы захоўваюць тонкую дынаміку артыкуляцыі і галасавога тракту, у той час як верхнія слаі мадэлююць прасадычны паток і рытм фраз. Шматузроўневае зліццё з наступным уважлівым пулінгам дынамічна ўзважвае найбольш дыягнастычныя кадры.
Мы адмовіліся ад сінтэтычнага белага шуму на карысць шырокіх прамысловых аўдыёпраграм — цяжкая тэхніка, грукат транспарту, фонавы гоман натоўпу і структурная рэверберацыя. Гэта ліквідавала разрыў у прадукцыйнасці ў жорсткіх палявых умовах без пагаршэння дакладнасці на чыстым базавым узроўні.
Каб пераходныя ўсплёскі або кашаль не выклікалі ілжывых спрацоўванняў, канвеер інферэнцыі ацэньвае некалькі перакрыўных вокнаў аналізу на выказванне. Прымяненне кансэнсуснага галасавання дадае 1–2 пункты UAR і робіць выяўленне выключна ўстойлівым да рэальных акустычных усплёскаў.
Кансэнсусны UAR (MV@5), на аснове базавага профілю / без базавага профілю. Апублікавана ўключаючы ўмовы, дзе дакладнасць падае.
SafeVoice не вымярае канцэнтрацыю алкаголю ў крыві і не можа служыць падставай для адхілення работніка ад выканання абавязкаў. Гэта інструмент першаснага скрынінгу, які паказвае, хто заслугоўвае ўвагі, для праверкі ўстаноўленымі сродкамі. Адпаведнае параўнанне не з алкатэстарам, а з альтэрнатывай, якая выкарыстоўваецца сёння: назіранне кіраўніка, якое працуе прыкладна на ўзроўні ненавучанага слыху.
Усе вынікі паходзяць з аднаго корпуса — Нямецкага алкагольнага моўнага корпуса, запісанага ад 162 дыктараў з падыктарам-спецыфічнай асновай праўды па ўзроўні алкаголю ў крыві і дыханні. Гэта эталонны бенчмарк для гэтай задачы, але гэта адзін корпус, і кожнае параўнанне вышэй зроблена на яго адкладзеным тэставым падзеле.
Мы публікуем умовы, пры якіх дакладнасць зніжаецца, побач з асноўнымі лічбамі, і мы публікуем тое, што адхілілі: дапаможныя эмацыйныя і рэгрэсійныя галовы па алкаголю ў крыві (негатыўны эфект), частковае замарожванне асновы (прыкладна на сем пунктаў горш), наладжванне парога рашэння (фікс сімптому на 0,2 пункта) і кандыцыянаванне эмбедынгамі дыктара для мадэлі без асновы — сапраўдны прырост на 0,6 пункта, адхілены, бо гэта запатрабавала б рэгістрацыі кожнага карыстальніка і знішчыла б перавагу Solo з нулявым трэннем.
Праверка прыдатнасці да працы на пачатку змены: кароткі галасавы ўваход у сістэму ў параўнанні з зарэгістраванай асновай
Бесперапынны пасіўны маніторынг звычайнага радыётрафіку, без рэгістрацыі
Калібраваны сігнал, накіраваны адпаведнаму кіраўніку для прыняцця рашэння чалавекам
Працуе на CPU з затрымкай менш за адну секунду на акно аналізу
Дэградуе плаўна, калі дэмаграфічны кантэкст недаступны
Паказваецца праз платформу XENOM побач з іншымі аперацыйнымі сігналамі пляцоўкі