Акустична детекција оштећености из говорне пријаве

SafeVoice — власнички мотор говорне интелигенције који означава вероватну алкохолну оштећеност из само неколико секунди обичног говора. Неинвазиван, без специјализованог хардвера, не захтева ништа више од изговорене фразе.

Оштећено особље остаје водећи и недовољно инструментализован узрок спречивих индустријских инцидената. Алкохол деградира брзину реакције, просторно расуђивање и фину моторичку контролу дуго пре него што симптоми постану визуелно уочљиви. Традиционалне контроле — периодични алкотестови и визуелне провере надзорника — су повремене, инвазивне, уска грла на капијама смена и лако их је заобићи. Резултат је оперативна слепа тачка: високоризична стања остају најтежа за континуирано пресретање.

Глас је идеалан сигнал за елиминисање овог јаза. Радници природно користе Push-to-Talk радио уређаје, приступају интерфонима и гласовним интерфејсима током целе смене. Алкохол конзистентно мења акустичну биомеханику — оштећујући брзину артикулације, тајминг фонације, прозодију и спектрални квалитет гласа — биомаркере које специјализовани модел извлачи из секунди аудио записа.

SafeVoice се примењује у две комплементарне архитектуре.

SafeVoice-Ref упоређује глас у реалном времену са уписаним трезвеним основним профилом радника — идеално за проверу приступа на почетку смене.

SafeVoice-Solo ради без икаквог уписаног профила, процењујући појединачне говорне сегменте током рутинских радио комуникација током смене.

Издвојени тестни део Немачког корпуса алкохолног језика, стандардног јавног бенчмарка, оцењен по unweighted average recall (UAR). Поређења са претходним радовима користе метрику по прозору — једна одлука по исказу, без гласања — јер претходни радови не гласају.

Шта смо изградили

Диференцијално кодирање релативно према говорнику

Уместо класификације аудио записа изоловано, SafeVoice-Ref упоређује говор са индивидуалним основним профилом. Елиминисање акустичне варијансе између говорника доноси тренутни добитак од ~5 поена у Unweighted Average Recall (UAR) — наша најутицајнија архитектонска прекретница.

Две моделске архитектуре, јединствени слој обележја

И Ref и Solo користе исте нискe акустичне репрезентације. SafeVoice-Ref максимизује прецизност кроз брзо једнократно уписовање, док SafeVoice-Solo даје предност нултом оперативном трењу, проверавајући било ког говорника одмах без историјских података.

Пуна адаптација основног модела

Стандардна пракса предлаже замрзавање претходно обучених основних модела на малим корпусима. Наше емпиријске анализе су доказале супротно: тачност провере расте са дубином финог подешавања, скачући ~7 поена при пуној енд-ту-енд адаптацији основног модела у поређењу са делимичним замрзавањем слојева.

Агрегација обележја на више скала

Акустични биомаркери постоје на различитим временским резолуцијама. Нижи слојеви основног модела задржавају фину артикулациону динамику и динамику вокалног тракта, док виши слојеви моделују прозодијски ток и ритам фразирања. Фузија на више нивоа праћена пажљивим обједињавањем динамички пондерише најдијагностичкије оквире.

Наставни планови са тешком индустријском буком

Заобишли смо синтетички бели шум у корист обимних индустријских аудио наставних планова — тешке машине, тутњава возила, амбијентални жамор гомиле и структурна реверберација. Ово је затворило јаз у перформансама у тешким теренским условима без деградације тачности на чистом основном нивоу.

Декодирање консензусом на више прозора

Да би се спречило да пролазни скокови или прочишћавање грла покрену лажне аларме, цевовод закључивања оцењује више преклапајућих прозора анализе по исказу. Примена консензусног гласања додаје 1–2 поена UAR-а и чини детекцију изузетно отпорном на стварне акустичне скокове.

Измерени резултати

Деградација у различитим акустичним условима

Консензус UAR (MV@5), са референцом / без референце. Објављено укључујући услове у којима тачност опада.

Шта систем јесте — а шта није

SafeVoice не мери концентрацију алкохола у крви и не може послужити као основ за удаљавање радника са дужности. То је алат за скрининг прве линије који указује на то коме је потребна пажња, ради провере утврђеним средствима. Релевантно поређење није са алкотестом, већ са алтернативом која се данас користи: надзорним посматрањем, које функционише отприлике на нивоу неувежбаног слушања.

Сви резултати потичу из једног корпуса — Немачки алкохолни језички корпус, снимљен од 162 говорника са појединачном основном истином концентрације алкохола у крви и даху. То је референтни бенчмарк за овај задатак, али то је један корпус, и свако поређење изнад је направљено на његовом издвојеном тестном делу.

Објављујемо услове у којима тачност опада заједно са главним бројевима, и објављујемо оно што смо одбацили: помоћне главе за емоције и регресију алкохола у крви (негативан ефекат), делимично замрзавање основе (око седам поена лошије), подешавање прага одлуке (симптоматска поправка вредна 0,2 поена) и условљавање уграђивањем говорника за модел без референце — стварни добитак од 0,6 поена, одбачен јер би захтевао упис по кориснику и уништио предност нултог трења производа Solo.

Како се користи

Провера способности за рад на почетку смене: кратка говорна пријава у односу на уписану основу

Континуирано пасивно праћење рутинског радио саобраћаја, без уписа

Калибрисано упозорење прослеђено одговарајућем надзорнику ради људске одлуке

Ради на CPU-у са мање од једне секунде кашњења по прозору анализе

Деградира постепено када демографски контекст није доступан

Приказано кроз XENOM платформу заједно са другим оперативним сигналима локације