Акустично откриване на нарушение от говорен чек-ин

SafeVoice — патентован двигател за речева интелигентност, който маркира вероятно алкохолно нарушение само от няколко секунди обикновена реч. Неинвазивен, без специализиран хардуер, изискващ само изговорена фраза.

Нарушеният персонал остава водещ и недостатъчно инструментиран двигател на предотвратими индустриални инциденти. Алкохолът влошава скоростта на реакция, пространствената преценка и фината моторика дълго преди симптомите да станат визуално очевидни. Традиционните контроли — периодични дрегери и визуални проверки на ръководителя — са прекъсващи, инвазивни, затруднения на порталите на смените и лесни за заобикаляне. Резултатът е оперативно сляпо петно: високорисковите състояния остават най-трудни за непрекъснато прихващане.

Гласът е идеалният сигнал за премахване на тази празнина. Работниците естествено използват Push-to-Talk радиостанции, достъпват домофони и гласови интерфейси през цялата си смяна. Алкохолът последователно променя акустичната биомеханика — нарушавайки скоростта на артикулация, времето на фонация, прозодията и спектралното качество на гласа — биомаркери, които специализиран модел извлича от секунди аудио.

SafeVoice се внедрява в две допълващи се архитектури.

SafeVoice-Ref сравнява гласа в реално време спрямо записания трезвен базов профил на работника — идеален за скрининг на достъпа при започване на смяна.

SafeVoice-Solo работи с нулева настройка без записан базов профил, оценявайки единични речеви изблици по време на рутинни радио комуникации през смяната.

Задържан тестов сплит на German Alcohol Language Corpus, стандартният публичен бенчмарк, оценен по unweighted average recall (UAR). Сравненията с предишното изкуство използват метриката per-window — едно решение на изказване, без гласуване — защото предишното изкуство не гласува.

Какво създадохме

Относително диференциално кодиране спрямо говорещия

Вместо да класифицира аудиото изолирано, SafeVoice-Ref сравнява речта спрямо индивидуалния базов профил. Елиминирането на междуговорителната акустична вариация дава незабавно подобрение от ~5 точки в Unweighted Average Recall (UAR) — нашият най-значим архитектурен етап.

Двойни моделни архитектури, единен стек от характеристики

И Ref, и Solo използват същите нисконивови акустични представяния. SafeVoice-Ref максимизира прецизността чрез бързо еднократно записване, докато SafeVoice-Solo приоритизира нулево оперативно триене, скринирайки всеки говорещ незабавно без исторически данни.

Пълна адаптация на гръбнака

Стандартната практика предлага замразяване на предварително обучени гръбнаци върху малки корпуси. Нашите емпирични проучвания доказаха обратното: точността на скрининга се увеличаваше с дълбочината на фина настройка, скачайки ~7 точки при пълна end-to-end адаптация на гръбнака в сравнение с частично замразени слоеве.

Много-мащабно агрегиране на характеристики

Акустичните биомаркери съществуват при различни времеви разделителни способности. По-ниските слоеве на гръбнака запазват фината артикулационна и гласова динамика, докато по-високите слоеве моделират прозодичния поток и ритъма на фразите. Многостепенното сливане, последвано от внимателно обединяване, динамично претегля най-диагностичните кадри.

Учебни програми за тежък индустриален шум

Заобиколихме синтетичния бял шум в полза на обширни индустриални аудио програми — тежки машини, тътен на превозни средства, околен шум от тълпа и структурна реверберация. Това затвори разликата в производителността при тежки полеви условия, без да влошава чистата базова точност.

Декодиране с консенсус от множество прозорци

За да предотвратим преходни пикове или прочистване на гърлото да предизвикват фалшиви аларми, тръбопроводът за изводи оценява множество припокриващи се прозорци за анализ на изказване. Прилагането на консенсусно гласуване добавя 1–2 точки UAR и прави откриването изключително устойчиво на реални акустични пикове.

Измерени резултати

Влошаване при различни акустични условия

Консенсус UAR (MV@5), базиран на референция / свободен от референция. Публикувано включително условията, при които точността пада.

Какво е системата — и какво не е

SafeVoice не измерва концентрацията на алкохол в кръвта и не може да служи като основание за отстраняване на работник от дежурство. Това е първостепенен скринингов инструмент, който показва кой изисква внимание, за проверка чрез утвърдени средства. Относителното сравнение не е с дрегер, а с алтернативата, използвана днес: наблюдение от ръководител, което се представя приблизително на нивото на необучено слушане.

Всички резултати идват от един корпус — German Alcohol Language Corpus, записан от 162 говорители с истинска стойност на алкохол в кръвта и дъха за всеки говорител. Това е референтният бенчмарк за тази задача, но е единствен корпус и всяко сравнение по-горе е направено върху неговия задържан тестов сплит.

Публикуваме условията, при които точността се влошава, заедно с основните показатели, и публикуваме това, което сме отхвърлили: спомагателни глави за емоция и регресия на алкохол в кръвта (отрицателен ефект), частично замразяване на гръбнака (около седем точки по-лошо), настройка на прага на решение (симптоматично подобрение от 0.2 точки) и кондициониране на вграждания на говорителя за модела без референция — реално подобрение от 0.6 точки, отхвърлено, защото би изисквало регистрация на всеки потребител и би унищожило предимството на Solo без триене.

Как се използва

Проверка за годност за дежурство в началото на смяната: кратък гласов отчет срещу регистриран базов профил

Непрекъснато пасивно наблюдение по рутинен радиотрафик, без регистрация

Калибриран сигнал, насочен към съответния ръководител за човешко решение

Работи на CPU с под една секунда латентност за прозорец на анализ

Деградира плавно, когато демографският контекст е недостъпен

Извежда се чрез платформата XENOM заедно с другите оперативни сигнали на обекта