Akustyczne wykrywanie upojenia na podstawie wypowiedzianego zgłoszenia

SafeVoice — autorski silnik inteligencji mowy, który sygnalizuje prawdopodobne upojenie alkoholowe na podstawie zaledwie kilku sekund zwykłej mowy. Nieinwazyjny, bez specjalistycznego sprzętu, wymagający jedynie wypowiedzianej frazy.

Upojeni pracownicy pozostają głównym i niedostatecznie monitorowanym źródłem możliwych do uniknięcia incydentów przemysłowych. Alkohol pogarsza czas reakcji, ocenę przestrzenną i precyzję ruchów na długo przed tym, zanim objawy staną się widoczne. Tradycyjne kontrole — okresowe alkomaty i wzrokowe kontrole przełożonych — są sporadyczne, inwazyjne, stanowią wąskie gardło przy bramkach zmianowych i łatwo je ominąć. Rezultatem jest operacyjna martwa strefa: stany wysokiego ryzyka pozostają najtrudniejsze do ciągłego przechwycenia.

Głos jest idealnym sygnałem do wyeliminowania tej luki. Pracownicy naturalnie korzystają z radiotelefonów Push-to-Talk, domofonów i interfejsów głosowych przez całą zmianę. Alkohol konsekwentnie zmienia biomechanikę akustyczną — upośledzając prędkość artykulacji, czas fonacji, prozodię i jakość spektralną głosu — biomarkery, które wyspecjalizowany model wyodrębnia z sekund dźwięku.

SafeVoice działa w dwóch uzupełniających się architekturach.

SafeVoice-Ref porównuje głos w czasie rzeczywistym z zarejestrowanym trzeźwym profilem bazowym pracownika — idealny do kontroli dostępu na początku zmiany.

SafeVoice-Solo działa w trybie zero-shot bez zarejestrowanego profilu bazowego, oceniając pojedyncze fragmenty mowy podczas rutynowej łączności radiowej w trakcie zmiany.

Wyodrębniony zbiór testowy German Alcohol Language Corpus, standardowego publicznego benchmarku, oceniany za pomocą unweighted average recall (UAR). Porównania z wcześniejszymi pracami wykorzystują metrykę per-window — pojedyncza decyzja na wypowiedź, bez głosowania — ponieważ wcześniejsze prace nie głosują.

Co zbudowaliśmy

Kodowanie różnicowe względem mówcy

Zamiast klasyfikować dźwięk w izolacji, SafeVoice-Ref porównuje mowę z profilem bazowym danej osoby. Wyeliminowanie międzyosobniczej wariancji akustycznej daje natychmiastowy wzrost o około 5 punktów w Unweighted Average Recall (UAR) — nasz najbardziej znaczący kamień milowy architektoniczny.

Dwie architektury modeli, jeden zestaw cech

Zarówno Ref, jak i Solo wykorzystują te same niskopoziomowe reprezentacje akustyczne. SafeVoice-Ref maksymalizuje precyzję dzięki szybkiej jednorazowej rejestracji, podczas gdy SafeVoice-Solo priorytetyzuje zerowe tarcie operacyjne, badając dowolnego mówcę natychmiast, bez danych historycznych.

Pełna adaptacja szkieletu

Standardowa praktyka sugeruje zamrażanie wstępnie wytrenowanych szkieletów na małych korpusach. Nasze eksperymenty empiryczne dowiodły czegoś przeciwnego: dokładność badania rosła wraz z głębokością dostrajania, skacząc o około 7 punktów przy pełnej adaptacji szkieletu end-to-end w porównaniu z częściowym zamrażaniem warstw.

Wieloskalowa agregacja cech

Biomarkery akustyczne istnieją w różnych rozdzielczościach czasowych. Niższe warstwy szkieletu zachowują subtelną dynamikę artykulacyjną i traktu głosowego, podczas gdy wyższe warstwy modelują przepływ prozodyczny i rytm frazowania. Fuzja wielopoziomowa z uważnym pulowaniem dynamicznie waży najbardziej diagnostyczne ramki.

Kursy uczenia z ciężkim szumem przemysłowym

Pominęliśmy syntetyczny szum biały na rzecz obszernych korpusów dźwięków przemysłowych — ciężkich maszyn, warkotu pojazdów, gwaru otoczenia i pogłosu konstrukcyjnego. To zamknęło lukę wydajności w trudnych warunkach terenowych bez pogorszenia bazowej dokładności w czystym środowisku.

Dekodowanie konsensusowe z wieloma oknami

Aby zapobiec fałszywym alarmom powodowanym przez przejściowe skoki lub chrząknięcia, potok wnioskowania ocenia wiele nakładających się okien analizy na wypowiedź. Zastosowanie głosowania konsensusowego dodaje 1–2 punkty UAR i czyni detekcję wyjątkowo odporną na rzeczywiste skoki akustyczne.

Zmierzone wyniki

Spadek dokładności w różnych warunkach akustycznych

UAR konsensusowy (MV@5), oparty na referencji / bez referencji. Opublikowano łącznie z warunkami, w których dokładność spada.

Czym system jest — a czym nie jest

SafeVoice nie mierzy stężenia alkoholu we krwi i nie może stanowić podstawy do odsunięcia pracownika od obowiązków. Jest to narzędzie przesiewowe pierwszego rzutu, które wskazuje, kto wymaga uwagi, w celu weryfikacji ustalonymi metodami. Właściwym porównaniem nie jest alkomat, lecz stosowana dziś alternatywa: obserwacja przełożonego, która działa na poziomie zbliżonym do nieprzeszkolonego słuchania.

Wszystkie wyniki pochodzą z jednego korpusu — German Alcohol Language Corpus, nagranego od 162 mówców z indywidualnym stężeniem alkoholu we krwi i wydychanym powietrzu jako wzorcem odniesienia. Jest to referencyjny benchmark dla tego zadania, ale to pojedynczy korpus, a każde z powyższych porównań zostało wykonane na jego wydzielonym podzbiorze testowym.

Publikujemy warunki, w których dokładność spada, obok głównych wskaźników, oraz publikujemy to, co odrzuciliśmy: pomocnicze głowice emocji i regresji stężenia alkoholu we krwi (efekt negatywny), częściowe zamrożenie szkieletu modelu (o około siedem punktów gorzej), strojenie progu decyzyjnego (poprawka objawowa warta 0,2 punktu) oraz warunkowanie osadzeniami mówcy dla modelu bezreferencyjnego — realny zysk 0,6 punktu, odrzucony, ponieważ wymagałby rejestracji każdego użytkownika i zniszczył przewagę Solo polegającą na zerowej tarciowości.

Jak jest używane

Kontrola zdolności do pracy na początku zmiany: krótkie głosowe zalogowanie względem zapisanego wzorca

Ciągłe pasywne monitorowanie rutynowego ruchu radiowego, bez rejestracji

Skalibrowany alert kierowany do właściwego przełożonego w celu podjęcia decyzji przez człowieka

Działa na procesorze CPU z opóźnieniem poniżej jednej sekundy na okno analizy

Degraduje się stopniowo, gdy kontekst demograficzny jest niedostępny

Udostępniane przez platformę XENOM obok innych sygnałów operacyjnych obiektu