SafeVoice — власний мовно-інтелектуальний рушій, що позначає ймовірне алкогольне сп'яніння з кількох секунд звичайного мовлення. Неінвазивний, без спеціалізованого обладнання, потребує лише вимовленої фрази.
Персонал з порушеним станом залишається провідним і недостатньо інструментованим чинником запобіжних промислових інцидентів. Алкоголь погіршує швидкість реакції, просторове судження та дрібну моторику задовго до того, як симптоми стають візуально помітними. Традиційні засоби контролю — періодичні алкотестери та візуальні перевірки керівниками — є переривчастими, інвазивними, вузькими місцями на вході в зміну та легко обходяться. Результат — операційна сліпа зона: стани високого ризику залишаються найважчими для безперервного перехоплення.
Голос — ідеальний сигнал для усунення цієї прогалини. Працівники природно користуються раціями Push-to-Talk, переговорними пристроями та голосовими інтерфейсами протягом зміни. Алкоголь стабільно змінює акустичну біомеханіку — погіршуючи швидкість артикуляції, таймінг фонації, просодію та спектральну якість голосу — біомаркери, які спеціалізована модель витягує з секунд аудіо.
SafeVoice розгортається у двох взаємодоповнювальних архітектурах.
SafeVoice-Ref порівнює голос у реальному часі з зареєстрованим тверезим базовим профілем працівника — ідеально для скринінгу доступу на початку зміни.
SafeVoice-Solo працює без навчання, без зареєстрованого базового профілю, оцінюючи окремі мовні фрагменти під час звичайного радіозв'язку протягом зміни.
Відкладений тестовий розділ Німецького алкогольного мовного корпусу, стандартного публічного бенчмарку, оцінений за зваженим середнім відкликом (UAR). Порівняння з попередніми роботами використовує метрику на вікно — одне рішення на висловлювання, без голосування — оскільки попередні роботи не голосують.
Замість класифікації аудіо ізольовано, SafeVoice-Ref порівнює мовлення з базовим профілем особи. Усунення міжмовної акустичної варіативності дає негайний приріст приблизно на 5 пунктів у зваженому середньому відклику (UAR) — наша найвагоміша архітектурна віха.
Обидві Ref і Solo використовують однакові низькорівневі акустичні представлення. SafeVoice-Ref максимізує точність через швидку одноразову реєстрацію, тоді як SafeVoice-Solo надає пріоритет нульовому операційному тертю, скринінгуючи будь-якого мовця негайно, без історичних даних.
Стандартна практика пропонує заморожувати попередньо навчені магістралі на малих корпусах. Наші емпіричні перебори довели протилежне: точність скринінгу зростала з глибиною тонкого налаштування, стрибаючи приблизно на 7 пунктів за повної наскрізної адаптації магістралі порівняно з частковим заморожуванням шарів.
Акустичні біомаркери існують на різних часових роздільностях. Нижчі шари магістралі зберігають тонку артикуляційну та голосову динаміку, тоді як вищі шари моделюють просодичний потік і ритм фразування. Багаторівневе злиття з подальшим уважним пулінгом динамічно зважує найбільш діагностичні кадри.
Ми оминули синтетичний білий шум на користь великих промислових аудіопрограм — важка техніка, гуркіт транспортних засобів, фоновий натовп і структурна реверберація. Це закрило розрив продуктивності в суворих польових умовах без погіршення базової точності в чистому середовищі.
Щоб запобігти транзієнтним сплескам або покашлюванням, які викликають хибні тривоги, конвеєр інференсу оцінює кілька перекривних вікон аналізу на висловлювання. Застосування консенсусного голосування додає 1–2 пункти UAR і робить виявлення винятково стійким до реальних акустичних сплесків.
Консенсусний UAR (MV@5), з базовим профілем / без базового профілю. Опубліковано включно з умовами, де точність падає.
SafeVoice не вимірює концентрацію алкоголю в крові та не може бути підставою для відсторонення працівника від роботи. Це інструмент первинного скринінгу, який вказує, хто потребує уваги, для подальшої перевірки встановленими методами. Порівнювати його слід не з алкотестером, а з альтернативою, що використовується сьогодні: спостереженням керівника, яке працює приблизно на рівні нетренованого слуху.
Усі результати отримано з одного корпусу — German Alcohol Language Corpus, записаного від 162 мовців із поспікерною еталонною істиною за вмістом алкоголю в крові та видиху. Це еталонний бенчмарк для цього завдання, але це єдиний корпус, і всі порівняння вище зроблено на його відкладеному тестовому розбитті.
Ми публікуємо умови, за яких точність знижується, разом із головними показниками, і публікуємо те, що відхилили: допоміжні голови емоцій та регресії алкоголю в крові (негативний ефект), часткове заморожування основи (приблизно на сім пунктів гірше), налаштування порога рішення (симптоматичне виправлення вартістю 0,2 пункту) та обумовлення ембедингами мовця для моделі без референсу — справжній приріст у 0,6 пункту, відхилений, оскільки він вимагав би індивідуальної реєстрації користувача та знищив би перевагу Solo в нульовому терті.
Перевірка придатності до роботи на початку зміни: короткий голосовий вхід проти зареєстрованого базового профілю
Безперервний пасивний моніторинг звичайного радіотрафіку без реєстрації
Калібрований сигнал, спрямований відповідному керівнику для прийняття людського рішення
Працює на CPU із затримкою менше однієї секунди на вікно аналізу
Плавно деградує, коли демографічний контекст недоступний
Відображається через платформу XENOM разом з іншими операційними сигналами майданчика