SafeVoice — собственный алгоритм речевой аналитики, выявляющий признаки алкогольного опьянения по нескольким секундам обычной речи. Без алкотестеров, очередей на проходной и специализированного оборудования — достаточно просто сказать фразу.
Сотрудники в состоянии опьянения — ключевая, но наименее контролируемая причина предотвратимых производственных аварий. Алкоголь притупляет реакцию, ухудшает координацию и оценку рисков задолго до появления явных визуальных признаков. Традиционные методы контроля — выборочные алкотестеры на КПП или визуальный осмотр мастером — эпизодичны, создают задержки и не защищают от инцидентов в течение смены. Возникает слепая зона: самые опасные риски сложнее всего зафиксировать в реальном времени.
Голос — идеальный канал для непрерывного мониторинга. Рабочие постоянно говорят по рации, интеркому или отмечаются на терминалах доступа. Алкоголь оставляет отчётливый акустический след: нарушает артикуляцию, ритмику, просодику и формантную структуру голоса — маркеры, которые обученная модель считывает за несколько секунд.
SafeVoice реализован в двух конфигурациях.
SafeVoice-Ref сравнивает текущую речь с индивидуальным «трезвым профилем» сотрудника — оптимально для утреннего предсменного контроля.
SafeVoice-Solo не требует профиля и анализирует любую отдельную реплику «с нуля» — оптимально для фонового скрининга радиопереговоров в течение смены.
Отложенная тестовая выборка немецкого корпуса Alcohol Language Corpus — стандартного публичного бенчмарка, — метрика UAR (невзвешенная средняя точность). Сравнение с предшественниками ведётся по per-window метрике: одно решение на реплику, без голосования, потому что предшественники не голосуют.
SafeVoice-Ref оценивает не запись саму по себе, а величину её отклонения от трезвого эталона конкретного человека. Это компенсирует индивидуальные особенности дикции и даёт прирост точности порядка 5 пунктов UAR — наш главный архитектурный фактор.
Версии Ref и Solo используют общий аудиопайплайн. Ref обеспечивает максимальную точность за счёт однократной регистрации профиля, а Solo обеспечивает нулевое сопротивление внедрению, анализируя голос любого нового рабочего без предварительной записи.
Стандартный подход рекомендует замораживать слои предобученных моделей на небольших выборках. Наши тесты показали обратное: точность устойчиво растёт по мере углубления дообучения, давая скачок до 7 пунктов при полной сквозной адаптации бэкбона.
Маркеры опьянения распределены по разным уровням звука: нижние слои нейросети улавливают микродинамику артикуляции и тембра, а верхние — просодику и интонационный ритм. Совместная обработка уровней с механизмом attentive pooling выделяет наиболее информативные кадры записи.
Вместо синтетического шума мы обучили модель на записях реальной производственной среды: цеховых агрегатов, гула тяжёлой техники, радиопомех и акустического эха. Это устранило разрыв в точности между лабораторией и реальным шумным объектом.
Система не принимает решение по одному случайному отрезку. На этапе инференса аудиопоток разбивается на несколько окон, а итоговый результат формируется голосованием большинства. Это добавляет 1–2 пункта UAR и защищает от ложных срабатываний из-за единичных помех или покашливания.
Консенсусная точность MV@5, с эталоном / без эталона. Публикуем вместе с теми условиями, где точность снижается.
SafeVoice не измеряет концентрацию алкоголя в крови и не может служить основанием для отстранения от работы. Это инструмент скрининга первой линии: он указывает, на кого стоит обратить внимание, с последующей проверкой установленными методами. Сравнивать его нужно не с алкотестером, а с тем, что применяется сегодня, — с наблюдением мастера, точность которого примерно на уровне неподготовленного слушателя.
Все результаты получены на одном корпусе — немецком Alcohol Language Corpus, записанном от 162 говорящих с измеренным содержанием алкоголя в крови и выдохе. Это эталонный бенчмарк для задачи, но это один корпус, и все приведённые сравнения сделаны на его отложенной тестовой выборке.
Мы публикуем условия, в которых точность падает, вместе с основными цифрами — и публикуем то, что отвергли: вспомогательные головы распознавания эмоций и регрессии уровня алкоголя (эффект отрицательный), частичную заморозку опорной модели (хуже примерно на семь пунктов), подбор порога решения (лечение симптома ценой 0,2 пункта) и обусловливание эмбеддингом говорящего для модели без эталона — реальный выигрыш в 0,6 пункта, от которого мы отказались, потому что он требовал регистрации каждого пользователя и уничтожал главное преимущество Solo — нулевое трение.
Проверка при заступлении на смену: короткая голосовая отметка против записанного эталона
Непрерывный пассивный контроль поверх обычного радиообмена, без регистрации эталона
Калиброванный сигнал направляется профильному руководителю для решения человеком
Работает на обычном процессоре, менее секунды на окно анализа
Корректно деградирует, когда демографический контекст недоступен
Выводится в платформе XENOM рядом с остальными оперативными сигналами объекта