R&D XENOM досягає найсучаснішого рівня в неінвазивному голосовому скринінгу

Мовлення несе більше, ніж слова. Алкогольне сп'яніння залишає вимірювані сліди в артикуляції, темпі та спектральних мікроваріаціях — сигнали, які людське вухо реєструє щонайбільше ненадійно.

Команда R&D XENOM навчила власну модель глибокого навчання виявляти ці акустичні біомаркери та оцінила її на Alcohol Language Corpus, стандартному публічному бенчмарку для цього завдання.

При строгому порівнянні «яблуко до яблука» — незважена середня повнота по вікнах, одне рішення на висловлювання без голосування, саме так, як вимірюється попередня робота — конфігурація з референсом досягає 86.3% UAR. Конфігурація без референсу, яка не потребує зареєстрованого базового рівня і ухвалює рішення з одного вимовленого зразка, досягає 81.9%. У робочій точці розгортання, де система об'єднує кілька вікон запису в консенсусне рішення, ці показники зростають до 87.6% та 82.5% відповідно.

Для контексту: офіційний базовий рівень Interspeech 2011 Speaker-State Challenge на цьому корпусі становить 65.9% UAR, раніше опубліковані найсучасніші результати досягають приблизно 73–75%, а нетреновані люди-слухачі показують близько 60–65%.

Система працює як пасивний шар поверх звичайного радіотрафіку. Працівники говорять так, як завжди; жодної додаткової процедури, жодного переривання завдання, жодного окремого контрольно-пропускного пункту.

Чим система є — і чим не є. Вона не вимірює концентрацію алкоголю в крові і не може бути підставою для відсторонення працівника від виконання обов'язків. Це інструмент скринінгу першої лінії, який вказує, хто потребує уваги, для подальшої перевірки встановленими методами. Правильне порівняння — не з алкотестером, а з альтернативою, що використовується сьогодні: спостереженням супервізора, яке працює приблизно на рівні нетренованого слухання.

Ми опублікували повні результати для різних акустичних умов — включно з тими, де точність погіршується — разом із застереженнями щодо порівнянності та відомими обмеженнями методу.