I+D de XENOM logra el estado del arte en detección no invasiva de voz

El habla transmite más que palabras. La intoxicación por alcohol deja rastros medibles en la articulación, el tempo y la microvariación espectral, señales que el oído humano registra de manera poco confiable en el mejor de los casos.

El equipo de I+D de XENOM ha entrenado un modelo propietario de aprendizaje profundo para detectar estos biomarcadores acústicos y lo ha evaluado en el Alcohol Language Corpus, el punto de referencia público estándar para esta tarea.

Calificado estrictamente en igualdad de condiciones — promedio de recuperación no ponderado por ventana, una sola decisión por emisión sin votación, exactamente como se mide el trabajo previo — la configuración basada en referencia alcanza un 86.3% de UAR. La configuración sin referencia, que no requiere una línea base registrada y decide a partir de una sola muestra hablada, alcanza un 81.9%. En el punto operativo de despliegue, donde el sistema combina varias ventanas de una grabación en una decisión por consenso, estos valores aumentan al 87.6% y 82.5% respectivamente.

Para contextualizar: la línea base oficial del Interspeech 2011 Speaker-State Challenge en este corpus se sitúa en un 65.9% de UAR, los resultados del estado del arte publicados anteriormente alcanzan un máximo de aproximadamente 73–75%, y los oyentes humanos no entrenados obtienen alrededor del 60–65%.

El sistema funciona como una capa pasiva sobre el tráfico de radio rutinario. Los trabajadores hablan como siempre lo hacen; sin procedimientos adicionales, sin interrupción de la tarea, sin puntos de control separados.

Qué es el sistema — y qué no es. No mide la concentración de alcohol en sangre y no puede servir como base para retirar a un trabajador de sus funciones. Es una herramienta de detección de primera línea que indica quién merece atención, para su verificación por medios establecidos. La comparación relevante no es con un alcoholímetro, sino con la alternativa utilizada hoy: la observación del supervisor, que se desempeña aproximadamente al nivel de la escucha no entrenada.

Hemos publicado resultados completos en todas las condiciones acústicas — incluidas aquellas donde la precisión se degrada — junto con las advertencias de comparabilidad y las limitaciones conocidas del método.