SafeVoice — un motor propietario de inteligencia del habla que marca el probable deterioro por alcohol con solo unos segundos de habla ordinaria. No invasivo, cero hardware especializado, sin necesidad de nada más que una frase hablada.
El personal con deterioro sigue siendo un factor principal y poco instrumentado de incidentes industriales prevenibles. El alcohol degrada la velocidad de reacción, el juicio espacial y el control motor fino mucho antes de que los síntomas sean visualmente evidentes. Los controles tradicionales — alcoholímetros periódicos y verificaciones visuales del supervisor — son intermitentes, invasivos, cuellos de botella en las puertas de turno y fáciles de evadir. El resultado es un punto ciego operativo: los estados de alto riesgo siguen siendo los más difíciles de interceptar continuamente.
La voz es la señal ideal para eliminar esta brecha. Los trabajadores usan naturalmente radios Push-to-Talk, acceden a intercomunicadores e interfaces de voz durante todo su turno. El alcohol altera consistentemente la biomecánica acústica — deteriorando la velocidad de articulación, la temporización de la fonación, la prosodia y la calidad espectral de la voz — biomarcadores que un modelo especializado extrae de segundos de audio.
SafeVoice se despliega en dos arquitecturas complementarias.
SafeVoice-Ref compara la voz en tiempo real contra la línea base sobria registrada del trabajador — ideal para la detección de acceso al inicio del turno.
SafeVoice-Solo opera sin línea base registrada, evaluando ráfagas de habla únicas durante las comunicaciones de radio rutinarias a lo largo del turno.
División de prueba retenida del corpus de lenguaje alemán sobre alcohol, el benchmark público estándar, puntuado por recuperación promedio no ponderada (UAR). Las comparaciones con el estado del arte anterior usan la métrica por ventana — una única decisión por enunciado, sin votación — porque el estado del arte anterior no vota.
En lugar de clasificar el audio de forma aislada, SafeVoice-Ref compara el habla con el perfil de línea base del individuo. Eliminar la varianza acústica entre hablantes produce una ganancia inmediata de ~5 puntos en la recuperación promedio no ponderada (UAR) — nuestro hito arquitectónico de mayor impacto.
Tanto Ref como Solo aprovechan las mismas representaciones acústicas de bajo nivel. SafeVoice-Ref maximiza la precisión mediante una inscripción única rápida, mientras que SafeVoice-Solo prioriza la fricción operativa cero, evaluando a cualquier hablante de inmediato sin datos históricos.
La práctica estándar sugiere congelar los backbones preentrenados en corpus pequeños. Nuestros barridos empíricos demostraron lo contrario: la precisión de detección escaló con la profundidad del ajuste fino, saltando ~7 puntos bajo adaptación completa del backbone de extremo a extremo en comparación con el congelamiento parcial de capas.
Los biomarcadores acústicos existen en distintas resoluciones temporales. Las capas inferiores del backbone retienen dinámicas finas de articulación y tracto vocal, mientras que las capas superiores modelan el flujo prosódico y el ritmo de frases. La fusión multinivel seguida de agrupación atenta pondera dinámicamente los fotogramas más diagnósticos.
Evitamos el ruido blanco sintético en favor de currículos extensos de audio industrial — maquinaria pesada, estruendo de vehículos, murmullo ambiental de multitudes y reverberación estructural. Esto cerró la brecha de rendimiento en condiciones de campo duras sin degradar la precisión de línea base en entornos limpios.
Para evitar que picos transitorios o carraspeos activen falsas alarmas, el flujo de inferencia puntúa múltiples ventanas de análisis solapadas por enunciado. Aplicar votación por consenso agrega 1–2 puntos de UAR y hace que la detección sea excepcionalmente resiliente a picos acústicos del mundo real.
UAR por consenso (MV@5), basado en referencia / sin referencia. Publicado incluyendo las condiciones donde la precisión cae.
SafeVoice no mide la concentración de alcohol en sangre y no puede servir como base para retirar a un trabajador de su puesto. Es una herramienta de cribado de primera línea que indica quién merece atención, para su verificación por medios establecidos. La comparación relevante no es con un alcoholímetro sino con la alternativa en uso hoy en día: la observación del supervisor, que rinde aproximadamente al nivel de una escucha no entrenada.
Todos los resultados provienen de un único corpus: el German Alcohol Language Corpus, grabado de 162 hablantes con valores reales de alcohol en sangre y aliento por hablante. Es el punto de referencia para esta tarea, pero es un único corpus, y cada comparación anterior se realiza sobre su partición de prueba reservada.
Publicamos las condiciones donde la precisión se degrada junto con las cifras principales, y publicamos lo que rechazamos: cabezales auxiliares de emoción y regresión de alcohol en sangre (efecto negativo), congelación parcial del backbone (unos siete puntos peor), ajuste del umbral de decisión (una solución sintomática que vale 0,2 puntos) y condicionamiento de incrustaciones de hablante para el modelo sin referencia: una ganancia genuina de 0,6 puntos, descartada porque habría requerido inscripción por usuario y destruido la ventaja de fricción cero de Solo.
Control de aptitud para el servicio al inicio del turno: un breve registro de voz hablado contra una línea base inscrita
Monitoreo pasivo continuo sobre el tráfico de radio rutinario, sin inscripción
Una alerta calibrada dirigida al supervisor correspondiente para una decisión humana
Funciona en CPU con menos de un segundo de latencia por ventana de análisis
Se degrada con elegancia cuando el contexto demográfico no está disponible
Se muestra a través de la plataforma XENOM junto con las demás señales operativas del sitio