La R+D de XENOM assoleix l'estat de l'art en el cribratge de veu no invasiu

La parla porta més que paraules. La intoxicació per alcohol deixa rastres mesurables en l'articulació, el tempo i la microvariació espectral, senyals que l'oïda humana registra de manera poc fiable en el millor dels casos.

L'equip d'R+D de XENOM ha entrenat un model d'aprenentatge profund propietari per detectar aquests biomarcadors acústics i l'ha avaluat amb l'Alcohol Language Corpus, el referent públic estàndard per a aquesta tasca.

Puntuat estrictament d'igual a igual (recuperació mitjana no ponderada per finestra, una sola decisió per enunciat sense votació, exactament com es mesura el treball anterior), la configuració basada en referència arriba al 86,3% UAR. La configuració sense referència, que no requereix cap línia de base inscrita i decideix a partir d'una sola mostra parlada, arriba al 81,9%. Al punt d'operació de desplegament, on el sistema combina diverses finestres d'un enregistrament en una decisió de consens, aquestes pugen al 87,6% i al 82,5% respectivament.

Per contextualitzar: la línia de base oficial de l'Interspeech 2011 Speaker-State Challenge en aquest corpus se situa en el 65,9% UAR, els resultats d'estat de l'art publicats anteriorment arriben al màxim al voltant del 73-75%, i els oients humans no entrenats puntuen al voltant del 60-65%.

El sistema funciona com una capa passiva sobre el trànsit de ràdio habitual. Els treballadors parlen com sempre; sense cap procediment addicional, sense interrupció de la tasca, sense cap punt de control separat.

Què és el sistema, i què no és. No mesura la concentració d'alcohol en sang i no pot servir com a base per retirar un treballador del servei. És una eina de cribratge de primera línia que indica qui mereix atenció, per a la verificació per mitjans establerts. La comparació rellevant no és amb un alcoholímetre, sinó amb l'alternativa que s'utilitza avui: l'observació del supervisor, que funciona aproximadament al nivell de l'escolta no entrenada.

Hem publicat resultats complets en totes les condicions acústiques, incloses aquelles on la precisió es degrada, juntament amb les reserves de comparabilitat i les limitacions conegudes del mètode.