SafeVoice — un motor propietari d'intel·ligència de parla que marca la probable intoxicació etílica a partir de només uns segons de parla ordinària. No invasiu, sense maquinari especialitzat, no necessita res més que una frase parlada.
El personal intoxicat segueix sent un dels principals factors d'incidents industrials evitables i poc instrumentats. L'alcohol degrada la velocitat de reacció, el judici espacial i el control motor fi molt abans que els símptomes esdevinguin visualment evidents. Els controls tradicionals — alcoholímetres periòdics i comprovacions visuals del supervisor — són intermitents, invasius, colls d'ampolla a les portes de torn i fàcils d'eludir. El resultat és un punt cec operatiu: els estats d'alt risc segueixen sent els més difícils d'interceptar contínuament.
La veu és el senyal ideal per eliminar aquest buit. Els treballadors utilitzen naturalment ràdios push-to-talk, accedeixen a interfons i interfícies de veu durant tot el seu torn. L'alcohol altera constantment la biomecànica acústica — deteriorant la velocitat d'articulació, el temps de fonació, la prosòdia i la qualitat espectral de la veu — biomarcadors que un model especialitzat extreu de segons d'àudio.
SafeVoice es desplega en dues arquitectures complementàries.
SafeVoice-Ref compara la veu en temps real amb la línia de base sòbria registrada del treballador — ideal per al cribratge d'accés a l'inici del torn.
SafeVoice-Solo funciona sense cap línia de base registrada, avaluant ràfegues de parla individuals durant les comunicacions de ràdio rutinàries al llarg del torn.
Divisió de prova retinguda del German Alcohol Language Corpus, el punt de referència públic estàndard, puntuada per la recuperació mitjana no ponderada (UAR). Les comparacions amb l'estat de l'art anterior utilitzen la mètrica per finestra — una única decisió per enunciat, sense votació — perquè l'estat de l'art anterior no vota.
En lloc de classificar l'àudio de manera aïllada, SafeVoice-Ref compara la parla amb el perfil de línia de base de l'individu. Eliminar la variància acústica entre parlants produeix un guany immediat d'aproximadament 5 punts en la recuperació mitjana no ponderada (UAR) — la nostra fita arquitectònica de més impacte.
Tant Ref com Solo aprofiten les mateixes representacions acústiques de baix nivell. SafeVoice-Ref maximitza la precisió mitjançant un registre únic ràpid, mentre que SafeVoice-Solo prioritza la fricció operativa zero, cribrant qualsevol parlant immediatament sense dades històriques.
La pràctica estàndard suggereix congelar les columnes vertebrals preentrenades en corpus petits. Els nostres estudis empírics van demostrar el contrari: la precisió del cribratge escalava amb la profunditat d'ajust fi, saltant ~7 punts amb una adaptació completa de la columna vertebral d'extrem a extrem en comparació amb la congelació parcial de capes.
Els biomarcadors acústics existeixen en resolucions temporals diferents. Les capes inferiors de la columna vertebral conserven dinàmiques fines d'articulació i tracte vocal, mentre que les capes superiors modelen el flux prosòdic i el ritme de frasatge. La fusió multi-nivell seguida d'un pooling atent pondera dinàmicament els fotogrames més diagnòstics.
Vam evitar el soroll blanc sintètic a favor de currículums d'àudio industrial extensos — maquinària pesant, remor de vehicles, xerrada ambiental de multituds i reverberació estructural. Això va tancar la bretxa de rendiment en condicions de camp dures sense degradar la precisió de la línia de base neta.
Per evitar que pics transitoris o aclariments de gola desencadenin falses alarmes, el pipeline d'inferència puntua múltiples finestres d'anàlisi superposades per enunciat. L'aplicació de votació per consens afegeix 1–2 punts d'UAR i fa que la detecció sigui excepcionalment resistent als pics acústics del món real.
UAR de consens (MV@5), basat en referència / sense referència. Publicat incloent les condicions on la precisió cau.
SafeVoice no mesura la concentració d'alcohol en sang i no pot servir com a base per retirar un treballador del servei. És una eina de cribratge de primera línia que indica qui mereix atenció, per a la verificació per mitjans establerts. La comparació rellevant no és amb un alcoholímetre sinó amb l'alternativa que s'utilitza avui: l'observació del supervisor, que funciona aproximadament al nivell de l'escolta sense formació.
Tots els resultats provenen d'un únic corpus: el German Alcohol Language Corpus, enregistrat amb 162 parlants amb valors de referència d'alcohol en sang i en aire expirat per parlant. És el punt de referència per a aquesta tasca, però és un únic corpus, i cada comparació anterior es fa sobre la seva partició de prova reservada.
Publiquem les condicions on la precisió es degrada juntament amb les xifres principals, i publiquem el que vam descartar: caps auxiliars d'emoció i de regressió d'alcohol en sang (efecte negatiu), congelació parcial del backbone (uns set punts pitjor), ajust del llindar de decisió (una solució simptomàtica que val 0,2 punts) i el condicionament d'embeddings de parlant per al model sense referència — un guany real de 0,6 punts, descartat perquè hauria requerit inscripció per usuari i hauria destruït l'avantatge de fricció zero de Solo.
Comprovació d'aptitud per al servei a l'inici del torn: una breu identificació parlada contra una línia de base inscrita
Monitoratge passiu continu sobre el trànsit de ràdio rutinari, sense inscripció
Una alerta calibrada dirigida al supervisor corresponent per a una decisió humana
S'executa en CPU amb menys d'un segon de latència per finestra d'anàlisi
Es degrada amb elegància quan el context demogràfic no està disponible
Es mostra a través de la plataforma XENOM juntament amb els altres senyals operatius del lloc