Rilevamento acustico di alterazione da un check-in parlato

SafeVoice — un motore proprietario di intelligenza vocale che segnala probabile alterazione da alcol da pochi secondi di parlato ordinario. Non invasivo, zero hardware specializzato, non richiede altro che una frase pronunciata.

Il personale alterato rimane una causa primaria e sotto-strumentata di incidenti industriali prevenibili. L'alcol degrada la velocità di reazione, il giudizio spaziale e il controllo motorio fine molto prima che i sintomi diventino visivamente evidenti. I controlli tradizionali — etilometri periodici e controlli visivi dei supervisori — sono intermittenti, invasivi, colli di bottiglia ai cancelli di turno e facili da eludere. Il risultato è un punto cieco operativo: gli stati ad alto rischio restano i più difficili da intercettare continuamente.

La voce è il segnale ideale per eliminare questo divario. I lavoratori usano naturalmente radio Push-to-Talk, citofoni di accesso e interfacce vocali durante tutto il turno. L'alcol altera costantemente la biomeccanica acustica — compromettendo velocità di articolazione, tempistica della fonazione, prosodia e qualità spettrale della voce — biomarcatori che un modello specializzato estrae da secondi di audio.

SafeVoice si implementa in due architetture complementari.

SafeVoice-Ref confronta la voce in tempo reale con il profilo di base sobrio registrato dal lavoratore — ideale per lo screening di accesso all'inizio del turno.

SafeVoice-Solo opera zero-shot senza profilo di base registrato, valutando singole emissioni vocali durante le comunicazioni radio di routine nel corso del turno.

Suddivisione di test tenuta fuori dal German Alcohol Language Corpus, il benchmark pubblico standard, valutata con unweighted average recall (UAR). I confronti con lo stato dell'arte precedente usano la metrica per-finestra — una singola decisione per emissione, nessun voto — perché lo stato dell'arte precedente non vota.

Cosa abbiamo costruito

Codifica differenziale relativa al parlante

Invece di classificare l'audio in isolamento, SafeVoice-Ref confronta il parlato con il profilo di base dell'individuo. Eliminare la varianza acustica tra parlanti produce un guadagno immediato di circa 5 punti nell'Unweighted Average Recall (UAR) — la nostra pietra miliare architetturale più impattante.

Doppie architetture di modello, stack di feature unificato

Sia Ref che Solo sfruttano le stesse rappresentazioni acustiche di basso livello. SafeVoice-Ref massimizza la precisione tramite una registrazione rapida una tantum, mentre SafeVoice-Solo privilegia zero attriti operativi, valutando qualsiasi parlante immediatamente senza dati storici.

Adattamento completo della backbone

La pratica standard suggerisce di congelare le backbone pre-addestrate su corpora piccoli. Le nostre scansioni empiriche hanno dimostrato il contrario: l'accuratezza dello screening scala con la profondità del fine-tuning, guadagnando circa 7 punti con l'adattamento completo end-to-end della backbone rispetto al congelamento parziale dei layer.

Aggregazione di feature multi-scala

I biomarcatori acustici esistono a risoluzioni temporali distinte. I layer inferiori della backbone conservano dinamiche articolatorie fini e del tratto vocale, mentre i layer superiori modellano il flusso prosodico e il ritmo di fraseggio. La fusione multi-livello seguita da pooling attento pesa dinamicamente i frame più diagnostici.

Curricula di rumore industriale pesante

Abbiamo aggirato il rumore bianco sintetico a favore di estesi curricula audio industriali — macchinari pesanti, rombo di veicoli, chiacchiericcio ambientale e riverbero strutturale. Questo ha chiuso il divario prestazionale in condizioni di campo difficili senza degradare l'accuratezza di base in condizioni pulite.

Decodifica a consenso multi-finestra

Per impedire che picchi transitori o schiarimenti di gola attivino falsi allarmi, la pipeline di inferenza valuta più finestre di analisi sovrapposte per emissione vocale. L'applicazione del voto a consenso aggiunge 1–2 punti di UAR e rende il rilevamento eccezionalmente resiliente ai picchi acustici del mondo reale.

Risultati misurati

Degrado tra le condizioni acustiche

UAR a consenso (MV@5), basato su riferimento / senza riferimento. Pubblicato includendo le condizioni in cui l'accuratezza diminuisce.

Cosa è il sistema — e cosa non è

SafeVoice non misura la concentrazione di alcol nel sangue e non può fungere da base per allontanare un lavoratore dal servizio. È uno strumento di screening di prima linea che indica chi merita attenzione, per una verifica tramite metodi consolidati. Il confronto rilevante non è con l'etilometro ma con l'alternativa oggi in uso: l'osservazione del supervisore, che si attesta all'incirca al livello di un ascolto non addestrato.

Tutti i risultati provengono da un unico corpus — il German Alcohol Language Corpus, registrato da 162 parlanti con verità di riferimento alcol nel sangue e nell'alito per ciascun parlante. È il benchmark di riferimento per questo compito, ma è un singolo corpus, e ogni confronto sopra riportato è effettuato sulla sua porzione di test mantenuta separata.

Pubblichiamo le condizioni in cui l'accuratezza degrada insieme alle cifre principali, e pubblichiamo ciò che abbiamo scartato: testine ausiliarie per emozione e regressione dell'alcol nel sangue (effetto negativo), congelamento parziale della backbone (circa sette punti in meno), taratura della soglia di decisione (una correzione sintomatica che vale 0,2 punti) e condizionamento tramite embedding del parlante per il modello reference-free — un guadagno autentico di 0,6 punti, scartato perché avrebbe richiesto un'arruolamento per utente e distrutto il vantaggio di azzeramento degli attriti di Solo.

Come viene utilizzato

Verifica di idoneità al servizio all'inizio del turno: un breve accesso vocale rispetto a una baseline registrata

Monitoraggio passivo continuo sul traffico radio di routine, senza registrazione

Un segnale calibrato inoltrato al supervisore competente per una decisione umana

Funziona su CPU con meno di un secondo di latenza per finestra di analisi

Degrada in modo graduale quando il contesto demografico non è disponibile

Esposto tramite la piattaforma XENOM insieme agli altri segnali operativi del sito