Akustisk påvirkningsdeteksjon fra en talt innsjekking

SafeVoice — en proprietær tale-intelligensmotor som flagger sannsynlig alkoholpåvirkning fra bare noen få sekunder med vanlig tale. Ikke-invasiv, null spesialisert maskinvare, krever ikke noe mer enn en talt frase.

Påvirket personell forblir en ledende og under-instrumentert driver for forebyggbare industrielle hendelser. Alkohol forringer reaksjonshastighet, romlig vurdering og finmotorisk kontroll lenge før symptomer blir visuelt synlige. Tradisjonelle kontroller — periodiske alkometre og visuelle arbeidslederkontroller — er intermitterende, invasive, flaskehalser ved skiftporter og lette å omgå. Resultatet er en operasjonell blindsone: høyrisikotilstander forblir de vanskeligste å avskjære kontinuerlig.

Stemmen er det ideelle signalet for å eliminere dette gapet. Arbeidere bruker naturlig push-to-talk-radioer, tilgang til intercoms og stemmegrensesnitt gjennom hele skiftet. Alkohol endrer konsekvent akustisk biomekanikk — svekker artikulasjonshastighet, fonasjonstiming, prosodi og spektral stemmekvalitet — biomarkører som en spesialisert modell trekker ut fra sekunder med lyd.

SafeVoice utrulleres i to komplementære arkitekturer.

SafeVoice-Ref sammenligner sanntidsstemme mot arbeiderens registrerte edru-baseline — ideelt for tilgangsscreening ved skiftstart.

SafeVoice-Solo opererer null-skudd uten registrert baseline, og vurderer enkelttaleutbrudd under rutinemessig radiokommunikasjon gjennom skiftet.

Holdt ut test-splitt av German Alcohol Language Corpus, standard offentlig referanse, skåret etter uvektet gjennomsnittlig recall (UAR). Sammenligninger med tidligere arbeid bruker per-vindu-metrikken — én enkelt avgjørelse per ytring, ingen avstemming — fordi tidligere arbeid ikke stemmer.

Hva vi bygde

Talerelativ differensiell koding

I stedet for å klassifisere lyd isolert, benchmarker SafeVoice-Ref tale mot individets baselineprofil. Å eliminere inter-taler akustisk varians gir et umiddelbart ~5-punkts løft i uvektet gjennomsnittlig recall (UAR) — vår mest virkningsfulle arkitektoniske milepæl.

Doble modellarkitekturer, enhetlig funksjonsstakk

Både Ref og Solo bruker de samme lavnivå akustiske representasjonene. SafeVoice-Ref maksimerer presisjon via en rask engangsregistrering, mens SafeVoice-Solo prioriterer null operasjonell friksjon, og screener enhver taler umiddelbart uten historiske data.

Full ryggradstilpasning

Standard praksis foreslår å fryse forhåndstrente ryggrader på små korpus. Våre empiriske gjennomganger beviste det motsatte: screeningsnøyaktigheten skalerte med finjusteringsdybden, og hoppet ~7 poeng under full ende-til-ende ryggradstilpasning sammenlignet med delvis lagfrysing.

Fler-skala funksjonsaggregering

Akustiske biomarkører eksisterer på tvers av distinkte tidsmessige oppløsninger. Lavere ryggradslag beholder fine artikulatoriske og stemmekanaldynamikker, mens høyere lag modellerer prosodisk flyt og fraseringsrytme. Fler-nivå fusjon etterfulgt av oppmerksom pooling vekter dynamisk de mest diagnostiske rammene.

Tung industriell støylæreplan

Vi omgikk syntetisk hvit støy til fordel for omfattende industrielle lydlæreplaner — tunge maskiner, kjøretøybuldring, omgivelsesprat og strukturell etterklang. Dette lukket ytelsesgapet under tøffe feltforhold uten å forringe ren baseline-nøyaktighet.

Flervindu konsensusdekoding

For å forhindre at forbigående topper eller halskremting utløser falske alarmer, skårer inferensrørledningen flere overlappende analysevinduer per ytring. Å bruke konsensusavstemming legger til 1–2 poeng UAR og gjør deteksjon eksepsjonelt motstandsdyktig mot virkelige akustiske topper.

Målte resultater

Degradering på tvers av akustiske forhold

Konsensus-UAR (MV@5), referansebasert / referansefri. Publisert inkludert forholdene der nøyaktigheten faller.

Hva systemet er — og ikke er

SafeVoice måler ikke alkoholkonsentrasjon i blod og kan ikke brukes som grunnlag for å fjerne en arbeider fra tjeneste. Det er et førstelinjescreeningsverktøy som indikerer hvem som fortjener oppmerksomhet, for verifisering med etablerte metoder. Den relevante sammenligningen er ikke med en alkometer, men med alternativet som brukes i dag: arbeidsleders observasjon, som yter omtrent på nivå med utrent lytting.

Alle resultater kommer fra ett korpus — German Alcohol Language Corpus, innspilt fra 162 talere med blod- og utåndingsalkoholgrunnsannhet per taler. Det er referansebenchmarken for denne oppgaven, men det er ett enkelt korpus, og enhver sammenligning ovenfor er gjort på dets holdte ut-testdeling.

Vi publiserer forholdene der nøyaktigheten degraderes sammen med hovedtallene, og vi publiserer det vi forkastet: hjelpeemotion- og blodalkoholregresjonshoder (negativ effekt), delvis ryggradsfrysing (omtrent syv poeng dårligere), beslutningsterskeltuning (en symptomfiks verdt 0,2 poeng), og talerinnbyggingkondisjonering for den referansefrie modellen — en reell gevinst på 0,6 poeng, forkastet fordi den ville ha krevd per-bruker-innrullering og ødelagt Solos nullfriksjonsfordel.

Slik brukes det

Skiftstart egnethet-for-tjeneste-sjekk: en kort talt innsjekking mot en innrullet grunnlinje

Kontinuerlig passiv overvåking over rutinemessig radiotrafikk, uten innrullering

Et kalibrert varsel rutet til den aktuelle arbeidslederen for en menneskelig beslutning

Kjører på CPU med under ett sekunds latens per analysevindu

Degraderes elegant når demografisk kontekst er utilgjengelig

Vises gjennom XENOM-plattformen sammen med stedets øvrige operasjonelle signaler