SafeVoice — en proprietær tale-intelligensmotor som flagger sannsynlig alkoholpåvirkning fra bare noen få sekunder med vanlig tale. Ikke-invasiv, null spesialisert maskinvare, krever ikke noe mer enn en talt frase.
Påvirket personell forblir en ledende og under-instrumentert driver for forebyggbare industrielle hendelser. Alkohol forringer reaksjonshastighet, romlig vurdering og finmotorisk kontroll lenge før symptomer blir visuelt synlige. Tradisjonelle kontroller — periodiske alkometre og visuelle arbeidslederkontroller — er intermitterende, invasive, flaskehalser ved skiftporter og lette å omgå. Resultatet er en operasjonell blindsone: høyrisikotilstander forblir de vanskeligste å avskjære kontinuerlig.
Stemmen er det ideelle signalet for å eliminere dette gapet. Arbeidere bruker naturlig push-to-talk-radioer, tilgang til intercoms og stemmegrensesnitt gjennom hele skiftet. Alkohol endrer konsekvent akustisk biomekanikk — svekker artikulasjonshastighet, fonasjonstiming, prosodi og spektral stemmekvalitet — biomarkører som en spesialisert modell trekker ut fra sekunder med lyd.
SafeVoice utrulleres i to komplementære arkitekturer.
SafeVoice-Ref sammenligner sanntidsstemme mot arbeiderens registrerte edru-baseline — ideelt for tilgangsscreening ved skiftstart.
SafeVoice-Solo opererer null-skudd uten registrert baseline, og vurderer enkelttaleutbrudd under rutinemessig radiokommunikasjon gjennom skiftet.
Holdt ut test-splitt av German Alcohol Language Corpus, standard offentlig referanse, skåret etter uvektet gjennomsnittlig recall (UAR). Sammenligninger med tidligere arbeid bruker per-vindu-metrikken — én enkelt avgjørelse per ytring, ingen avstemming — fordi tidligere arbeid ikke stemmer.
I stedet for å klassifisere lyd isolert, benchmarker SafeVoice-Ref tale mot individets baselineprofil. Å eliminere inter-taler akustisk varians gir et umiddelbart ~5-punkts løft i uvektet gjennomsnittlig recall (UAR) — vår mest virkningsfulle arkitektoniske milepæl.
Både Ref og Solo bruker de samme lavnivå akustiske representasjonene. SafeVoice-Ref maksimerer presisjon via en rask engangsregistrering, mens SafeVoice-Solo prioriterer null operasjonell friksjon, og screener enhver taler umiddelbart uten historiske data.
Standard praksis foreslår å fryse forhåndstrente ryggrader på små korpus. Våre empiriske gjennomganger beviste det motsatte: screeningsnøyaktigheten skalerte med finjusteringsdybden, og hoppet ~7 poeng under full ende-til-ende ryggradstilpasning sammenlignet med delvis lagfrysing.
Akustiske biomarkører eksisterer på tvers av distinkte tidsmessige oppløsninger. Lavere ryggradslag beholder fine artikulatoriske og stemmekanaldynamikker, mens høyere lag modellerer prosodisk flyt og fraseringsrytme. Fler-nivå fusjon etterfulgt av oppmerksom pooling vekter dynamisk de mest diagnostiske rammene.
Vi omgikk syntetisk hvit støy til fordel for omfattende industrielle lydlæreplaner — tunge maskiner, kjøretøybuldring, omgivelsesprat og strukturell etterklang. Dette lukket ytelsesgapet under tøffe feltforhold uten å forringe ren baseline-nøyaktighet.
For å forhindre at forbigående topper eller halskremting utløser falske alarmer, skårer inferensrørledningen flere overlappende analysevinduer per ytring. Å bruke konsensusavstemming legger til 1–2 poeng UAR og gjør deteksjon eksepsjonelt motstandsdyktig mot virkelige akustiske topper.
Konsensus-UAR (MV@5), referansebasert / referansefri. Publisert inkludert forholdene der nøyaktigheten faller.
SafeVoice måler ikke alkoholkonsentrasjon i blod og kan ikke brukes som grunnlag for å fjerne en arbeider fra tjeneste. Det er et førstelinjescreeningsverktøy som indikerer hvem som fortjener oppmerksomhet, for verifisering med etablerte metoder. Den relevante sammenligningen er ikke med en alkometer, men med alternativet som brukes i dag: arbeidsleders observasjon, som yter omtrent på nivå med utrent lytting.
Alle resultater kommer fra ett korpus — German Alcohol Language Corpus, innspilt fra 162 talere med blod- og utåndingsalkoholgrunnsannhet per taler. Det er referansebenchmarken for denne oppgaven, men det er ett enkelt korpus, og enhver sammenligning ovenfor er gjort på dets holdte ut-testdeling.
Vi publiserer forholdene der nøyaktigheten degraderes sammen med hovedtallene, og vi publiserer det vi forkastet: hjelpeemotion- og blodalkoholregresjonshoder (negativ effekt), delvis ryggradsfrysing (omtrent syv poeng dårligere), beslutningsterskeltuning (en symptomfiks verdt 0,2 poeng), og talerinnbyggingkondisjonering for den referansefrie modellen — en reell gevinst på 0,6 poeng, forkastet fordi den ville ha krevd per-bruker-innrullering og ødelagt Solos nullfriksjonsfordel.
Skiftstart egnethet-for-tjeneste-sjekk: en kort talt innsjekking mot en innrullet grunnlinje
Kontinuerlig passiv overvåking over rutinemessig radiotrafikk, uten innrullering
Et kalibrert varsel rutet til den aktuelle arbeidslederen for en menneskelig beslutning
Kjører på CPU med under ett sekunds latens per analysevindu
Degraderes elegant når demografisk kontekst er utilgjengelig
Vises gjennom XENOM-plattformen sammen med stedets øvrige operasjonelle signaler