SafeVoice — en proprietær taleintelligensmotor, der markerer sandsynlig alkoholpåvirkning fra blot et par sekunders almindelig tale. Ikke-invasiv, nul specialiseret hardware, kræver intet mere end en talt sætning.
Påvirket personale forbliver en førende og underinstrumenteret drivkraft for forebyggelige industrihændelser. Alkohol forringer reaktionshastighed, rumlig bedømmelse og finmotorisk kontrol længe før symptomer bliver visuelt synlige. Traditionelle kontroller — periodiske alkometertests og visuelle supervisorkontroller — er intermitterende, invasive, flaskehalse ved vagtporte og lette at omgå. Resultatet er en operationel blind vinkel: højrisikotilstande forbliver de sværeste at fange kontinuerligt.
Stemmen er det ideelle signal til at eliminere dette hul. Arbejdere bruger naturligt push-to-talk-radioer, adgangsintercoms og stemmegrænseflader gennem deres vagt. Alkohol ændrer konsekvent akustisk biomekanik — forringer artikulationshastighed, fonationstiming, prosodi og spektral stemmekvalitet — biomarkører, som en specialiseret model udtrækker fra sekunders audio.
SafeVoice implementeres i to komplementære arkitekturer.
SafeVoice-Ref sammenligner realtidsstemme med arbejderens indmeldte ædru baseline — ideelt til vagtstarts-adgangsscreening.
SafeVoice-Solo fungerer zero-shot uden indmeldt baseline og vurderer enkelte taleudbrud under rutinemæssig radiokommunikation gennem vagten.
Tilbageholdt testsplit af German Alcohol Language Corpus, den offentlige standardbenchmark, scoret ved unweighted average recall (UAR). Sammenligninger med tidligere forskning bruger per-vindue-metrikken — en enkelt beslutning pr. ytring, ingen afstemning — fordi tidligere forskning ikke stemmer.
I stedet for at klassificere audio isoleret benchmarker SafeVoice-Ref tale mod individets basisprofil. Eliminering af inter-talers akustisk varians giver en øjeblikkelig gevinst på cirka 5 point i Unweighted Average Recall (UAR) — vores mest betydningsfulde arkitektoniske milepæl.
Både Ref og Solo udnytter de samme lavniveau-akustiske repræsentationer. SafeVoice-Ref maksimerer præcision via en hurtig engangsindmeldelse, mens SafeVoice-Solo prioriterer nul operationel friktion og screener enhver taler øjeblikkeligt uden historiske data.
Standardpraksis foreslår at fryse fortrænede backbones på små korpora. Vores empiriske afprøvninger beviste det modsatte: screeningsnøjagtigheden skaleres med finjusteringsdybden med et spring på ca. 7 point under fuld end-to-end backbone-tilpasning sammenlignet med delvis lagfrysning.
Akustiske biomarkører eksisterer på tværs af forskellige tidsmæssige opløsninger. Lavere backbone-lag bevarer fine artikulatoriske dynamikker og stemmekanaldynamik, mens højere lag modellerer prosodisk flow og fraseringsrytme. Multi-niveau-fusion efterfulgt af attentiv pooling vægter dynamisk de mest diagnostiske frames.
Vi omgik syntetisk hvid støj til fordel for omfattende kurrikula af industriel audio — tunge maskiner, køretøjsbrummen, omgivende menneskesnak og strukturel efterklang. Dette lukkede præstationsgabet under hårde feltforhold uden at forringe ren baseline-nøjagtighed.
For at forhindre transiente spikes eller rømmen i at udløse falske alarmer scorer inferenspipelinen flere overlappende analysevinduer pr. ytring. Anvendelse af konsensusafstemning tilføjer 1–2 point UAR og gør detektionen exceptionelt modstandsdygtig over for virkelige akustiske spikes.
Konsensus UAR (MV@5), referencebaseret / referencefri. Publiceret inklusive de forhold, hvor nøjagtigheden falder.
SafeVoice måler ikke alkoholkoncentration i blodet og kan ikke danne grundlag for at fjerne en medarbejder fra tjeneste. Det er et første-linje screeningsværktøj, der indikerer, hvem der kræver opmærksomhed, til verifikation ved etablerede metoder. Den relevante sammenligning er ikke med et alkometer, men med det alternativ, der anvendes i dag: supervisorens observation, som præsterer på niveau med utrænet lytning.
Alle resultater kommer fra ét korpus — det tyske alkoholsprogskorpus, optaget fra 162 talere med per-taler blod- og udåndingsalkohol som grundsandhed. Det er referencebenchmarket for denne opgave, men det er et enkelt korpus, og enhver sammenligning ovenfor er foretaget på dets tilbageholdte testsplit.
Vi offentliggør de forhold, hvor nøjagtigheden falder, sammen med hovedtallene, og vi offentliggør, hvad vi afviste: hjælpehoveder til følelser og blodalkoholregression (negativ effekt), delvis frysning af backbone (cirka syv point dårligere), tuning af beslutningstærskel (en symptomrettelse værd 0,2 point) og højttalerembedding-konditionering for den referencefri model — en reel gevinst på 0,6 point, kasseret fordi den ville have krævet tilmelding per bruger og ødelagt Solos friktionsfri fordel.
Egnethedstjek ved vagtstart: et kort talt tjek-ind mod en tilmeldt baseline
Kontinuerlig passiv overvågning over rutinemæssig radiotrafik uden tilmelding
Et kalibreret flag dirigeret til den relevante supervisor til en menneskelig beslutning
Kører på CPU med under ét sekunds latenstid per analysevindue
Nedbrydes gradvist, når demografisk kontekst ikke er tilgængelig
Vises gennem XENOM-platformen sammen med anlæggets øvrige operationelle signaler