SafeVoice — en egenutvecklad talintelligensmotor som flaggar sannolik alkoholpåverkan från bara några sekunders vanligt tal. Icke-invasiv, noll specialiserad hårdvara, kräver inget annat än en talad fras.
Påverkad personal förblir en ledande och underinstrumenterad drivkraft bakom förebyggbara industriella incidenter. Alkohol försämrar reaktionshastighet, rumsligt omdöme och finmotorisk kontroll långt innan symtom blir visuellt uppenbara. Traditionella kontroller — periodiska alkomätare och visuella arbetsledarkontroller — är intermittenta, invasiva, flaskhalsar vid skiftgrindar och lätta att kringgå. Resultatet är en operativ blind fläck: högrisktillstånd förblir de svåraste att fånga kontinuerligt.
Rösten är den idealiska signalen för att eliminera detta gap. Arbetare använder naturligt push-to-talk-radior, åtkomstintercoms och röstgränssnitt under hela skiftet. Alkohol förändrar konsekvent akustisk biomekanik — försämrar artikulationshastighet, fonationstiming, prosodi och spektral röstkvalitet — biomarkörer som en specialiserad modell extraherar från sekunder av ljud.
SafeVoice distribueras i två kompletterande arkitekturer.
SafeVoice-Ref jämför röst i realtid mot arbetarens registrerade nyktra baslinje — idealisk för åtkomstscreening vid skiftstart.
SafeVoice-Solo fungerar zero-shot utan registrerad baslinje och bedömer enskilda talutbrott under rutinmässig radiokommunikation under hela skiftet.
Hållet-ut testdelning av German Alcohol Language Corpus, det offentliga standardriktmärket, poängsatt med Unweighted Average Recall (UAR). Jämförelser med tidigare forskning använder per-fönster-måttet — ett enda beslut per yttrande, ingen röstning — eftersom tidigare forskning inte röstar.
Istället för att klassificera ljud isolerat jämför SafeVoice-Ref tal med individens baslinjeprofil. Att eliminera akustisk varians mellan talare ger en omedelbar vinst på ~5 punkter i Unweighted Average Recall (UAR) — vår mest betydelsefulla arkitektoniska milstolpe.
Både Ref och Solo utnyttjar samma lågnivåakustiska representationer. SafeVoice-Ref maximerar precision via en snabb engångsregistrering, medan SafeVoice-Solo prioriterar noll operativ friktion och screenar vilken talare som helst omedelbart utan historiska data.
Standardpraxis föreslår att frysa förtränade ryggrader på små korpusar. Våra empiriska tester visade motsatsen: screeningsnoggrannheten skalade med finjusteringsdjupet och hoppade ~7 punkter under fullständig end-to-end-ryggradsanpassning jämfört med partiell lagerfrysning.
Akustiska biomarkörer existerar över distinkta tidsupplösningar. Lägre ryggradslager behåller fina artikulatoriska och vokaltraktdynamiker, medan högre lager modellerar prosodiskt flöde och frasrytm. Fler-nivåfusion följt av uppmärksam pooling väger dynamiskt de mest diagnostiska ramarna.
Vi kringgick syntetiskt vitt brus till förmån för omfattande industriella ljudkurrikula — tunga maskiner, fordonsmuller, omgivande folksorl och strukturell efterklang. Detta stängde prestationsgapet under hårda fältförhållanden utan att försämra ren baslinjenoggrannhet.
För att förhindra att övergående toppar eller harklingar utlöser falsklarm poängsätter inferenspipelinen flera överlappande analysfönster per yttrande. Att tillämpa konsensusröstning lägger till 1–2 punkter av UAR och gör detekteringen exceptionellt motståndskraftig mot verkliga akustiska toppar.
Konsensus UAR (MV@5), referensbaserad / referensfri. Publicerad inklusive förhållanden där noggrannheten sjunker.
SafeVoice mäter inte alkoholkoncentration i blodet och kan inte ligga till grund för att avlägsna en arbetstagare från tjänst. Det är ett screeningverktyg i första ledet som indikerar vem som förtjänar uppmärksamhet, för verifiering med etablerade metoder. Den relevanta jämförelsen är inte med en alkoholmätare utan med det alternativ som används idag: arbetsledarobservation, som presterar ungefär på nivån av otränat lyssnande.
Alla resultat kommer från en korpus — German Alcohol Language Corpus, inspelad från 162 talare med per-talare blod- och utandningsalkohol som facit. Det är referensbenchmarken för denna uppgift, men det är en enda korpus, och varje jämförelse ovan görs på dess hållna testdel.
Vi publicerar de förhållanden där noggrannheten försämras tillsammans med huvudtalen, och vi publicerar vad vi förkastade: extra känslo- och blodalkoholregressionshuvuden (negativ effekt), partiell frysning av ryggraden (cirka sju punkter sämre), tröskeljustering för beslut (en symtomfix värd 0,2 poäng) och talarinbäddningsvillkor för den referensfria modellen — en verklig vinst på 0,6 poäng, bortkastad eftersom den skulle ha krävt per-användare-inskrivning och förstört Solos friktionsfria fördel.
Lämplighetskontroll vid skiftstart: en kort talad incheckning mot en inskriven baslinje
Kontinuerlig passiv övervakning över rutinmässig radiotrafik, utan inskrivning
En kalibrerad flagga som dirigeras till lämplig arbetsledare för ett mänskligt beslut
Körs på CPU med under en sekunds latens per analysfönster
Försämras gradvis när demografisk kontext inte är tillgänglig
Visas genom XENOM-plattformen tillsammans med platsens övriga operativa signaler