Akoestische intoxicatiedetectie uit een gesproken check-in

SafeVoice — een eigen spraakintelligentie-engine die waarschijnlijke alcoholintoxicatie markeert uit slechts enkele seconden gewone spraak. Niet-invasief, zonder gespecialiseerde hardware, met niets meer dan een gesproken zin.

Geïntoxiceerd personeel blijft een belangrijke en onvoldoende geïnstrumenteerde oorzaak van vermijdbare industriële incidenten. Alcohol verslechtert reactiesnelheid, ruimtelijk inzicht en fijne motoriek lang voordat symptomen visueel zichtbaar worden. Traditionele controles — periodieke ademtests en visuele controles door leidinggevenden — zijn intermitterend, invasief, flessenhalzen bij de poort en makkelijk te omzeilen. Het resultaat is een operationele blinde vlek: toestanden met hoog risico blijven het moeilijkst continu te onderscheppen.

Stem is het ideale signaal om dit gat te dichten. Werknemers gebruiken van nature Push-to-Talk-radio's, intercoms en spraakinterfaces tijdens hun dienst. Alcohol verandert consequent de akoestische biomechanica — het schaadt articulatiesnelheid, fonatietiming, prosodie en spectrale stemkwaliteit — biomarkers die een gespecialiseerd model uit seconden audio haalt.

SafeVoice wordt in twee complementaire architecturen ingezet.

SafeVoice-Ref vergelijkt realtime stem met de geregistreerde nuchtere basislijn van de werknemer — ideaal voor toegangsscreening bij aanvang van de dienst.

SafeVoice-Solo werkt zero-shot zonder geregistreerde basislijn en beoordeelt afzonderlijke spraakuitbarstingen tijdens routinematige radiocommunicatie gedurende de dienst.

Achtergehouden testsplitsing van het German Alcohol Language Corpus, de standaard publieke benchmark, gescoord op unweighted average recall (UAR). Vergelijkingen met eerdere publicaties gebruiken de per-venster-metriek — één beslissing per uiting, geen stemming — omdat eerdere publicaties niet stemmen.

Wat wij hebben gebouwd

Spreker-relatieve differentiële codering

In plaats van audio geïsoleerd te classificeren, benchmarkt SafeVoice-Ref spraak tegen het basislijnprofiel van het individu. Het elimineren van akoestische variantie tussen sprekers levert een onmiddellijke winst van ongeveer 5 punten in Unweighted Average Recall (UAR) op — onze belangrijkste architecturale mijlpaal.

Dubbele modelarchitecturen, uniforme feature-stack

Zowel Ref als Solo gebruiken dezelfde laagniveau akoestische representaties. SafeVoice-Ref maximaliseert precisie via een snelle eenmalige inschrijving, terwijl SafeVoice-Solo prioriteit geeft aan nul operationele frictie en elke spreker onmiddellijk screent zonder historische data.

Volledige backbone-adaptatie

De standaardpraktijk suggereert het bevriezen van voorgetrainde backbones op kleine corpora. Onze empirische sweeps bewezen het tegenovergestelde: screennauwkeurigheid schaalde met fine-tuningdiepte en sprong ongeveer 7 punten bij volledige end-to-end backbone-adaptatie vergeleken met gedeeltelijk bevroren lagen.

Multi-schaal feature-aggregatie

Akoestische biomarkers bestaan op verschillende temporele resoluties. Lagere backbonelagen behouden fijne articulatorische en stemkanaaldynamiek, terwijl hogere lagen prosodische flow en fraseringsritme modelleren. Multi-level fusie gevolgd door aandachtige pooling weegt dynamisch de meest diagnostische frames.

Zware industriële ruiscurricula

Wij hebben synthetische witte ruis overgeslagen ten gunste van uitgebreide industriële audiocurricula — zware machines, voertuiggerommel, omgevingsgepraat en structurele nagalm. Dit dichtte de prestatiekloof in zware veldomstandigheden zonder de nauwkeurigheid op schone basislijn te verslechteren.

Multi-window consensusdecodering

Om te voorkomen dat voorbijgaande pieken of keelschrapen valse alarmen veroorzaken, scoort de inferentiepijplijn meerdere overlappende analysevensters per uiting. Consensusstemming voegt 1–2 punten UAR toe en maakt detectie uitzonderlijk robuust tegen akoestische pieken in de echte wereld.

Gemeten resultaten

Degradatie over akoestische omstandigheden

Consensus-UAR (MV@5), referentiegebaseerd / referentievrij. Gepubliceerd inclusief de omstandigheden waar de nauwkeurigheid daalt.

Wat het systeem is — en niet is

SafeVoice meet geen bloedalcoholconcentratie en kan niet dienen als grond voor het verwijderen van een medewerker van zijn taak. Het is een eerstelijns screeningsinstrument dat aangeeft wie aandacht verdient, ter verificatie via gevestigde middelen. De relevante vergelijking is niet met een ademtest maar met het huidige alternatief: observatie door een leidinggevende, die ongeveer presteert op het niveau van ongetraind luisteren.

Alle resultaten komen uit één corpus: het German Alcohol Language Corpus, opgenomen van 162 sprekers met per spreker een grondwaarheid van bloed- en ademalcohol. Het is de referentiebenchmark voor deze taak, maar het is één corpus, en elke bovenstaande vergelijking is gemaakt op de apart gehouden testset.

We publiceren de omstandigheden waarin de nauwkeurigheid afneemt naast de kerncijfers, en we publiceren wat we hebben afgewezen: hulpkoppen voor emotie en bloedalcoholregressie (negatief effect), gedeeltelijke bevriezing van de backbone (ongeveer zeven punten slechter), tuning van de beslissingsdrempel (een symptoomoplossing van 0,2 punt waard), en speaker-embeddingconditionering voor het referentievrije model — een echte winst van 0,6 punt, afgewezen omdat het per-gebruiker-inschrijving zou vereisen en Solo's voordeel van zero friction zou vernietigen.

Hoe het wordt gebruikt

Geschiktheidscontrole bij aanvang van de dienst: een korte gesproken aanmelding tegen een ingeschreven basisprofiel

Continue passieve monitoring over routineus radioverkeer, zonder inschrijving

Een gekalibreerde melding die naar de juiste leidinggevende wordt geleid voor een menselijke beslissing

Draait op CPU met minder dan één seconde latentie per analysevenster

Neemt geleidelijk af in prestaties wanneer demografische context niet beschikbaar is

Beschikbaar via het XENOM-platform naast de andere operationele signalen van de locatie