Akoestiese benatheidsopsporing vanaf 'n gesproke aanmelding

SafeVoice — 'n eie spraakintelligensie-enjin wat waarskynlike alkoholbenatheid uit slegs 'n paar sekondes gewone spraak merk. Nie-indringend, geen gespesialiseerde hardeware nie, niks meer as 'n gesproke frase nodig nie.

Benadeelde personeel bly 'n leidende en onder-geïnstrumenteerde drywer van voorkombare industriële voorvalle. Alkohol verswak reaksiespoed, ruimtelike oordeel en fyn motoriese beheer lank voordat simptome visueel sigbaar word. Tradisionele kontroles — periodieke asemtoetse en visuele toesighouerkontroles — is onderbroke, indringend, bottelnekke by skofhekke, en maklik om te ontduik. Die resultaat is 'n operasionele blindekol: hoërisiko-toestande bly die moeilikste om deurlopend te onderskep.

Stem is die ideale sein om hierdie gaping uit te skakel. Werkers gebruik natuurlik druk-om-te-praat-radio's, toegang-interkoms en stemkoppelvlakke regdeur hul skof. Alkohol verander akoestiese biomeganika konsekwent — benadeel artikulasiesnelheid, fonasie-tydsberekening, prosodie en spektrale stemkwaliteit — biomerkers wat 'n gespesialiseerde model uit sekondes oudio onttrek.

SafeVoice ontplooi in twee komplementêre argitekture.

SafeVoice-Ref vergelyk intydse stem met die werker se ingeskrewe nugter basislyn — ideaal vir skofbegin-toegangskeuring.

SafeVoice-Solo werk zero-shot sonder 'n ingeskrewe basislyn, en assesseer enkele spraakuitbarstings tydens roetine-radiokommunikasie regdeur die skof.

Teruggehoue toetssplitsing van die Duitse Alkokorpus, die standaard openbare maatstaf, gemeet volgens ongeweegde gemiddelde herroeping (UAR). Vergelykings met vorige kuns gebruik die per-venster-metriek — 'n enkele besluit per uiting, geen stemming nie — omdat vorige kuns nie stem nie.

Wat ons gebou het

Spreker-relatiewe differensiële enkodering

Eerder as om oudio in isolasie te klassifiseer, maatstaf SafeVoice-Ref spraak teen die individu se basislynprofiel. Die uitskakeling van tussenspreker-akoestiese variasie lewer 'n onmiddellike ~5-punt-wins in Ongeweegde Gemiddelde Herroeping (UAR) — ons mees impakvolle argitektoniese mylpaal.

Dubbele modelargitekture, verenigde kenmerkstapel

Beide Ref en Solo gebruik dieselfde laevlak-akoestiese voorstellings. SafeVoice-Ref maksimeer presisie via 'n vinnige eenmalige inskrywing, terwyl SafeVoice-Solo nul operasionele wrywing prioritiseer, en enige spreker onmiddellik sonder historiese data keur.

Volle ruggraataanpassing

Standaardpraktyk stel voor om voorafopgeleide ruggraat op klein korpusse te vries. Ons empiriese swepe het die teenoorgestelde bewys: keuringsakkuraatheid het met fyninstellingsdiepte geskaal, en het ~7 punte gespring onder volle end-tot-end-ruggraataanpassing in vergelyking met gedeeltelike laagbevriesing.

Veelskaal-kenmerkaggregasie

Akoestiese biomerkers bestaan oor verskillende tydelike resolusies. Laer ruggraatlae behou fyn artikulatoriese en vokale kanaaldinamika, terwyl hoër lae prosodiese vloei en fraseringsritme modelleer. Multi-vlak-samesmelting gevolg deur aandagtige samevoeging weeg die mees diagnostiese rame dinamies.

Swaar industriële geraasleerplanne

Ons het sintetiese wit geraas omseil ten gunste van uitgebreide industriële oudioleerplanne — swaar masjinerie, voertuiggedreun, omringende skare-gesels, en strukturele weerklank. Dit het die prestasiegaping in strawwe veldtoestande gesluit sonder om skoon basislynakkuraatheid te verswak.

Veelvenster-konsensusdekodering

Om te verhoed dat verbygaande spykers of keelskoonmaak vals alarms aktiveer, behaal die afleidingspyplyn tellings oor veelvuldige oorvleuelende analisevensters per uiting. Die toepassing van konsensusstemming voeg 1–2 punte UAR by en maak opsporing buitengewoon veerkragtig teen werklike akoestiese spykers.

Gemete resultate

Verswakking oor akoestiese toestande

Konsensus UAR (MV@5), verwysing-gebaseer / verwysing-vry. Gepubliseer insluitend die toestande waar akkuraatheid daal.

Wat die stelsel is — en nie is nie

SafeVoice meet nie bloedalkoholkonsentrasie nie en kan nie as grond dien om 'n werker van diens te verwyder nie. Dit is 'n eerstelyn-siftingsinstrument wat aandui wie aandag verdien, vir bevestiging deur gevestigde metodes. Die relevante vergelyking is nie met 'n asemtoestel nie, maar met die alternatief wat vandag in gebruik is: toesighouerwaarneming, wat ongeveer op die vlak van onopgeleide luister presteer.

Alle resultate kom uit een korpus — die German Alcohol Language Corpus, opgeneem van 162 sprekers met per-spreker bloed- en asemalkohol-grondwaarheid. Dit is die verwysingsmaatstaf vir hierdie taak, maar dit is 'n enkele korpus, en elke vergelyking hierbo word op sy uitgehoue toetsverdeling gemaak.

Ons publiseer die toestande waar akkuraatheid afneem saam met die hoofsyfers, en ons publiseer wat ons verwerp het: aanvullende emosie- en bloedalkoholregressie-koppe (negatiewe effek), gedeeltelike ruggraatbevriesing (ongeveer sewe punte swakker), besluitdrempel-instelling ('n simptoomoplossing van 0.2 punte werd), en spreker-inbedding-kondisionering vir die verwysingsvrye model — 'n egte 0.6-punt-wins, weggegooi omdat dit per-gebruiker-inskrywing sou vereis en Solo se nul-wrywing-voordeel sou vernietig.

Hoe dit gebruik word

Skuifbegin-geskiktheid-vir-diens-kontrole: 'n kort gesproke aanmelding teen 'n ingeskrewe basislyn

Deurlopende passiewe monitering oor roetine-radiokommunikasie, sonder inskrywing

'n Gekalibreerde vlag wat na die toepaslike toesighouer gestuur word vir 'n menslike besluit

Loop op SVE met minder as een sekonde vertraging per ontledingsvenster

Verswak grasieus wanneer demografiese konteks nie beskikbaar is nie

Vertoon deur die XENOM-platform saam met die terrein se ander operasionele seine