XENOM R&D dosahuje špičkovú úroveň v neinvazívnom hlasovom skríningu

Reč nesie viac než len slová. Intoxikácia alkoholom zanecháva merateľné stopy v artikulácii, tempe a spektrálnych mikrovariáciách — signály, ktoré ľudské ucho registruje prinajlepšom nespoľahlivo.

R&D tím XENOM natrénoval vlastný model hlbokého učenia na detekciu týchto akustických biomarkerov a vyhodnotil ho na Alcohol Language Corpus, štandardnom verejnom benchmarku pre túto úlohu.

Hodnotené prísne porovnateľne — priemerná nevážená miera vybavenia na okno, jedno rozhodnutie na výpoveď bez hlasovania, presne ako sa meria predchádzajúca práca — referenčná konfigurácia dosahuje 86,3 % UAR. Konfigurácia bez referencie, ktorá nevyžaduje registrovanú základnú líniu a rozhoduje z jedinej hovorenej vzorky, dosahuje 81,9 %. V prevádzkovom pracovnom bode, kde systém kombinuje niekoľko okien nahrávky do konsenzuálneho rozhodnutia, tieto hodnoty stúpajú na 87,6 % a 82,5 %.

Pre kontext: oficiálna základná línia Interspeech 2011 Speaker-State Challenge na tomto korpuse je 65,9 % UAR, predtým publikované špičkové výsledky dosahujú približne 73–75 % a netrénovaní ľudskí poslucháči dosahujú okolo 60–65 %.

Systém funguje ako pasívna vrstva nad bežnou rádiovou komunikáciou. Pracovníci hovoria tak, ako vždy; žiadny dodatočný postup, žiadne prerušenie úlohy, žiadny samostatný kontrolný bod.

Čo systém je — a čo nie je. Nemeria koncentráciu alkoholu v krvi a nemôže slúžiť ako dôvod na odvolanie pracovníka zo služby. Je to prvostupňový skríningový nástroj, ktorý indikuje, kto si zaslúži pozornosť, na overenie zavedenými prostriedkami. Relevantné porovnanie nie je s alkohol testerom, ale s alternatívou používanou dnes: pozorovaním nadriadeným, ktoré dosahuje približne úroveň netrénovaného počúvania.

Zverejnili sme kompletné výsledky naprieč akustickými podmienkami — vrátane tých, kde presnosť klesá — spolu s upozorneniami na porovnateľnosť a známymi obmedzeniami metódy.