भाषणात शब्दांपेक्षा अधिक काही असते. अल्कोहोलच्या नशेचे मोजता येणारे ट्रेस उच्चार, गती आणि वर्णक्रमीय सूक्ष्म-भिन्नतेत उमटतात — मानवी कान जे सिग्नल अविश्वसनीयपणे नोंदवतात.
XENOM च्या R&D टीमने या ध्वनिक बायोमार्कर्स शोधण्यासाठी एक मालकीचे डीप लर्निंग मॉडेल प्रशिक्षित केले आहे आणि या कार्यासाठी मानक सार्वजनिक बेंचमार्क असलेल्या Alcohol Language Corpus वर त्याचे मूल्यांकन केले आहे.
काटेकोरपणे तुलनात्मक पद्धतीने स्कोअर केले — प्रति-विंडो अनवेटेड सरासरी रिकॉल, प्रति उच्चारण एकच निर्णय, मतदानाशिवाय, पूर्वीच्या कामाचे मोजमाप जसे केले जाते तसे — संदर्भ-आधारित कॉन्फिगरेशन 86.3% UAR पर्यंत पोहोचते. संदर्भ-मुक्त कॉन्फिगरेशन, ज्याला नोंदणीकृत बेसलाइनची आवश्यकता नसते आणि एकाच बोललेल्या नमुन्यावरून निर्णय घेते, 81.9% पर्यंत पोहोचते. तैनाती ऑपरेटिंग पॉइंटवर, जिथे सिस्टम रेकॉर्डिंगच्या अनेक विंडो एकत्र करून सर्वसंमतीचा निर्णय घेते, हे अनुक्रमे 87.6% आणि 82.5% पर्यंत वाढते.
संदर्भासाठी: या कॉर्पसवरील अधिकृत Interspeech 2011 Speaker-State Challenge बेसलाइन 65.9% UAR वर आहे, पूर्वी प्रकाशित अत्याधुनिक परिणाम अंदाजे 73–75% वर शिखरावर आहेत आणि अप्रशिक्षित मानवी श्रोते सुमारे 60–65% स्कोअर करतात.
ही सिस्टम नियमित रेडिओ ट्रॅफिकवर एक निष्क्रिय स्तर म्हणून चालते. कामगार नेहमीप्रमाणे बोलतात; कोणतीही अतिरिक्त प्रक्रिया नाही, कामात व्यत्यय नाही, वेगळा चेकपॉइंट नाही.
ही सिस्टम काय आहे — आणि काय नाही. ती रक्तातील अल्कोहोल एकाग्रता मोजत नाही आणि कामगाराला कर्तव्यावरून दूर करण्यासाठी आधार म्हणून वापरली जाऊ शकत नाही. हे एक प्रथम-ओळीचे स्क्रीनिंग साधन आहे जे कोणाकडे लक्ष देणे आवश्यक आहे हे सूचित करते, स्थापित माध्यमांद्वारे पडताळणीसाठी. संबंधित तुलना ब्रेथलायझरशी नाही, तर आज वापरल्या जाणाऱ्या पर्यायाशी आहे: पर्यवेक्षक निरीक्षण, जे अंदाजे अप्रशिक्षित ऐकण्याच्या पातळीवर कार्य करते.
आम्ही ध्वनिक परिस्थितींमध्ये पूर्ण परिणाम प्रकाशित केले आहेत — ज्यामध्ये अचूकता कमी होते अशा परिस्थितींचा समावेश आहे — तुलनात्मकतेच्या सूचना आणि पद्धतीच्या ज्ञात मर्यादांसह.