XENOM R&D ने गैर-आक्रामक आवाज़ जांच में अत्याधुनिक स्तर हासिल किया

वाणी शब्दों से अधिक वहन करती है। शराब का नशा उच्चारण, गति और वर्णक्रमीय सूक्ष्म-भिन्नता में मापने योग्य निशान छोड़ता है — ऐसे संकेत जिन्हें मानव कान सर्वोत्तम रूप से भी अविश्वसनीय रूप से पंजीकृत करता है।

XENOM की R&D टीम ने इन ध्वनिक बायोमार्करों का पता लगाने के लिए एक स्वामित्व वाला डीप लर्निंग मॉडल प्रशिक्षित किया है और इस कार्य के लिए मानक सार्वजनिक बेंचमार्क, Alcohol Language Corpus पर इसका मूल्यांकन किया है।

कड़ाई से समान-से-समान स्कोर किया गया — प्रति-विंडो अनवेटेड औसत रिकॉल, प्रति उच्चारण एकल निर्णय जिसमें कोई वोटिंग नहीं, ठीक वैसे ही जैसे पूर्व कार्य को मापा जाता है — संदर्भ-आधारित कॉन्फ़िगरेशन 86.3% UAR तक पहुंचता है। संदर्भ-मुक्त कॉन्फ़िगरेशन, जिसके लिए कोई नामांकित बेसलाइन की आवश्यकता नहीं होती और जो एकल बोले गए नमूने से निर्णय लेता है, 81.9% तक पहुंचता है। तैनाती ऑपरेटिंग पॉइंट पर, जहां सिस्टम एक रिकॉर्डिंग की कई विंडो को एक सहमति निर्णय में जोड़ता है, ये क्रमशः 87.6% और 82.5% तक बढ़ जाते हैं।

संदर्भ के लिए: इस कॉर्पस पर आधिकारिक Interspeech 2011 स्पीकर-स्टेट चैलेंज बेसलाइन 65.9% UAR पर खड़ा है, पूर्व में प्रकाशित अत्याधुनिक परिणाम लगभग 73–75% पर चरम पर हैं, और अप्रशिक्षित मानव श्रोता लगभग 60–65% स्कोर करते हैं।

यह प्रणाली नियमित रेडियो ट्रैफ़िक पर एक निष्क्रिय परत के रूप में चलती है। कर्मचारी वैसे ही बोलते हैं जैसे वे हमेशा बोलते हैं; कोई अतिरिक्त प्रक्रिया नहीं, कार्य में कोई रुकावट नहीं, कोई अलग चेकपॉइंट नहीं।

सिस्टम क्या है — और क्या नहीं है। यह रक्त अल्कोहल सांद्रता को नहीं मापता और किसी कर्मचारी को ड्यूटी से हटाने के आधार के रूप में काम नहीं कर सकता। यह एक प्रथम-पंक्ति जांच उपकरण है जो इंगित करता है कि किसे ध्यान देने की आवश्यकता है, स्थापित साधनों द्वारा सत्यापन के लिए। प्रासंगिक तुलना ब्रेथलाइज़र से नहीं है, बल्कि आज उपयोग किए जाने वाले विकल्प से है: पर्यवेक्षक अवलोकन, जो लगभग अप्रशिक्षित सुनने के स्तर पर प्रदर्शन करता है।

हमने ध्वनिक स्थितियों में पूर्ण परिणाम प्रकाशित किए हैं — जिनमें वे भी शामिल हैं जहां सटीकता घटती है — साथ ही तुलनीयता चेतावनियाँ और विधि की ज्ञात सीमाएँ।