बोले गए चेक-इन से ध्वनिक अशक्तता का पता लगाना

SafeVoice — एक मालिकाना वाक्-बुद्धिमत्ता इंजन जो सामान्य भाषण के कुछ सेकंड से संभावित शराब अशक्तता को चिह्नित करता है। गैर-आक्रामक, शून्य विशेष हार्डवेयर, बोले गए वाक्यांश से अधिक कुछ नहीं चाहिए।

अशक्त कर्मी रोके जा सकने वाली औद्योगिक घटनाओं का एक प्रमुख और कम-साधन वाला चालक बने हुए हैं। शराब लक्षण दिखाई देने से बहुत पहले प्रतिक्रिया गति, स्थानिक निर्णय और सूक्ष्म मोटर नियंत्रण को खराब कर देती है। पारंपरिक नियंत्रण — आवधिक ब्रेथलाइज़र और दृश्य पर्यवेक्षक जाँच — रुक-रुक कर, आक्रामक, शिफ्ट गेट पर बाधाएँ और चकमा देने में आसान होते हैं। परिणाम एक परिचालन अंधा स्थान है: उच्च-जोखिम स्थितियाँ निरंतर अवरोधन के लिए सबसे कठिन रहती हैं।

आवाज़ इस अंतर को समाप्त करने के लिए आदर्श संकेत है। कर्मचारी स्वाभाविक रूप से पुश-टू-टॉक रेडियो, एक्सेस इंटरकॉम और आवाज़ इंटरफ़ेस का उपयोग अपनी शिफ्ट के दौरान करते हैं। शराब लगातार ध्वनिक बायोमैकेनिक्स को बदलती है — उच्चारण वेग, स्वर-ध्वनि समय, छंद और वर्णक्रमीय आवाज़ गुणवत्ता को खराब करती है — बायोमार्कर जो एक विशेष मॉडल ऑडियो के सेकंडों से निकालता है।

SafeVoice दो पूरक वास्तुकलाओं में तैनात होता है।

SafeVoice-Ref वास्तविक समय की आवाज़ की तुलना कर्मचारी की नामांकित शांत आधार रेखा से करता है — शिफ्ट-स्टार्ट एक्सेस स्क्रीनिंग के लिए आदर्श।

SafeVoice-Solo शून्य-शॉट संचालित होता है, बिना नामांकित आधार रेखा के, शिफ्ट के दौरान नियमित रेडियो संचार के दौरान एकल भाषण विस्फोटों का आकलन करता है।

जर्मन अल्कोहल लैंग्वेज कॉर्पस का होल्ड-आउट परीक्षण विभाजन, मानक सार्वजनिक बेंचमार्क, अनवेटेड औसत रिकॉल (UAR) द्वारा स्कोर किया गया। पूर्व कला के साथ तुलना प्रति-विंडो मीट्रिक का उपयोग करती है — प्रति उच्चारण एकल निर्णय, कोई मतदान नहीं — क्योंकि पूर्व कला मतदान नहीं करती है।

हमने क्या बनाया

वक्ता-सापेक्ष विभेदक एन्कोडिंग

ऑडियो को अलग से वर्गीकृत करने के बजाय, SafeVoice-Ref व्यक्ति की आधार रेखा प्रोफ़ाइल के विरुद्ध भाषण को बेंचमार्क करता है। अंतर-वक्ता ध्वनिक विचरण को समाप्त करने से अनवेटेड औसत रिकॉल (UAR) में तत्काल ~5-पॉइंट लाभ मिलता है — हमारा सबसे प्रभावशाली वास्तुशिल्प मील का पत्थर।

दोहरी मॉडल वास्तुकलाएँ, एकीकृत फ़ीचर स्टैक

Ref और Solo दोनों समान निम्न-स्तरीय ध्वनिक अभ्यावेदन का लाभ उठाते हैं। SafeVoice-Ref तीव्र एक-बार नामांकन के माध्यम से परिशुद्धता को अधिकतम करता है, जबकि SafeVoice-Solo शून्य परिचालन घर्षण को प्राथमिकता देता है, बिना ऐतिहासिक डेटा के किसी भी वक्ता की तुरंत जांच करता है।

पूर्ण बैकबोन अनुकूलन

मानक अभ्यास छोटे संग्रहों पर पूर्व-प्रशिक्षित बैकबोन को स्थिर करने का सुझाव देता है। हमारे अनुभवजन्य स्वीप ने विपरीत साबित किया: स्क्रीनिंग सटीकता फाइन-ट्यूनिंग गहराई के साथ बढ़ी, आंशिक परत स्थिरीकरण की तुलना में पूर्ण एंड-टू-एंड बैकबोन अनुकूलन के तहत ~7 पॉइंट उछल गई।

बहु-पैमाना फ़ीचर एकत्रीकरण

ध्वनिक बायोमार्कर विशिष्ट लौकिक विभेदनों में मौजूद होते हैं। निचली बैकबोन परतें सूक्ष्म उच्चारण और स्वर पथ गतिशीलता बनाए रखती हैं, जबकि उच्च परतें छंद प्रवाह और वाक्यांश लय का मॉडल बनाती हैं। बहु-स्तरीय संलयन के बाद चौकस पूलिंग सबसे नैदानिक फ़्रेमों को गतिशील रूप से भारित करता है।

भारी औद्योगिक शोर पाठ्यक्रम

हमने सिंथेटिक सफेद शोर को दरकिनार कर व्यापक औद्योगिक ऑडियो पाठ्यक्रमों का पक्ष लिया — भारी मशीनरी, वाहन गड़गड़ाहट, परिवेशी भीड़ बकबक और संरचनात्मक प्रतिध्वनि। इसने स्वच्छ आधार-रेखा सटीकता को खराब किए बिना कठोर क्षेत्र स्थितियों में प्रदर्शन अंतर को बंद कर दिया।

बहु-विंडो सर्वसम्मति डिकोडिंग

क्षणिक स्पाइक्स या गला साफ करने से झूठे अलार्म को रोकने के लिए, अनुमान पाइपलाइन प्रति उच्चारण कई अतिव्यापी विश्लेषण विंडो स्कोर करती है। सर्वसम्मति मतदान लागू करने से 1–2 पॉइंट UAR जुड़ते हैं और पता लगाना वास्तविक दुनिया के ध्वनिक स्पाइक्स के प्रति असाधारण रूप से लचीला बन जाता है।

मापा परिणाम

ध्वनिक स्थितियों में गिरावट

सर्वसम्मति UAR (MV@5), संदर्भ-आधारित / संदर्भ-मुक्त। उन स्थितियों सहित प्रकाशित जहाँ सटीकता गिरती है।

प्रणाली क्या है — और क्या नहीं है

SafeVoice रक्त अल्कोहल सांद्रता को नहीं मापता है और किसी कर्मचारी को ड्यूटी से हटाने के लिए आधार के रूप में काम नहीं कर सकता है। यह एक प्रथम-पंक्ति स्क्रीनिंग टूल है जो इंगित करता है कि किस पर ध्यान देने की आवश्यकता है, स्थापित माध्यमों से सत्यापन के लिए। प्रासंगिक तुलना ब्रेथलाइज़र से नहीं बल्कि आज उपयोग किए जाने वाले विकल्प से है: पर्यवेक्षक अवलोकन, जो लगभग अप्रशिक्षित सुनने के स्तर पर काम करता है।

सभी परिणाम एक कॉर्पस से आते हैं — जर्मन अल्कोहल लैंग्वेज कॉर्पस, 162 वक्ताओं से प्रति-वक्ता रक्त- और सांस-अल्कोहल ग्राउंड ट्रुथ के साथ रिकॉर्ड किया गया। यह इस कार्य के लिए संदर्भ बेंचमार्क है, लेकिन यह एक एकल कॉर्पस है, और ऊपर की प्रत्येक तुलना इसके होल्ड-आउट टेस्ट स्प्लिट पर की गई है।

हम सुर्खियों के आंकड़ों के साथ उन स्थितियों को प्रकाशित करते हैं जहाँ सटीकता कम हो जाती है, और हम वह प्रकाशित करते हैं जिसे हमने अस्वीकार किया: सहायक भावना और रक्त-अल्कोहल-प्रतिगमन हेड (नकारात्मक प्रभाव), आंशिक बैकबोन फ्रीज़िंग (लगभग सात अंक खराब), निर्णय-सीमा ट्यूनिंग (एक लक्षण समाधान जो 0.2 अंक के लायक है), और संदर्भ-मुक्त मॉडल के लिए स्पीकर-एम्बेडिंग कंडीशनिंग — एक वास्तविक 0.6-अंक लाभ, जिसे खारिज कर दिया गया क्योंकि इसके लिए प्रति-उपयोगकर्ता नामांकन की आवश्यकता होती और यह सोलो के शून्य-घर्षण लाभ को नष्ट कर देता।

इसका उपयोग कैसे किया जाता है

शिफ्ट-प्रारंभ फिटनेस-फॉर-ड्यूटी जांच: नामांकित बेसलाइन के विरुद्ध एक छोटा मौखिक साइन-इन

नियमित रेडियो ट्रैफ़िक पर निरंतर निष्क्रिय निगरानी, बिना किसी नामांकन के

मानवीय निर्णय के लिए उपयुक्त पर्यवेक्षक को भेजा गया एक कैलिब्रेटेड फ़्लैग

प्रति विश्लेषण विंडो एक सेकंड से कम विलंबता के साथ सीपीयू पर चलता है

जनसांख्यिकीय संदर्भ अनुपलब्ध होने पर सुचारू रूप से कम हो जाता है

साइट के अन्य परिचालन संकेतों के साथ XENOM प्लेटफ़ॉर्म के माध्यम से सामने आता है