تحقیق و توسعه XENOM به پیشرفته‌ترین سطح در غربالگری صوتی غیرتهاجمی دست یافت

گفتار بیش از کلمات حامل اطلاعات است. مسمومیت الکلی ردپای قابل اندازه‌گیری در تلفظ، سرعت و تغییرات طیفی خرد بر جای می‌گذارد — سیگنال‌هایی که گوش انسان در بهترین حالت به‌طور غیرقابل اعتماد ثبت می‌کند.

تیم تحقیق و توسعه XENOM یک مدل یادگیری عمیق اختصاصی برای تشخیص این زیست‌نشانگرهای صوتی آموزش داده و آن را بر روی Alcohol Language Corpus، معیار عمومی استاندارد برای این کار، ارزیابی کرده است.

با امتیازدهی دقیق معادل — میانگین بازیابی بدون وزنی هر پنجره، یک تصمیم واحد برای هر گفتار بدون رأی‌گیری، دقیقاً همان‌طور که کارهای قبلی اندازه‌گیری می‌شوند — پیکربندی مبتنی بر مرجع به 86.3٪ UAR می‌رسد. پیکربندی بدون مرجع، که به خط پایه ثبت‌نام‌شده نیاز ندارد و از یک نمونه گفتاری واحد تصمیم می‌گیرد، به 81.9٪ می‌رسد. در نقطه عملیاتی استقرار، جایی که سیستم چندین پنجره از یک ضبط را به یک تصمیم اجماعی ترکیب می‌کند، این مقادیر به ترتیب به 87.6٪ و 82.5٪ افزایش می‌یابد.

برای زمینه: خط پایه رسمی Interspeech 2011 Speaker-State Challenge بر روی این پیکره 65.9٪ UAR است، نتایج پیشرفته منتشرشده قبلی در حدود 73 تا 75٪ به اوج می‌رسند و شنوندگان انسانی آموزش‌ندیده حدود 60 تا 65٪ امتیاز کسب می‌کنند.

سیستم به عنوان یک لایه غیرفعال روی ترافیک رادیویی معمول اجرا می‌شود. کارگران همان‌طور که همیشه صحبت می‌کنند صحبت می‌کنند؛ بدون رویه اضافی، بدون وقفه در کار، بدون ایست بازرسی جداگانه.

سیستم چه هست و چه نیست. این سیستم غلظت الکل خون را اندازه‌گیری نمی‌کند و نمی‌تواند مبنایی برای حذف کارگر از وظیفه باشد. این یک ابزار غربالگری خط اول است که نشان می‌دهد چه کسی نیاز به توجه دارد، برای تأیید با روش‌های مستقر. مقایسه مربوطه با دستگاه تنفسی نیست، بلکه با جایگزینی است که امروز استفاده می‌شود: مشاهده ناظر، که تقریباً در سطح گوش دادن آموزش‌ندیده عمل می‌کند.

ما نتایج کامل را در شرایط صوتی مختلف — از جمله مواردی که دقت کاهش می‌یابد — همراه با هشدارهای قابلیت مقایسه و محدودیت‌های شناخته‌شده روش منتشر کرده‌ایم.