گفتار بیش از کلمات حامل اطلاعات است. مسمومیت الکلی ردپای قابل اندازهگیری در تلفظ، سرعت و تغییرات طیفی خرد بر جای میگذارد — سیگنالهایی که گوش انسان در بهترین حالت بهطور غیرقابل اعتماد ثبت میکند.
تیم تحقیق و توسعه XENOM یک مدل یادگیری عمیق اختصاصی برای تشخیص این زیستنشانگرهای صوتی آموزش داده و آن را بر روی Alcohol Language Corpus، معیار عمومی استاندارد برای این کار، ارزیابی کرده است.
با امتیازدهی دقیق معادل — میانگین بازیابی بدون وزنی هر پنجره، یک تصمیم واحد برای هر گفتار بدون رأیگیری، دقیقاً همانطور که کارهای قبلی اندازهگیری میشوند — پیکربندی مبتنی بر مرجع به 86.3٪ UAR میرسد. پیکربندی بدون مرجع، که به خط پایه ثبتنامشده نیاز ندارد و از یک نمونه گفتاری واحد تصمیم میگیرد، به 81.9٪ میرسد. در نقطه عملیاتی استقرار، جایی که سیستم چندین پنجره از یک ضبط را به یک تصمیم اجماعی ترکیب میکند، این مقادیر به ترتیب به 87.6٪ و 82.5٪ افزایش مییابد.
برای زمینه: خط پایه رسمی Interspeech 2011 Speaker-State Challenge بر روی این پیکره 65.9٪ UAR است، نتایج پیشرفته منتشرشده قبلی در حدود 73 تا 75٪ به اوج میرسند و شنوندگان انسانی آموزشندیده حدود 60 تا 65٪ امتیاز کسب میکنند.
سیستم به عنوان یک لایه غیرفعال روی ترافیک رادیویی معمول اجرا میشود. کارگران همانطور که همیشه صحبت میکنند صحبت میکنند؛ بدون رویه اضافی، بدون وقفه در کار، بدون ایست بازرسی جداگانه.
سیستم چه هست و چه نیست. این سیستم غلظت الکل خون را اندازهگیری نمیکند و نمیتواند مبنایی برای حذف کارگر از وظیفه باشد. این یک ابزار غربالگری خط اول است که نشان میدهد چه کسی نیاز به توجه دارد، برای تأیید با روشهای مستقر. مقایسه مربوطه با دستگاه تنفسی نیست، بلکه با جایگزینی است که امروز استفاده میشود: مشاهده ناظر، که تقریباً در سطح گوش دادن آموزشندیده عمل میکند.
ما نتایج کامل را در شرایط صوتی مختلف — از جمله مواردی که دقت کاهش مییابد — همراه با هشدارهای قابلیت مقایسه و محدودیتهای شناختهشده روش منتشر کردهایم.