تشخیص آکوستیک اختلال از یک ورود گفتاری

SafeVoice — یک موتور هوش گفتاری اختصاصی که اختلال احتمالی ناشی از الکل را تنها از چند ثانیه گفتار معمولی علامت می‌زند. غیرتهاجمی، بدون سخت‌افزار تخصصی، بدون نیاز به چیزی بیش از یک عبارت گفتاری.

پرسنل دچار اختلال همچنان یک عامل اصلی و کم‌ابزار حوادث صنعتی قابل پیشگیری هستند. الکل سرعت واکنش، قضاوت فضایی و کنترل حرکتی ظریف را مدت‌ها قبل از آشکار شدن علائم بصری کاهش می‌دهد. کنترل‌های سنتی — الکل‌سنج‌های دوره‌ای و بررسی‌های چشمی ناظر — متناوب، تهاجمی، گلوگاه در گیت‌های شیفت و آسان برای دور زدن هستند. نتیجه یک نقطه کور عملیاتی است: حالت‌های پرخطر سخت‌ترین حالات برای رهگیری مداوم باقی می‌مانند.

صدا سیگنال ایده‌آلی برای پر کردن این شکاف است. کارگران به طور طبیعی از رادیوهای Push-to-Talk، اینترکام‌ها و رابط‌های صوتی در طول شیفت استفاده می‌کنند. الکل به طور مداوم بیومکانیک آکوستیک را تغییر می‌دهد — سرعت تولید صدا، زمان‌بندی آواسازی، عروض و کیفیت طیفی صدا را مختل می‌کند — شاخص‌های زیستی که یک مدل تخصصی از چند ثانیه صدا استخراج می‌کند.

SafeVoice در دو معماری مکمل مستقر می‌شود.

SafeVoice-Ref صدای بلادرنگ را با خط پایه هشیار ثبت‌شده کارگر مقایسه می‌کند — ایده‌آل برای غربالگری دسترسی در شروع شیفت.

SafeVoice-Solo بدون خط پایه ثبت‌شده و بدون نمونه اولیه عمل می‌کند و تکه‌های گفتار منفرد را در طول ارتباطات رادیویی معمول شیفت ارزیابی می‌کند.

تقسیم تست نگه‌داشته‌شده از German Alcohol Language Corpus، معیار عمومی استاندارد، امتیازدهی‌شده با Unweighted Average Recall (UAR). مقایسه با آثار قبلی از معیار هر پنجره استفاده می‌کند — یک تصمیم واحد برای هر گفته، بدون رأی‌گیری — زیرا آثار قبلی رأی‌گیری نمی‌کنند.

آنچه ما ساختیم

رمزگذاری تفاضلی نسبی به گوینده

به جای طبقه‌بندی صدا به صورت جداگانه، SafeVoice-Ref گفتار را با پروفایل خط پایه فرد مقایسه می‌کند. حذف واریانس آکوستیک بین گوینده‌ها یک بهبود فوری حدود 5 امتیازی در Unweighted Average Recall (UAR) ایجاد می‌کند — مهم‌ترین نقطه عطف معماری ما.

دو معماری مدل، پشته ویژگی یکپارچه

هر دو Ref و Solo از همان نمایش‌های آکوستیک سطح پایین استفاده می‌کنند. SafeVoice-Ref دقت را از طریق ثبت‌نام یک‌باره سریع حداکثر می‌کند، در حالی که SafeVoice-Solo اصطکاک عملیاتی صفر را اولویت می‌دهد و هر گوینده‌ای را فوراً بدون داده تاریخی غربالگری می‌کند.

انطباق کامل ستون فقرات

رویه استاندارد پیشنهاد می‌کند ستون فقرات از پیش آموزش‌دیده روی مجموعه داده‌های کوچک منجمد شود. جستجوهای تجربی ما خلاف آن را ثابت کرد: دقت غربالگری با عمق تنظیم دقیق افزایش یافت و تحت انطباق کامل انتها به انتهای ستون فقرات در مقایسه با انجماد لایه‌های جزئی حدود 7 امتیاز جهش کرد.

تجمع ویژگی چندمقیاسی

شاخص‌های زیستی آکوستیک در وضوح‌های زمانی متمایز وجود دارند. لایه‌های پایین‌تر ستون فقرات دینامیک ظریف تولید صدا و مجرای صوتی را حفظ می‌کنند، در حالی که لایه‌های بالاتر جریان عروضی و ریتم جمله‌بندی را مدل می‌کنند. ادغام چندسطحی به دنبال ادغام توجهی، تشخیصی‌ترین فریم‌ها را به صورت پویا وزن‌دهی می‌کند.

برنامه‌های آموزشی نویز سنگین صنعتی

ما نویز سفید مصنوعی را به نفع برنامه‌های آموزشی صوتی صنعتی گسترده کنار گذاشتیم — ماشین‌آلات سنگین، غرش خودرو، همهمه جمعیت محیطی و طنین سازه‌ای. این شکاف عملکرد را در شرایط سخت میدانی بدون کاهش دقت خط پایه تمیز بست.

رمزگشایی اجماع چندپنجره‌ای

برای جلوگیری از ایجاد هشدارهای کاذب توسط جهش‌های گذرا یا صاف کردن گلو، خط لوله استنتاج چندین پنجره تحلیل همپوشان را برای هر گفته امتیازدهی می‌کند. اعمال رأی‌گیری اجماع 1 تا 2 امتیاز UAR اضافه می‌کند و تشخیص را به طور استثنایی در برابر جهش‌های آکوستیک دنیای واقعی مقاوم می‌کند.

نتایج اندازه‌گیری‌شده

کاهش دقت در شرایط آکوستیک

UAR اجماع (MV@5)، مبتنی بر مرجع / بدون مرجع. منتشرشده شامل شرایطی که دقت کاهش می‌یابد.

سیستم چیست — و چیست نیست

SafeVoice غلظت الکل خون را اندازه‌گیری نمی‌کند و نمی‌تواند مبنایی برای کنار گذاشتن کارگر از وظیفه باشد. این یک ابزار غربالگری خط اول است که نشان می‌دهد چه کسی نیاز به توجه دارد، برای تأیید با روش‌های تثبیت‌شده. مقایسه مربوطه با دستگاه تنفسی نیست بلکه با جایگزین مورد استفاده امروز است: مشاهده ناظر، که تقریباً در سطح گوش دادن آموزش‌ندیده عمل می‌کند.

همه نتایج از یک پیکره زبانی می‌آیند — پیکره زبانی الکل آلمانی، ضبط‌شده از 162 گوینده با حقیقت زمینی الکل خون و تنفس برای هر گوینده. این معیار مرجع برای این وظیفه است، اما یک پیکره واحد است، و هر مقایسه بالا بر روی بخش آزمون کنار گذاشته‌شده آن انجام شده است.

ما شرایطی را که دقت در آن کاهش می‌یابد همراه با ارقام اصلی منتشر می‌کنیم، و آنچه را رد کردیم منتشر می‌کنیم: سرهای کمکی احساسات و رگرسیون الکل خون (اثر منفی)، انجماد جزئی ستون فقرات (حدود هفت امتیاز بدتر)، تنظیم آستانه تصمیم (یک رفع علامت به ارزش 0.2 امتیاز)، و شرطی‌سازی embedding گوینده برای مدل بدون مرجع — یک سود واقعی 0.6 امتیازی، کنار گذاشته شد زیرا نیاز به ثبت‌نام هر کاربر داشت و مزیت بدون اصطکاک Solo را از بین می‌برد.

چگونه استفاده می‌شود

بررسی آمادگی برای انجام وظیفه در شروع شیفت: یک ورود گفتاری کوتاه در برابر یک خط مبنا ثبت‌شده

پایش غیرفعال پیوسته بر روی ترافیک رادیویی معمول، بدون ثبت‌نام

یک پرچم کالیبره‌شده که به ناظر مناسب برای تصمیم انسانی ارجاع داده می‌شود

بر روی CPU با کمتر از یک ثانیه تأخیر در هر پنجره تحلیل اجرا می‌شود

هنگامی که بافت جمعیت‌شناختی در دسترس نیست به‌صورت تدریجی کاهش می‌یابد

از طریق پلتفرم XENOM همراه با سایر سیگنال‌های عملیاتی سایت نمایش داده می‌شود