SafeVoice — یک موتور هوش گفتاری اختصاصی که اختلال احتمالی ناشی از الکل را تنها از چند ثانیه گفتار معمولی علامت میزند. غیرتهاجمی، بدون سختافزار تخصصی، بدون نیاز به چیزی بیش از یک عبارت گفتاری.
پرسنل دچار اختلال همچنان یک عامل اصلی و کمابزار حوادث صنعتی قابل پیشگیری هستند. الکل سرعت واکنش، قضاوت فضایی و کنترل حرکتی ظریف را مدتها قبل از آشکار شدن علائم بصری کاهش میدهد. کنترلهای سنتی — الکلسنجهای دورهای و بررسیهای چشمی ناظر — متناوب، تهاجمی، گلوگاه در گیتهای شیفت و آسان برای دور زدن هستند. نتیجه یک نقطه کور عملیاتی است: حالتهای پرخطر سختترین حالات برای رهگیری مداوم باقی میمانند.
صدا سیگنال ایدهآلی برای پر کردن این شکاف است. کارگران به طور طبیعی از رادیوهای Push-to-Talk، اینترکامها و رابطهای صوتی در طول شیفت استفاده میکنند. الکل به طور مداوم بیومکانیک آکوستیک را تغییر میدهد — سرعت تولید صدا، زمانبندی آواسازی، عروض و کیفیت طیفی صدا را مختل میکند — شاخصهای زیستی که یک مدل تخصصی از چند ثانیه صدا استخراج میکند.
SafeVoice در دو معماری مکمل مستقر میشود.
SafeVoice-Ref صدای بلادرنگ را با خط پایه هشیار ثبتشده کارگر مقایسه میکند — ایدهآل برای غربالگری دسترسی در شروع شیفت.
SafeVoice-Solo بدون خط پایه ثبتشده و بدون نمونه اولیه عمل میکند و تکههای گفتار منفرد را در طول ارتباطات رادیویی معمول شیفت ارزیابی میکند.
تقسیم تست نگهداشتهشده از German Alcohol Language Corpus، معیار عمومی استاندارد، امتیازدهیشده با Unweighted Average Recall (UAR). مقایسه با آثار قبلی از معیار هر پنجره استفاده میکند — یک تصمیم واحد برای هر گفته، بدون رأیگیری — زیرا آثار قبلی رأیگیری نمیکنند.
به جای طبقهبندی صدا به صورت جداگانه، SafeVoice-Ref گفتار را با پروفایل خط پایه فرد مقایسه میکند. حذف واریانس آکوستیک بین گویندهها یک بهبود فوری حدود 5 امتیازی در Unweighted Average Recall (UAR) ایجاد میکند — مهمترین نقطه عطف معماری ما.
هر دو Ref و Solo از همان نمایشهای آکوستیک سطح پایین استفاده میکنند. SafeVoice-Ref دقت را از طریق ثبتنام یکباره سریع حداکثر میکند، در حالی که SafeVoice-Solo اصطکاک عملیاتی صفر را اولویت میدهد و هر گویندهای را فوراً بدون داده تاریخی غربالگری میکند.
رویه استاندارد پیشنهاد میکند ستون فقرات از پیش آموزشدیده روی مجموعه دادههای کوچک منجمد شود. جستجوهای تجربی ما خلاف آن را ثابت کرد: دقت غربالگری با عمق تنظیم دقیق افزایش یافت و تحت انطباق کامل انتها به انتهای ستون فقرات در مقایسه با انجماد لایههای جزئی حدود 7 امتیاز جهش کرد.
شاخصهای زیستی آکوستیک در وضوحهای زمانی متمایز وجود دارند. لایههای پایینتر ستون فقرات دینامیک ظریف تولید صدا و مجرای صوتی را حفظ میکنند، در حالی که لایههای بالاتر جریان عروضی و ریتم جملهبندی را مدل میکنند. ادغام چندسطحی به دنبال ادغام توجهی، تشخیصیترین فریمها را به صورت پویا وزندهی میکند.
ما نویز سفید مصنوعی را به نفع برنامههای آموزشی صوتی صنعتی گسترده کنار گذاشتیم — ماشینآلات سنگین، غرش خودرو، همهمه جمعیت محیطی و طنین سازهای. این شکاف عملکرد را در شرایط سخت میدانی بدون کاهش دقت خط پایه تمیز بست.
برای جلوگیری از ایجاد هشدارهای کاذب توسط جهشهای گذرا یا صاف کردن گلو، خط لوله استنتاج چندین پنجره تحلیل همپوشان را برای هر گفته امتیازدهی میکند. اعمال رأیگیری اجماع 1 تا 2 امتیاز UAR اضافه میکند و تشخیص را به طور استثنایی در برابر جهشهای آکوستیک دنیای واقعی مقاوم میکند.
UAR اجماع (MV@5)، مبتنی بر مرجع / بدون مرجع. منتشرشده شامل شرایطی که دقت کاهش مییابد.
SafeVoice غلظت الکل خون را اندازهگیری نمیکند و نمیتواند مبنایی برای کنار گذاشتن کارگر از وظیفه باشد. این یک ابزار غربالگری خط اول است که نشان میدهد چه کسی نیاز به توجه دارد، برای تأیید با روشهای تثبیتشده. مقایسه مربوطه با دستگاه تنفسی نیست بلکه با جایگزین مورد استفاده امروز است: مشاهده ناظر، که تقریباً در سطح گوش دادن آموزشندیده عمل میکند.
همه نتایج از یک پیکره زبانی میآیند — پیکره زبانی الکل آلمانی، ضبطشده از 162 گوینده با حقیقت زمینی الکل خون و تنفس برای هر گوینده. این معیار مرجع برای این وظیفه است، اما یک پیکره واحد است، و هر مقایسه بالا بر روی بخش آزمون کنار گذاشتهشده آن انجام شده است.
ما شرایطی را که دقت در آن کاهش مییابد همراه با ارقام اصلی منتشر میکنیم، و آنچه را رد کردیم منتشر میکنیم: سرهای کمکی احساسات و رگرسیون الکل خون (اثر منفی)، انجماد جزئی ستون فقرات (حدود هفت امتیاز بدتر)، تنظیم آستانه تصمیم (یک رفع علامت به ارزش 0.2 امتیاز)، و شرطیسازی embedding گوینده برای مدل بدون مرجع — یک سود واقعی 0.6 امتیازی، کنار گذاشته شد زیرا نیاز به ثبتنام هر کاربر داشت و مزیت بدون اصطکاک Solo را از بین میبرد.
بررسی آمادگی برای انجام وظیفه در شروع شیفت: یک ورود گفتاری کوتاه در برابر یک خط مبنا ثبتشده
پایش غیرفعال پیوسته بر روی ترافیک رادیویی معمول، بدون ثبتنام
یک پرچم کالیبرهشده که به ناظر مناسب برای تصمیم انسانی ارجاع داده میشود
بر روی CPU با کمتر از یک ثانیه تأخیر در هر پنجره تحلیل اجرا میشود
هنگامی که بافت جمعیتشناختی در دسترس نیست بهصورت تدریجی کاهش مییابد
از طریق پلتفرم XENOM همراه با سایر سیگنالهای عملیاتی سایت نمایش داده میشود