การตรวจจับอาการมึนเมาทางเสียงจากการเช็กอินด้วยเสียง

SafeVoice — เครื่องมือปัญญาเสียงพูดที่เป็นกรรมสิทธิ์ซึ่งแจ้งเตือนความเป็นไปได้ของอาการมึนเมาจากแอลกอฮอล์จากคำพูดธรรมดาเพียงไม่กี่วินาที ไม่รุกล้ำ ไม่ต้องใช้ฮาร์ดแวร์พิเศษ ต้องการเพียงวลีที่พูดออกมา

บุคลากรที่มีอาการมึนเมายังคงเป็นสาเหตุหลักและมีการตรวจวัดไม่เพียงพอของเหตุการณ์อุตสาหกรรมที่ป้องกันได้ แอลกอฮอล์ลดความเร็วปฏิกิริยา การตัดสินใจเชิงพื้นที่ และการควบคุมกล้ามเนื้อมัดเล็ก นานก่อนที่อาการจะมองเห็นได้ชัด การควบคุมแบบดั้งเดิม — เครื่องเป่าแอลกอฮอล์เป็นระยะและการตรวจด้วยสายตาของหัวหน้างาน — เป็นแบบไม่ต่อเนื่อง รุกล้ำ เป็นคอขวดที่ประตูกะงาน และหลีกเลี่ยงได้ง่าย ผลลัพธ์คือจุดบอดในการปฏิบัติงาน: สภาวะความเสี่ยงสูงยังคงตรวจจับอย่างต่อเนื่องได้ยากที่สุด

เสียงเป็นสัญญาณที่เหมาะที่สุดในการขจัดช่องว่างนี้ พนักงานใช้วีทยุ Push-to-Talk อินเตอร์คอม และอินเทอร์เฟซเสียงตามธรรมชาติตลอดกะงาน แอลกอฮอล์เปลี่ยนแปลงชีวกลศาสตร์ทางเสียงอย่างสม่ำเสมอ — ทำให้ความเร็วการออกเสียง จังหวะการเปล่งเสียง ทำนองเสียง และคุณภาพเสียงเชิงสเปกตรัมบกพร่อง — ตัวบ่งชี้ทางชีวภาพที่โมเดลเฉพาะทางสกัดจากเสียงเพียงไม่กี่วินาที

SafeVoice ถูกนำไปใช้ในสองสถาปัตยกรรมที่เสริมกัน

SafeVoice-Ref เปรียบเทียบเสียงแบบเรียลไทม์กับเส้นฐานขณะมีสติที่ลงทะเบียนไว้ของพนักงาน — เหมาะสำหรับการคัดกรองการเข้าถึงเมื่อเริ่มกะงาน

SafeVoice-Solo ทำงานแบบ zero-shot โดยไม่ต้องมีเส้นฐานที่ลงทะเบียน ประเมินช่วงเสียงเดี่ยวระหว่างการสื่อสารทางวิทยุตามปกติตลอดกะงาน

ชุดทดสอบแยกต่างหากของ German Alcohol Language Corpus ซึ่งเป็นเกณฑ์มาตรฐานสาธารณะ ให้คะแนนโดย unweighted average recall (UAR) การเปรียบเทียบกับงานก่อนหน้าใช้เมตริกต่อหน้าต่าง — การตัดสินใจครั้งเดียวต่อคำพูดหนึ่งช่วง ไม่มีการลงคะแนน — เพราะงานก่อนหน้าไม่มีการลงคะแนน

สิ่งที่เราสร้าง

การเข้ารหัสเชิงอนุพันธ์สัมพันธ์กับผู้พูด

แทนที่จะจำแนกเสียงแยกส่วน SafeVoice-Ref เปรียบเทียบเสียงพูดกับโปรไฟล์เส้นฐานของแต่ละบุคคล การขจัดความแปรปรวนทางเสียงระหว่างผู้พูดให้ผลเพิ่มขึ้นทันทีประมาณ 5 จุดใน Unweighted Average Recall (UAR) — เหตุการณ์สำคัญทางสถาปัตยกรรมที่ทรงพลังที่สุดของเรา

สถาปัตยกรรมโมเดลคู่ ชุดคุณลักษณะรวมเป็นหนึ่ง

ทั้ง Ref และ Solo ใช้การแทนเสียงระดับต่ำเดียวกัน SafeVoice-Ref เพิ่มความแม่นยำสูงสุดผ่านการลงทะเบียนครั้งเดียวที่รวดเร็ว ในขณะที่ SafeVoice-Solo ให้ความสำคัญกับแรงเสียดทานในการปฏิบัติงานเป็นศูนย์ คัดกรองผู้พูดใดก็ได้ทันทีโดยไม่ต้องมีข้อมูลย้อนหลัง

การปรับแบ็กโบนเต็มรูปแบบ

แนวปฏิบัติมาตรฐานแนะนำให้แช่แข็งแบ็กโบนที่ฝึกไว้ล่วงหน้าบนคลังข้อมูลขนาดเล็ก การกวาดเชิงประจักษ์ของเราพิสูจน์ตรงกันข้าม: ความแม่นยำในการคัดกรองเพิ่มขึ้นตามความลึกของการปรับละเอียด กระโดดขึ้นประมาณ 7 จุดภายใต้การปรับแบ็กโบนเต็มรูปแบบแบบ end-to-end เมื่อเทียบกับการแช่แข็งเลเยอร์บางส่วน

การรวมคุณลักษณะหลายสเกล

ตัวบ่งชี้ทางชีวภาพทางเสียงมีอยู่ในความละเอียดเชิงเวลาที่แตกต่างกัน เลเยอร์แบ็กโบนล่างรักษาพลวัตการออกเสียงและทางเดินเสียงที่ละเอียด ในขณะที่เลเยอร์สูงจำลองการไหลของทำนองเสียงและจังหวะการเว้นวรรค การฟิวชันหลายระดับตามด้วย attentive pooling ถ่วงน้ำหนักเฟรมที่บ่งชี้ได้มากที่สุดแบบไดนามิก

ชุดข้อมูลเสียงรบกวนอุตสาหกรรมหนัก

เราหลีกเลี่ยงเสียงรบกวนสีขาวสังเคราะห์และใช้ชุดข้อมูลเสียงอุตสาหกรรมที่ครอบคลุมแทน — เครื่องจักรหนัก เสียงครวญยานพาหนะ เสียงพูดคุยรอบข้าง และเสียงก้องโครงสร้าง วิธีนี้ปิดช่องว่างประสิทธิภาพในสภาพสนามที่สมบุกสมบันโดยไม่ลดความแม่นยำเส้นฐานที่สะอาด

การถอดรหัสฉันทามติหลายหน้าต่าง

เพื่อป้องกันการกระตุกชั่วคราวหรือการกระแอมไม่ให้ทริกเกอร์สัญญาณเตือนที่ผิดพลาด ไปป์ไลน์การอนุมานให้คะแนนหน้าต่างการวิเคราะห์ที่ทับซ้อนกันหลายหน้าต่างต่อคำพูดหนึ่งช่วง การลงคะแนนฉันทามติเพิ่ม UAR 1–2 จุดและทำให้การตรวจจับทนทานต่อการกระตุกทางเสียงในโลกจริงอย่างยอดเยี่ยม

ผลลัพธ์ที่วัดได้

การลดลงของประสิทธิภาพในสภาวะเสียงต่าง ๆ

UAR ฉันทามติ (MV@5) แบบอิงเส้นฐาน / แบบไม่ต้องมีเส้นฐาน เผยแพร่รวมถึงสภาวะที่ความแม่นยำลดลง

ระบบคืออะไร — และไม่ใช่อะไร

SafeVoice ไม่ได้วัดความเข้มข้นของแอลกอฮอล์ในเลือด และไม่สามารถใช้เป็นเหตุผลในการถอดพนักงานออกจากหน้าที่ได้ เป็นเครื่องมือคัดกรองขั้นแรกที่ระบุว่าใครสมควรได้รับความสนใจ เพื่อการตรวจยืนยันด้วยวิธีการที่เป็นที่ยอมรับ การเปรียบเทียบที่เกี่ยวข้องไม่ใช่กับเครื่องเป่าแอลกอฮอล์ แต่เป็นทางเลือกที่ใช้อยู่ในปัจจุบัน: การสังเกตโดยหัวหน้างาน ซึ่งมีประสิทธิภาพประมาณระดับของการฟังที่ไม่ได้รับการฝึกฝน

ผลลัพธ์ทั้งหมดมาจากคลังข้อมูลเดียว — German Alcohol Language Corpus บันทึกจากผู้พูด 162 คน พร้อมค่าความจริงอ้างอิงของแอลกอฮอล์ในเลือดและลมหายใจรายบุคคล เป็นเกณฑ์มาตรฐานอ้างอิงสำหรับงานนี้ แต่เป็นเพียงคลังข้อมูลเดียว และการเปรียบเทียบทั้งหมดข้างต้นทำบนชุดทดสอบที่แยกไว้

เราเผยแพร่เงื่อนไขที่ความแม่นยำลดลงควบคู่กับตัวเลขหลัก และเราเผยแพร่สิ่งที่เราปฏิเสธ: ส่วนหัวเสริมด้านอารมณ์และการถดถอยแอลกอฮอล์ในเลือด (ผลเชิงลบ), การแช่แข็งแกนหลักบางส่วน (แย่ลงประมาณเจ็ดจุด), การปรับค่าเกณฑ์การตัดสินใจ (การแก้ที่อาการ ได้ 0.2 จุด), และการปรับสภาพด้วย speaker embedding สำหรับโมเดลแบบไม่ต้องการอ้างอิง — ได้กำไรจริง 0.6 จุด แต่ถูกตัดออกเพราะต้องมีการลงทะเบียนผู้ใช้รายบุคคล และทำลายข้อได้เปรียบแบบไร้แรงเสียดทานของ Solo

วิธีการใช้งาน

การตรวจสอบความพร้อมปฏิบัติงานก่อนเริ่มกะ: การลงชื่อด้วยเสียงพูดสั้น ๆ เทียบกับค่าพื้นฐานที่ลงทะเบียนไว้

การเฝ้าติดตามแบบแพสซีฟต่อเนื่องผ่านการจราจรวิทยุตามปกติ โดยไม่ต้องลงทะเบียน

สัญญาณแจ้งเตือนที่ปรับเทียบแล้ว ส่งไปยังหัวหน้างานที่รับผิดชอบเพื่อการตัดสินใจโดยมนุษย์

ทำงานบน CPU โดยใช้เวลาประมวลผลน้อยกว่าหนึ่งวินาทีต่อหน้าต่างการวิเคราะห์

เสื่อมคุณภาพอย่างนุ่มนวลเมื่อไม่มีบริบททางประชากรศาสตร์

แสดงผลผ่านแพลตฟอร์ม XENOM ควบคู่กับสัญญาณการปฏิบัติงานอื่น ๆ ของไซต์