SafeVoice — một công cụ trí tuệ giọng nói độc quyền gắn cờ khả năng suy giảm do rượu chỉ từ vài giây nói chuyện thông thường. Không xâm lấn, không cần phần cứng chuyên dụng, không cần gì hơn một cụm từ được nói ra.
Nhân sự bị suy giảm khả năng vẫn là một nguyên nhân hàng đầu và chưa được trang bị đầy đủ của các sự cố công nghiệp có thể phòng ngừa. Rượu làm suy giảm tốc độ phản ứng, phán đoán không gian và kiểm soát vận động tinh từ lâu trước khi các triệu chứng trở nên rõ ràng về mặt thị giác. Các biện pháp kiểm soát truyền thống — máy đo nồng độ cồn định kỳ và kiểm tra trực quan của người giám sát — là không liên tục, xâm lấn, gây tắc nghẽn tại cổng ca và dễ bị né tránh. Kết quả là một điểm mù vận hành: các trạng thái rủi ro cao vẫn là thứ khó nhất để ngăn chặn liên tục.
Giọng nói là tín hiệu lý tưởng để loại bỏ khoảng trống này. Công nhân tự nhiên sử dụng đài Push-to-Talk, truy cập hệ thống liên lạc nội bộ và giao diện giọng nói trong suốt ca làm việc của họ. Rượu liên tục làm thay đổi cơ sinh học âm thanh — làm suy giảm tốc độ phát âm, thời điểm phát âm, ngữ điệu và chất lượng giọng nói phổ — những dấu ấn sinh học mà một mô hình chuyên dụng trích xuất từ vài giây âm thanh.
SafeVoice triển khai trong hai kiến trúc bổ sung cho nhau.
SafeVoice-Ref so sánh giọng nói thời gian thực với đường cơ sở tỉnh táo đã đăng ký của công nhân — lý tưởng cho sàng lọc truy cập đầu ca.
SafeVoice-Solo hoạt động zero-shot không cần đường cơ sở đã đăng ký, đánh giá các đợt phát âm đơn lẻ trong các liên lạc vô tuyến thông thường suốt ca.
Phân chia kiểm tra được giữ lại của German Alcohol Language Corpus, chuẩn công khai tiêu chuẩn, được chấm bằng unweighted average recall (UAR). Các so sánh với nghiên cứu trước sử dụng chỉ số theo cửa sổ — một quyết định duy nhất cho mỗi phát ngôn, không bỏ phiếu — vì nghiên cứu trước không bỏ phiếu.
Thay vì phân loại âm thanh một cách cô lập, SafeVoice-Ref đối chiếu giọng nói với hồ sơ đường cơ sở của cá nhân. Việc loại bỏ phương sai âm thanh giữa các người nói mang lại lợi ích ngay lập tức khoảng 5 điểm trong Unweighted Average Recall (UAR) — cột mốc kiến trúc có tác động lớn nhất của chúng tôi.
Cả Ref và Solo đều tận dụng cùng các biểu diễn âm thanh cấp thấp. SafeVoice-Ref tối đa hóa độ chính xác thông qua việc đăng ký một lần nhanh chóng, trong khi SafeVoice-Solo ưu tiên không ma sát vận hành, sàng lọc bất kỳ người nói nào ngay lập tức mà không cần dữ liệu lịch sử.
Thông lệ tiêu chuẩn đề xuất đóng băng các xương sống đã được huấn luyện trước trên các kho ngữ liệu nhỏ. Các quét thực nghiệm của chúng tôi đã chứng minh điều ngược lại: độ chính xác sàng lọc tăng theo độ sâu tinh chỉnh, tăng khoảng 7 điểm khi thích ứng toàn bộ xương sống đầu cuối so với đóng băng từng phần.
Các dấu ấn sinh học âm thanh tồn tại ở các độ phân giải thời gian khác nhau. Các lớp xương sống thấp hơn giữ lại các động lực học phát âm và đường dẫn âm tinh tế, trong khi các lớp cao hơn mô hình hóa dòng chảy ngữ điệu và nhịp điệu cụm từ. Sự hợp nhất đa cấp theo sau là gộp chú ý động cân nhắc các khung hình có giá trị chẩn đoán cao nhất.
Chúng tôi bỏ qua tiếng ồn trắng tổng hợp để ủng hộ các giáo trình âm thanh công nghiệp mở rộng — máy móc hạng nặng, tiếng ầm ầm của xe cộ, tiếng ồn ào đám đông xung quanh và phản xạ kết cấu. Điều này đã thu hẹp khoảng cách hiệu suất trong các điều kiện hiện trường khắc nghiệt mà không làm suy giảm độ chính xác đường cơ sở sạch.
Để ngăn các đỉnh tăng thoáng qua hoặc hắng giọng kích hoạt cảnh báo sai, quy trình suy luận chấm điểm nhiều cửa sổ phân tích chồng lặp trên mỗi phát ngôn. Áp dụng bỏ phiếu đồng thuận tăng thêm 1–2 điểm UAR và làm cho việc phát hiện đặc biệt bền vững trước các đỉnh âm thanh trong thế giới thực.
UAR đồng thuận (MV@5), dựa trên tham chiếu / không tham chiếu. Được công bố bao gồm cả các điều kiện mà độ chính xác giảm.
SafeVoice không đo nồng độ cồn trong máu và không thể là căn cứ để buộc người lao động ngừng làm việc. Đây là công cụ sàng lọc tuyến đầu cho biết ai cần được chú ý, để xác minh bằng các phương thức đã được thiết lập. So sánh phù hợp không phải là với máy đo nồng độ cồn trong hơi thở mà là với phương án thay thế đang dùng hiện nay: quan sát của giám sát viên, vốn chỉ đạt mức nghe chưa qua đào tạo.
Mọi kết quả đều đến từ một kho ngữ liệu — German Alcohol Language Corpus, được ghi âm từ 162 người nói với dữ liệu tham chiếu nồng độ cồn trong máu và hơi thở của từng người. Đây là chuẩn tham chiếu cho tác vụ này, nhưng chỉ là một kho ngữ liệu duy nhất, và mọi so sánh ở trên đều được thực hiện trên tập kiểm tra giữ lại của nó.
Chúng tôi công bố các điều kiện mà độ chính xác suy giảm cùng với các chỉ số chính, và công bố những gì đã loại bỏ: các đầu phụ cảm xúc và hồi quy nồng độ cồn trong máu (tác động tiêu cực), đóng băng một phần xương sống mạng (kém khoảng bảy điểm), tinh chỉnh ngưỡng quyết định (giải pháp chữa triệu chứng đáng giá 0.2 điểm), và điều kiện hóa nhúng người nói cho mô hình không tham chiếu — mức tăng thực sự 0.6 điểm, bị loại bỏ vì nó đòi hỏi đăng ký từng người dùng và phá hủy lợi thế không ma sát của Solo.
Kiểm tra đủ điều kiện làm việc đầu ca: đăng nhập bằng giọng nói ngắn so với đường cơ sở đã đăng ký
Giám sát thụ động liên tục qua lưu lượng bộ đàm thường nhật, không cần đăng ký
Một cảnh báo đã hiệu chuẩn được chuyển đến giám sát viên phù hợp để có quyết định của con người
Chạy trên CPU với độ trễ dưới một giây cho mỗi cửa sổ phân tích
Suy giảm một cách nhẹ nhàng khi không có bối cảnh nhân khẩu học
Được hiển thị qua nền tảng XENOM cùng với các tín hiệu vận hành khác của công trường